今日论文合集:CS.SD语音与音频 | 共 25 篇。

本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily

[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准


快速导航

1. 语音识别与关键词检测 1 篇

2. 语音合成与声音生成 5 篇

3. 说话人识别、验证与分离 2 篇

4. 音频事件检测与场景理解 3 篇

5. 语音翻译与语音语言模型 4 篇

6. 多模态音频与视听学习 2 篇

7. 数据集、基准与评测 2 篇

8. 安全、隐私与深度伪造音频 1 篇

9. 其他/综合语音音频 5 篇


1. 语音识别与关键词检测 | 1 篇

1. Pruning for Efficiency, Paying in Fairness: Demographic Disparities in Pruned Speech-LLMs

为效率剪枝,以公平为代价:剪枝后的语音-大语言模型中的群体差异

AI 总结:本研究系统评估剪枝对语音-LLM在不同人口群体上的影响,发现剪枝加剧群体间WER差距,并建议部署时以最差群体错误率为明确标准。

链接:https://arxiv.org/abs/2609.38106

机构:University of Essex(埃塞克斯大学)

作者:Ganesh Pavan Kartikeya Bharadwaj Kolluri, Michael Kampouridis, Ravi Shekhar


2. 语音合成与声音生成 | 5 篇

2. Distill Locally, Schedule Globally: Flow Maps for Few-Step Text-to-Speech

局部蒸馏,全局调度:用于少步文本到语音的流映射

AI 总结:本文提出局部流映射蒸馏(LFMD)及TD-DP采样调度,避免教师轨迹积分,在少步TTS中实现低NFE合成,于Seed-TTS上1-NFE达1.80% WER,接近32-NFE教师水平。

链接:https://arxiv.org/abs/2609.36324

机构:Institute of Foundation Models (IFM), MBZUAI(基础模型研究所(IFM),穆罕默德·本·扎耶德人工智能大学)

作者:Yentl Collin, Evan Dufraisse, Amr Mohamed, Amine Khelif Khelif, Dani Bouch, Guokan Shang


3. Interpreting and Evaluating Dynamic-Rate Speech Codec Boundaries

解释与评估动态码率语音编解码器边界

AI 总结:本研究通过对比预测边界与语言及声学参考,发现动态帧率编解码器边界含义取决于底层表示,且音节级边界对语义丰富的语音重建更有效。

链接:https://arxiv.org/abs/2609.36951

机构:The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Amphion Technology Co., Ltd.(Amphion科技有限公司); Zhejiang University(浙江大学)

作者:Han Wang, Jiaqi Li, Yingda Shen, Yuxiang Wang, Zhizheng Wu


4. RVQ Position Aware Speculative Decoding for On Device Text to Speech

RVQ位置感知投机解码用于设备端文本到语音

AI 总结:针对设备端TTS中MultiCodeDecoder的RVQ解码瓶颈,提出位置感知投机解码,以极小参数开销实现分布无损加速,将Qwen3-TTS实时合成调用次数从200降至88,RVQ生成提速2至2.2倍。

链接:https://arxiv.org/abs/2609.37007

机构:Argmax, Inc.(Argmax公司)

作者:Berkin Durmus, Eduardo Pacheco, Zach Nagengast, Atila Orhon


5. RAWD-TTS: Ratio-Free Reward Alignment for Discrete-Diffusion Voice Cloning

RAWD-TTS:离散扩散语音克隆的无比例奖励对齐

AI 总结:针对离散扩散语音克隆中监督训练与波形级属性不匹配的问题,提出RAWD-TTS方法,利用识别和说话人奖励及组相对优势加权掩码重建,无需目标音频,在500个俄语提示上显著降低词错误率并提升说话人相似度。

链接:https://arxiv.org/abs/2609.37028

机构:lab260; BitmanagerAI; MTUCI

作者:Maxim Maslov, Kirill Borodin, Vasilii Kudryavtsev, Nikita Vasiliev, Grach Mkrtchian


6. EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation

EmoRES-TTS:残差增强向量引导的情感语音生成

AI 总结:针对情感TTS可控性差且训练代价高的问题,提出免训练的EmoRES方法,将情感向量分解为共享与残差分量分别控制,在IEMOCAP上显著提升情感表达准确率与自然度。

链接:https://arxiv.org/abs/2609.38157

机构:Reality Labs at Meta(Meta现实实验室); National Taiwan University(国立台湾大学); FAIR at Meta(Meta基础人工智能研究团队)

作者:Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu, Zhaoheng Ni, Hung-yi Lee, Jinwon Lee, Neha Chachra


3. 说话人识别、验证与分离 | 2 篇

7. InterBias-SV: Compound Conditions in Speaker Verification

InterBias-SV:说话人验证中的复合条件

AI 总结:InterBias-SV 通过四项比较和 1200 万次试验评估,系统研究说话人验证中噪声、信道和语音变化复合条件的加性效应,发现平均对比接近加性但需进一步验证,并提出了可解释比较的基准要求。

链接:https://arxiv.org/abs/2609.36500

机构:Deakin University(迪肯大学)

作者:Kamel Kamel, Hridoy Sankar Dutta, Keshav Sood, Sunil Aryal


8. ReDimNet2+: Multi-Corpus Data Scaling for Robust Speaker Verification

ReDimNet2+:多语料库数据扩展用于稳健说话人验证

AI 总结:本文提出ReDimNet2+,通过多语料库数据扩展、编解码器与波形增强、大间隔微调和图检索重排序,显著提升说话人验证的跨设备稳健性,大幅降低EER并改善检索性能。

链接:https://arxiv.org/abs/2609.37014

机构:lab260; BitmanagerAI; MTUCI

作者:Kirill Borodin, Vasilii Kudryavtsev, Maxim Maslov, Grach Mkrtchian


4. 音频事件检测与场景理解 | 3 篇

9. Bad: Taming the Bioacoustic Data Deluge with a Bat Acticity Detector

Bad:用蝙蝠活动检测器驯服生物声学数据洪流

AI 总结:针对蝙蝠被动声学监测的数据洪流问题,提出硬件感知的BAD检测器,在微控制器上实现100%硬件卸载,以高精度区分蝙蝠叫声与干扰,显著提升精度。

链接:https://arxiv.org/abs/2609.37518

机构:Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会); University of Trento(特伦托大学); University College London(伦敦大学学院)

作者:Stefano Ciapponi, Santiago Martinez Balvanera, Andrea Cesaretti, Elisabetta Farella, Kate E. Jones


10. Rate-Agnostic Bioacoustics: Heterogeneous Multi-Taxa Classification with Continuous Filterbanks and Fourier Neural Operators

率无关生物声学:基于连续滤波器组和傅里叶神经算子的异质多分类

AI 总结:提出采样频率无关前端与傅里叶神经算子骨干,直接处理原生采样率录音,避免重采样和信息丢失,在84类60采样率语料上优于固定采样率基线,准确率0.906。

链接:https://arxiv.org/abs/2609.37540

机构:University of Trento(特伦托大学); Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

作者:Stefano Ciapponi, Francesco Ardan Dal Rı, Nicola Conci, Elisabetta Farella


11. 2-Dimensional spectral gating for denoising bioacoustics recordings

二维谱门控用于生物声学录音去噪

AI 总结:针对生物声学录音中噪声干扰问题,提出基于多频率结构的二维谱门控改进Noisereduce,在鸟类和海洋哺乳动物录音中实现更优降噪且不牺牲速度。

链接:https://arxiv.org/abs/2609.37910

机构:Mila - Quebec AI Institute(米拉-魁北克人工智能研究所); Pioneer Centre for AI, University of Copenhagen(哥本哈根大学人工智能先锋中心); McGill University(麦吉尔大学); Stockholm University(斯德哥尔摩大学)

作者:Julien Boussard, Mélisande Teng, Sulagna Saha, Mario Gallego-Abenza


5. 语音翻译与语音语言模型 | 4 篇

12. HEAR: Real Voices, Real Bias: A Large-Scale Human-Recorded, Demographically Diverse Benchmark for Audio Language Models

HEAR:真实声音,真实偏见:面向音频语言模型的大规模真人录音、人口多样性基准

AI 总结:我们提出HEAR基准,包含87k个来自843名参与者的真实语音样本,用于评估音频大语言模型中的语音条件偏见,发现偏见是模型特定且可控的,个性化指令会加剧人口差异。

链接:https://arxiv.org/abs/2609.35952

机构:Meta Superintelligence Labs(Meta超级智能实验室)

作者:Shen Yan, Duc Le, Irina-Elena Veliche


13. Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models

音频语言模型中基于长期记忆引导的目标感知增强

AI 总结:提出LTM-AE,利用人类长期记忆原理,无需训练即可增强音频大语言模型在噪声环境中的目标感知,显著提升分类准确率并降低语音识别错误率。

链接:https://arxiv.org/abs/2609.36577

机构:Nanyang Technological University(南洋理工大学); Beijing University of Posts and Telecommunications(北京邮电大学)

作者:Zhenhong Zhou, Xuanyue Zhao, Youji Liu, Yuanhe Zhang, Xiaoyu Ma, Lianyu Hu, Yang Liu


14. When Capabilities Fail to Compose: Diagnosing the Compositionality Gap in Large Audio-Language Models

当能力无法组合:诊断大型音频-语言模型中的组合性差距

AI 总结:本研究通过受控诊断实验,发现大型音频-语言模型在组合音频属性识别与下游任务时存在系统性能力组合差距,表现为准确率显著下降。

链接:https://arxiv.org/abs/2609.36921

机构:National Taiwan University(国立台湾大学); NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(台湾大学人工智能卓越研究中心); ASUS Open Cloud Infrastructure Software Center(华硕开放云端基础设施软件中心)

作者:Chien-Feng Liu, Chih-Kai Yang, Bo-Han Feng, Yu-Hsuan Li Liang, Hung-yi Lee, Cheng-Fu Chou


15. AS$^2$D: Accelerating On-Demand Audio Understanding on Mobile Devices

AS$^2$D:加速移动设备上的按需音频理解

AI 总结:针对移动设备音频理解,提出AS$^2$D解码方法,使草稿生成与目标验证解耦并行,在四款手机上提升ASR吞吐量42-76%,显著优于投机基线。

链接:https://arxiv.org/abs/2609.37617

机构:The University of Texas at Austin(德克萨斯大学奥斯汀分校); Shanghai Jiao Tong University(上海交通大学)

作者:Yunzhe Li, Kyoungjun Park, Hongzi Zhu, Lili Qiu


6. 多模态音频与视听学习 | 2 篇

16. Enabling Immersive Audio-Visual Experience from Any Video

将任意视频转化为沉浸式视听体验

AI 总结:OmniDream是一个无需训练的框架,通过对象为中心的音频表示将无声单目视频转化为沉浸式视听体验,实现空间对齐的音频与视觉场景,提升音视频对齐和沉浸感。

链接:https://arxiv.org/abs/2609.36295

机构:University of Pennsylvania(宾夕法尼亚大学)

作者:Zitong Lan, Mutian Tong, Jiatao Gu, Mingmin Zhao


17. Prediction-Layer Branch Calibration for Multimodal Sentiment Analysis

预测层分支校准用于多模态情感分析

AI 总结:本文提出BC-MLF,通过分支校准任务头和融合令牌对比学习显式建模预测层分支分配,在不改融合主干下提升多模态情感分析性能,在CMU-MOSEI和CH-SIMS上取得最优结果。

链接:https://arxiv.org/abs/2609.37100

机构:National University of Defense Technology(国防科技大学)

作者:Yulin Sun, Kele Xu, Yong Dou


7. 数据集、基准与评测 | 2 篇

18. Estimation of Room Impulse Responses from Handclaps

从拍手声中估计房间冲激响应

AI 总结:本文提出利用消声拍手数据集训练深度神经网络,直接从自然拍手声中估计房间冲激响应,无需已知激励,并在合成和真实声学空间中验证了其有效性和一致性。

链接:https://arxiv.org/abs/2609.35839

机构:National Taiwan University(国立台湾大学); Acoustics Lab, DICE, Aalto University(阿尔托大学DICE声学实验室); MoonShine Animation Studio(月光动画工作室)

作者:Shih-Yu Lai, Kyung Yun Lee, Nils Meyer-Kahlen, Eloi Moliner, Bing-Yu Chen, Vesa Välimäki


19. Trigger Sound Suppression for Misophonia

恐音症触发声音抑制

AI 总结:本研究提出神经触发声音抑制方法,利用流式双路径网络选择性移除恐音症患者的触发声音,并通过临床聆听研究验证其能显著降低痛苦和唤醒度、改善效价。

链接:https://arxiv.org/abs/2609.36351

机构:University of Washington(华盛顿大学); Duke Center for Misophonia and Emotion Regulation(杜克大学恐音症与情绪调节中心)

作者:Vaishnavi Vidyasagar, Jasmine Zhang, Mahima Uliyar, Seunghyun Oh, Emily Catherine Gates, Mark Zachary Rosenthal, Shyamnath Gollakota


8. 安全、隐私与深度伪造音频 | 1 篇

20. Learning as Deepfakes Evolve: RF-Prompt for Continual Audio Deepfake Detection

学习随深度伪造演变:RF-Prompt用于持续音频深度伪造检测

AI 总结:针对持续音频深度伪造检测,提出RAMI协议和RF-Prompt方法,通过共享真实提示与继承伪造专家结合软融合,在受控实验中取得最优EER。

链接:https://arxiv.org/abs/2609.37586

机构:The Hong Kong Polytechnic University(香港理工大学); Communication University of China(中国传媒大学); Beijing Institute of Technology(北京理工大学)

作者:Yuankun Xie, Xiaoxuan Guo, Xiaopeng Wang, Siqing Qin, Shaole Li, Kong Aik Lee


9. 其他/综合语音音频 | 5 篇

21. UDSS-BWE: Uncertainty- and Decision-Science Inspired Swin BandWidth Extension

UDSS-BWE:不确定性驱动的Swin频带扩展

AI 总结:针对频带扩展中罕见高频瞬态失真问题,提出UDSS-BWE框架,融合五个决策科学判别器与Swin生成器,以更少参数实现更优感知质量。

链接:https://arxiv.org/abs/2609.36379

机构:George Mason University(乔治梅森大学)

作者:Tarikul Islam Tamiti, Sajid Fardin Dipto, David Vergano, Luke Baja-Ricketts, Anomadarshi Barua


22. Emergent Tonal Structure in Learned Chord Embeddings and Its Relation to Tonal Tension

学习到的和弦嵌入中涌现的调性结构及其与调性张力的关系

AI 总结:本研究探讨skip-gram和弦嵌入如何反映调性结构,发现基于移调的增强嵌入能恢复五度圈结构,并有效捕捉调性张力的结构方面。

链接:https://arxiv.org/abs/2609.36460

作者:Maral Ebrahimzadeh, Gilberto Bernardes, Sebastian Stober


23. Reconstructing the Vocal Tract with Differentiable Acoustic Simulation

利用可微声学模拟重建声道

AI 总结:本文提出一种可微且GPU加速的声道声学模拟器,通过梯度下降从语音逆推声道形状,并集成湍流模型与神经网络参数化,实现跨语言自监督自编码及无配对数据的语音驱动MRI重建。

链接:https://arxiv.org/abs/2609.36737

机构:MIT CSAIL(麻省理工学院计算机科学与人工智能实验室); MIT RLE(麻省理工学院电子学研究实验室); KAIST GSCT(韩国科学技术院文化技术研究生院)

作者:Eric Ming Chen, Jin Woo Lee, Vincent Sitzmann


24. Multichannel Audio Quality Assessment: Extending Pretrained Perceptual Models to Spatial Audio

多声道音频质量评估:将预训练感知模型扩展到空间音频

AI 总结:针对多声道空间音频质量评估,提出特征级FGAtt方法,在5.1声道测试集上表现最佳,有效复用预训练感知模型。

链接:https://arxiv.org/abs/2609.37116

机构:Dolby Laboratories(杜比实验室)

作者:Gouthaman KV, Shiv Gehlot, Vishnu Raj, Lars Villemoes, Arijit Biswas


25. Do Music Generative Models Understand Musical Qualities? Automatic Music Evaluation with Model-Intrinsic Signals

音乐生成模型是否理解音乐品质?利用模型内在信号进行自动音乐评估

AI 总结:本文证明音乐生成模型的内在信号(预测损失、熵及SAE概念)与人类评分高度相关,据此训练轻量模型实现自动音乐评估,并在五个基准上验证其有效性。

链接:https://arxiv.org/abs/2609.37710

作者:Xiaosha Li, Chun Liu, Ziyu Wang