今日论文合集:CS.SD语音与音频 | 共 21 篇。

本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily

[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准


快速导航

1. 语音识别与关键词检测 1 篇

2. 语音合成与声音生成 3 篇

3. 语音增强、降噪与音频修复 1 篇

4. 音频事件检测与场景理解 1 篇

5. 音乐信息检索与音乐生成 1 篇

6. 语音翻译与语音语言模型 2 篇

7. 多模态音频与视听学习 1 篇

8. 安全、隐私与深度伪造音频 2 篇

9. 其他/综合语音音频 9 篇


1. 语音识别与关键词检测 | 1 篇


1. X2Streaming-ASR: wait when uncertain, emit when ready for streaming ASR

X2Streaming-ASR:不确定时等待,就绪时输出——面向流式语音识别

AI 总结:X2Streaming-ASR通过三阶段训练将流式识别分解为提交时机与内容,在AISHELL和WenetSpeech上以27-84毫秒延迟实现最佳流式CER。

链接:https://arxiv.org/abs/2609.08672

机构:X Square Robot(X Square机器人公司)

作者:Zhiwei Lin, Kaiqi Fu, Rime Wen, Zehan Liu, Shawn Qin, Roy Gan, Hao Wang, Qian Wang


2. 语音合成与声音生成 | 3 篇


2. KABURI-TTS: Phoneme-Keyed Activity-conditioned Bi-channel Utterance Rendering for Interaction

KABURI-TTS:面向交互的基于音素键控的活动条件双声道话语渲染

AI 总结:针对全双工对话中重叠等同时现象,提出KABURI-TTS,以每说话人音素栅格为输入,在语音活动条件下双声道渲染语音,实现可控双人对话生成,提升自然度并产生更多重叠与轮换。

链接:https://arxiv.org/abs/2609.07200

机构:Nagoya University(名古屋大学); National Institute of Informatics(信息学研究所); Keio University(庆应义塾大学); Waseda University(早稻田大学)

作者:Ryuichiro Higashinaka, Shinnosuke Takamichi, Tetsuji Ogawa


3. Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

稳定指令监督用于Instruct-TTS:通过可控多样化与漂移过滤

AI 总结:针对Instruct-TTS中指令监督的语义漂移问题,提出可控多样化、漂移过滤与属性对齐三机制数据方案,将指令跟随率提升至56.4%,漂移率降至15.4%。

链接:https://arxiv.org/abs/2609.08204

机构:Beijing University of Posts and Telecommunications(北京邮电大学); Li Auto(理想汽车)

作者:Yizhong Geng, Kecan Mao, Qifei Li, Cong Wang, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li


4. TontaubeV1: Streaming Text-to-Speech with Hierarchical Codec Modeling and Bounded Context

TontaubeV1:具有分层编解码器建模和有界上下文的流式文本到语音合成

AI 总结:TontaubeV1提出分层编解码器与有界上下文流式TTS,在单GPU上实现自然韵律与低延迟,匹配ElevenLabs并超越多个竞品。

链接:https://arxiv.org/abs/2609.08703

机构:Craitech

作者:Fritz Cremer, Jonathan Cremer


3. 语音增强、降噪与音频修复 | 1 篇


5. Iterative Audio Separation with Mixture Consistency via MIMO Model Extension

通过MIMO模型扩展实现具有混合一致性的迭代音频分离

AI 总结:本文提出一种通用框架,通过将源分离模型扩展为多输入多输出(MIMO)配置,实现稳定有效的迭代音频分离,同时保持混合一致性,并在最先进模型上取得显著性能提升。

链接:https://arxiv.org/abs/2609.07226

作者:Yukara Ikemiya, WeiHsiang Liao, Yuki Mitsufuji


4. 音频事件检测与场景理解 | 1 篇


6. Where Does the Sound Go? Tracing Acoustic Information Loss in Audio-Conditioned LLMs

声音去向何方?追踪音频条件大语言模型中的声学信息损失

AI 总结:本文通过对比不同前端编码器并追踪信息流,发现音频条件大语言模型对声学信息利用不足主要源于读出对齐瓶颈,而非编码器信息丢失。

链接:https://arxiv.org/abs/2609.05871

机构:Seoul National University(首尔大学); KAIST(韩国科学技术院); NAVER Cloud(NAVER云)

作者:Song-ha Jo, Sehyun Lee, Soyoon Kim, Jaesik Choi, Sanghyuk Choi


5. 音乐信息检索与音乐生成 | 1 篇


7. Lead Vocal Separation from Vocal Ensemble Mixtures Using Phoneme Alignment

基于音素对齐的声乐合奏混合中主唱分离

AI 总结:针对声乐合奏中主唱分离难的问题,提出基于BS-RoFormer和音素对齐条件化的模型,利用FiLM注入帧级音素标签,显著提升分离性能。

链接:https://arxiv.org/abs/2609.06488

机构:The University of Tokyo(东京大学); National Institute of Advanced Industrial Science and Technology (AIST)(独立行政法人产业技术综合研究所(AIST))

作者:Yuma Narahata, Tomohiko Nakamura, Yuki Saito, Hiroshi Saruwatari


6. 语音翻译与语音语言模型 | 2 篇


8. What Did I Just Say? Self-Listening for Full-Duplex Speech Models

我刚才说了什么?全双工语音模型的自听机制

AI 总结:针对全双工语音模型因异步生成导致说出内容与播放内容不一致的锚定打断问题,提出自听机制,将实际播放语音反馈给模型,并构建AnchorSpeech数据集,实验证明该方法提升锚定性能。

链接:https://arxiv.org/abs/2609.05592

机构:Shenzhen Loop Area Institute, China(深圳环形区域研究所); The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

作者:Xuanning Zhou, Junyi Ao, Xiaotong Liu, Tom Ko, Benyou Wang, Haizhou Li


9. TAD: Token-Adaptive Contrastive Decoding with Confidence-Guided Gating for Hallucination Mitigation in Large Audio-Language Models

TAD:面向大型音频语言模型幻觉缓解的置信度引导门控令牌自适应对比解码

AI 总结:针对大型音频语言模型的幻觉问题,提出无需训练的令牌自适应对比解码(TAD),通过置信度引导门控对比真实与静音音频逻辑分数,在多个基准上显著提升F1分数。

链接:https://arxiv.org/abs/2609.07286

机构:Information Engineering University(信息工程大学)

作者:Heyu Chang, Nianwen Si, Hao Zhang, Wenlin Zhang, Dan Qu


7. 多模态音频与视听学习 | 1 篇


10. Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models

噪声自适应流式音视频语音令牌增强用于鲁棒全双工口语对话模型

AI 总结:提出模块化流式音视频前端AV-STE,在语音LLM前从噪声音频和唇部视频恢复语义令牌,冻结下游模型,提升全双工对话鲁棒性,响应连贯性显著提高。

链接:https://arxiv.org/abs/2609.08390

机构:KAIST(韩国科学技术院)

作者:Bella Godiva, Yeonju Kim, Yong Man Ro


8. 安全、隐私与深度伪造音频 | 2 篇


11. From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection

从分数到证据:可审计决策可改进语音深度伪造检测

AI 总结:针对语音深度伪造检测中单一分数缺乏可解释性的问题,提出携带多线索的可审计决策记录,经后期校准在ASVspoof 5上显著降低等错误率,并保留证据以支持审查。

链接:https://arxiv.org/abs/2609.08899

机构:National Research Council Canada(加拿大国家研究委员会); The Chinese University of Hong Kong(香港中文大学); Shanghai Jiao Tong University(上海交通大学)

作者:Mengzhe Geng, Yujia Lu, Patrick Littell, Manuela Kunz, Xie Chen


12. Disentangled Global-Local Feature Learning with E-Branchformer for Audio Deepfake Detection

基于E-Branchformer的解耦全局-局部特征学习用于音频深度伪造检测

AI 总结:提出基于E-Branchformer的并行双分支架构,利用自监督语音表示,通过多头自注意力和卷积捕获全局与局部特征,集成深度卷积和压缩-激励模块增强分类令牌,在ASVspoof 2021等数据集上取得最优性能。

链接:https://arxiv.org/abs/2609.08948

机构:National University of Singapore(新加坡国立大学); Hanoi University of Science and Technology(河内理工大学)

作者:Phuong Tuan Dat, Ho Bao Thu, Nguyen Tran Trung, Pham Viet Hoang, Nguyen Thi Thu Trang


9. 其他/综合语音音频 | 9 篇


13. Emotion as a Distribution: Joint Valence-Arousal Probability Learning for Speaker-Independent Multimodal Emotion Recognition

情感作为分布:面向说话人无关多模态情感识别的联合效价-唤醒概率学习

AI 总结:针对多模态情感识别将情感压缩为硬标签的问题,提出输出9×9效价-唤醒概率分布的双头系统,在IEMOCAP上超越Transformer基线3.0个UA点,并恢复环状模型结构。

链接:https://arxiv.org/abs/2609.05755

机构:National Changhua University of Education(国立彰化师范大学); National Central University(国立中央大学)

作者:Tingyi Lin, Wen-Ren Yang, Kuanwei Chen


14. BinauralVAE: Spatial Audio Reconstruction For World Models

BinauralVAE:用于世界模型的空间音频重建


AI 总结:BinauralVAE提出一个开源流水线,利用多种变分自编码器架构重建空间音频,为基于音频的世界模型奠定状态表示基础,以补充视觉感知。

链接:https://arxiv.org/abs/2609.06837

机构:VISGRAF; IMPA(巴西纯数学与应用数学国家研究所)

作者:Luis Vitor Zerkowski, Luiz Velho


15. Frequency Estimation Based on SNR-adaptive Frequency Estimator Under Wide SNR Range

基于信噪比自适应频率估计器的宽信噪比范围频率估计

AI 总结:本文提出信噪比自适应频率估计器(SAFE),结合时频图像神经网络和信噪比选择器,在宽信噪比范围内兼顾低信噪比鲁棒性与高信噪比精度,显著提升频率估计性能。

链接:https://arxiv.org/abs/2609.07034

机构:Korea Advanced Institute of Science and Technology(韩国科学技术院); Korea University(高丽大学)

作者:Hee-Yang Jung, Dong-Hee Paek, Woo-Jin Jung, Seung-Hyun Kong


16. Comparing Self-Supervised and Domain-Invariant Features for Cross-Domain Voice Phishing Detection

跨域语音钓鱼检测中自监督与域不变特征的比较

AI 总结:该研究比较域不变韵律特征与自监督模型(HuBERT、wav2vec2.0)在跨域语音钓鱼检测中的表现,发现域不变特征支持零样本部署,而自监督方法性能更高但需真实样本与计算资源。

链接:https://arxiv.org/abs/2609.07079

机构:Electronics and Telecommunications Research Institute(电子通信研究院); University of Science and Technology(科技大学)

作者:Jeongmin Lee, Seung Yun, Minkyu Lee, Ran Han, Yoonkyu Woo, Jinxia Huang


17. Silent Metronome: Rhythmic Grounding for Live Music Accompaniment

静默节拍器:现场音乐伴奏的节奏锚定

AI 总结:针对现场伴奏中节奏漂移问题,提出静默节拍器(SiMe),通过周期性编码节拍相位作为独立条件通道提供时间参考,使节拍对齐提升3.2倍,并超越非因果基线。

链接:https://arxiv.org/abs/2609.07688

机构:Leiden University(莱顿大学); Leiden Institute of Advanced Computer Science (LIACS)(莱顿高级计算机科学研究所)

作者:Kevin Bretz, Derya Soydaner, Aske Plaat


18. Clean Accuracy Does Not Guarantee Provenance Robustness: A Prospective Codec-Stress Evaluation of Audio Attribution

干净准确率并不保证溯源鲁棒性:音频归因的前瞻性编解码器压力评估

AI 总结:该研究通过前瞻性注册实验评估编解码器转码对音频溯源归因的影响,发现干净准确率无法保证部署鲁棒性,编解码器传输可导致显著性能下降,且下降程度依赖条件与表示。

链接:https://arxiv.org/abs/2609.07981

作者:Gang Shi (Independent Researcher)


19. Geometry-Informed Distributed Acoustic Scene Understanding

几何信息感知的分布式声学场景理解

AI 总结:提出几何信息感知的分布式声学场景理解框架,融合分布式麦克风、音频频谱图变换器与拓扑感知图神经网络,解码语义三元组并结合大语言模型,实现多房间场景的空间理解与物理一致叙述。

链接:https://arxiv.org/abs/2609.08026

机构:University of Oxford(牛津大学)

作者:Yiyuan Yang, Shitong Xu, Niki Trigoni, Andrew Markham


20. AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

AuK 技术报告:用于语音生成与编辑的开源基础模型

AI 总结:AuK 是一个开源基础模型,通过统一接口实现语音生成与编辑,采用多模态大语言模型和混合流 Transformer 架构,经后训练优化与蒸馏,实现高效推理并在多项任务上取得领先性能。

链接:https://arxiv.org/abs/2609.08936

作者:Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu, Yanru Huo, Nickk Huang, Yang Liu, Qicong Xie, Zeyu Xie, Hui Wang, Haitao Li, Zixuan Jiang, Yalin Li, Jie Fang, Yifan Duan, Zeyue Tian, Guangzheng Li, Haina Zhu, Shuyi Wang, Jinwen Wang, Mingyu Cui, Tian Tan, Auden, Sen Liang, Steve Yves, Shan Yang, Liefeng Bo, Zilong Zheng, Kai Yu, Eng-Siong Chng, Xie Chen


21. TASTE2: Text-Aligned Speech Modeling and Deployment toward Full-Duplex Voice Interaction

TASTE2:面向全双工语音交互的文本对齐语音建模与部署

AI 总结:TASTE2将TASTE扩展为增量对话栈,实现流式全双工语音交互,通过共享词表和增量解分词器提升性能,并首次系统表征副语言控制。

链接:https://arxiv.org/abs/2609.08956

机构:MediaTek Research(联发科技研究院); National Taiwan University(台湾大学); NVIDIA(英伟达)

作者:Yi-Chang Chen, Chun Wei Chen, Dien-Ruei Wu, Jie Lin, Yu-Kuan Fu, Yang-Hsien Lin, Eddie TC Huang, Simon See, Hung-yi Lee, Da-Shan Shiu