今日论文合集:CS.SD语音与音频 | 共 22 篇。

本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily

[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准


快速导航

1. 语音识别与关键词检测 2 篇

2. 语音合成与声音生成 3 篇

3. 说话人识别、验证与分离 2 篇

4. 音频事件检测与场景理解 1 篇

5. 音乐信息检索与音乐生成 1 篇

6. 语音翻译与语音语言模型 3 篇

7. 多模态音频与视听学习 1 篇

8. 数据集、基准与评测 1 篇

9. 其他/综合语音音频 8 篇


1. 语音识别与关键词检测 | 2 篇

1. ParA-LLM: A Unified Approach to Paralinguistic and Acoustic Speech Understanding

ParA-LLM:副语言与声学语音理解的统一方法

AI 总结:针对音频大模型忽视副语言信息的问题,提出ParA-LLM,通过两阶段课程训练和120万问答对,在ParA-Bench等基准上超越GPT-4o-Audio,显著提升说话人与声学特征理解。

链接:https://arxiv.org/abs/2609.22771

机构:Adobe Research(Adobe研究院); University of Maryland, College Park(马里兰大学学院公园分校); OpenAI

作者:Nishit Anand, Jiaqi Su, Ke Chen, Yunyun Wang, Dinesh Manocha, Ramani Duraiswami, Rithesh Kumar, Zeyu Jin


2. Beyond Encoder Fusion: Multi-View Discrete Token Augmentation for LLM-Based ASR

超越编码器融合:基于多视角离散词元增强的LLM语音识别

AI 总结:提出多视角离散词元增强策略,利用多个SSL编码器生成互补训练视角,提升基于LLM的语音识别性能,在LibriSpeech上显著降低词错误率。

链接:https://arxiv.org/abs/2609.23525

机构:LIA, Avignon University(阿维尼翁大学LIA); EDL

作者:Paul Moïse Gangbadja, Mickael Rouvier, Fabrice Lefèvre


2. 语音合成与声音生成 | 3 篇

3. TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints

TTS-Guard:通过自适应对抗说话人配对指纹实现文本到语音模型的黑盒所有权验证

AI 总结:TTS-Guard提出基于对抗性说话人配对指纹的黑盒所有权验证框架,通过双嵌入空间和自适应课程优化,在五个TTS系统上实现96.4%指纹成功率,且对多种攻击和修改保持鲁棒性。

链接:https://arxiv.org/abs/2609.23729

机构:Zhejiang University(浙江大学); Binjiang Institute of Zhejiang University(浙江大学滨江研究院); Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院); China University of Petroleum (Beijing)(中国石油大学(北京))

作者:Xubin Yue, Zhenhua Xu, Zhebo Wang, Mengting Li, Zijie Zhou, Wenpeng Xing, Dezhang Kong, Meng Han


4. Understanding Hyperspherical Geometry of ECAPA-TDNN Embedding and Its Impact on Zero-Shot Voice Conversion

理解ECAPA-TDNN嵌入的超球面几何及其对零样本语音转换的影响

AI 总结:本文分析ECAPA-TDNN嵌入的超球面几何,提出两种几何正则化策略改善原型分布,提升零样本语音转换对未见说话人的鲁棒性。

链接:https://arxiv.org/abs/2609.24688

机构:STMS Lab, IRCAM CNRS, Sorbonne Université(STMS实验室,法国国家科学研究中心下属的IRCAM,索邦大学)

作者:Mathilde Abrassart, Nicolas Obin, Axel Roebel


5. CycleSpeech: Reciprocal Alignment for Instruction-Controlled Speech Synthesis and Paralinguistic Understanding

CycleSpeech:面向指令控制语音合成与副语言理解的互惠对齐

AI 总结:CycleSpeech通过结构化语音画像连接语音合成与理解,利用前向和后向循环互惠反馈及CycleGRPO策略优化,在双语基准上显著提升指令遵循与画像恢复,无需人工偏好标注。

链接:https://arxiv.org/abs/2609.24771

机构:The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Tsinghua University(清华大学); Amphion Technology Co., Ltd.(Amphion科技有限公司)

作者:Huan Liao, Haonan Han, Xingwen Han, Dekun Chen, Yuancheng Wang, Zhizheng Wu


3. 说话人识别、验证与分离 | 2 篇

6. Entropy-aware logistic regression for fusion of large-scale speaker recognition systems

熵感知逻辑回归用于大规模说话人识别系统的融合

AI 总结:针对传统逻辑回归融合忽略话语可靠性变化的问题,提出熵感知逻辑回归,结合系统互补性与话语不确定性,提升大规模说话人识别性能。

链接:https://arxiv.org/abs/2609.23727

机构:LIA, Avignon University(阿维尼翁大学LIA实验室)

作者:Pierre-Michel Bousquet, Mickael Rouvier


7. MECT: Mixture of Experts with CNN-Transformer Network for Speaker verification

MECT:用于说话人验证的CNN-Transformer网络专家混合模型

AI 总结:本文提出MECT,一种集成专家混合机制到CNN-Transformer骨干的说话人验证模型,通过优化块结构和路由策略,在保持紧凑参数的同时,在VoxCeleb1和CN-Celeb上取得领先性能,并支持流式推理。

链接:https://arxiv.org/abs/2609.24061

机构:Ant Group(蚂蚁集团)

作者:Yu Zheng, Jinghan Peng, ChangHao Zhang, Jian Liu, Weiqiang Wang


4. 音频事件检测与场景理解 | 1 篇

8. EquiSELD: Efficient training of equivariant sound event localization and detection networks

EquiSELD:等变声音事件定位与检测网络的高效训练

AI 总结:EquiSELD提出一种利用FOA信号O(3)对称性的等变注意力网络,通过成对流处理和Multi-ACCDOA读出,以更低训练成本在模拟和真实声景中超越先前等变及非等变SELD网络。

链接:https://arxiv.org/abs/2609.23156

机构:Radboud University(拉德堡德大学); Columbia University(哥伦比亚大学)

作者:Goksenin Yuksel, Marcel van Gerven, Kiki van der Heijden


5. 音乐信息检索与音乐生成 | 1 篇

9. Which Constraints Are Missing? Ask the Verifier: Graded Rewards for Constraint-Following Music Generation

哪些约束缺失了?询问验证器:用于约束跟随音乐生成的梯度奖励

AI 总结:针对约束跟随音乐生成,提出MusicRLVR方法,利用验证器提供分级奖励,在MusicConstraintBench上显著提升模型性能,并泛化至未见组合。

链接:https://arxiv.org/abs/2609.23665

机构:The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳市未来智联网络研究院)

作者:Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoyu Ma, Haoran Shou, Xiaoying Tang


6. 语音翻译与语音语言模型 | 3 篇

10. Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs

离散与连续:LALMs中统一音频理解的综合研究

AI 总结:本研究系统比较了大型音频语言模型中连续与离散表示,发现语义约束对音频理解至关重要,且扩展模型规模无法弥补表示信息损失,为未来设计提供了平衡指导。

链接:https://arxiv.org/abs/2609.22851

机构:Tsinghua University(清华大学)

作者:Jing Peng, Zichao Nie, Zhisheng Zhang, Jingran Xie, Zhiyong Wu ID

11. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

MuLA-Bench:通过多层审计构建的多语言长格式音频理解基准

AI 总结:MuLA-Bench通过多层审计构建多语言长音频理解基准,覆盖16种语言和8个领域,评估十个模型,揭示语言、证据和任务对难度的联合影响及条件性失败模式。

链接:https://arxiv.org/abs/2609.23416

机构:The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Alibaba Token Hub, Alibaba Group(阿里巴巴集团通义实验室)

作者:Zeyu Yang, Xinyu Zhang, Zibo Bi, Pei Zhang, Xize Cheng, Jin Xu, Baosong Yang, Satoshi Nakamura


12. Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

先听后推理:面向大型音频语言模型的感知接地测试时强化学习

AI 总结:本研究提出感知接地测试时强化学习(PG-TTRL),通过量化并增强大型音频语言模型推理中对声学证据的依赖,显著提升音频推理准确率,优于基础模型和标准TTRL。

链接:https://arxiv.org/abs/2609.23589

机构:The University of Melbourne(墨尔本大学); University of Auckland(奥克兰大学); University of Birmingham(伯明翰大学); ARC OPTIMA

作者:Jiaheng Dong, Xiaofeng Yu, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang


7. 多模态音频与视听学习 | 1 篇

13. OmniEcho: Spatial Audio Understanding for Embodied Agents

OmniEcho:具身智能体的空间音频理解

AI 总结:本文提出OmniEchoBench基准和OmniEcho模型,用于具身智能体的空间音频理解,通过可控渲染和FOA编码器,在感知和导航任务上达到先进性能,证明空间音频的价值。

链接:https://arxiv.org/abs/2609.23407

机构:Peking University(北京大学); Alibaba Group(阿里巴巴集团); Tsinghua University(清华大学)

作者:Ruixun Liu, Yuxuan Wang, Jiacheng Xie, Yuhuan You, Donghua Cai, Junming Lin, Xiong-Hui Chen, Zhifang Guo, Yunfei Chu, Qize Yang, Xize Cheng, Jin Xu, Yiwu Zhong


8. 数据集、基准与评测 | 1 篇

14. SEABED: SouthEast Asian Benchmark for Evaluating Audio Reasoning

SEABED:用于评估音频推理的东南亚基准

AI 总结:针对现有音频推理基准偏重英语和通用领域的问题,提出SEABED,一个基于真实东南亚语音语料构建的六任务问答基准,含5,404个问答对,评估显示最先进模型Gemini 3.5 Flash仅达50.3%加权平均准确率,并额外检验推理是否基于音频证据。

链接:https://arxiv.org/abs/2609.22586

机构:Centific AI Research(Centific 人工智能研究院)

作者:Harshit Rajgarhia, Asif Shaik, Rachuri Lokesh, Sushanta Kumar Pani, Abhishek Mukherji


9. 其他/综合语音音频 | 8 篇

15. Causal limits and optimal allocation for passive frequency-selective hearing protection

被动频率选择性听力保护中的因果极限与最优分配

AI 总结:本研究针对被动亥姆霍兹谐振器耳塞,推导因果透射损耗守恒积分,提出危害加权注水法最优分配有限空气体积,实现低频保护约1分贝、中高频达12分贝的噪声衰减与语音可听性平衡。

链接:https://arxiv.org/abs/2609.22395

机构:Hokkaido University(北海道大学); CHA University(车大学); Korea Advanced Institute of Science and Technology(韩国科学技术院)

作者:Geonhwi Hwang, Jaewoo Lee, Hyunjun Kim, Hyeonwoo Na


16. Bearings: Self-Supervised Soundfield Embeddings from First-Order Ambisonics

Bearings:基于一阶环境立体声的自监督声场嵌入

AI 总结:Bearings是一种自监督声场嵌入框架,从一阶环境立体声学习空间表征,可附加到冻结音频编码器,实现联合声音事件检测与定位,显著提升F分数。

链接:https://arxiv.org/abs/2609.23152

机构:Radboud University(拉德堡德大学); Columbia University(哥伦比亚大学)

作者:Goksenin Yuksel, Marcel van Gerven, Kiki van der Heijden


17. Misrecognition or Abstraction? Rethinking Outputs of Sound Event Recognition

误识别还是抽象?重新思考声音事件识别的输出

AI 总结:本文提出结合声音类别、置信度和拟声词描述的输出表示,在不确定性下提升声音事件识别的信息性和沟通性,实验验证其性能与传统系统相当且更受偏好。

链接:https://arxiv.org/abs/2609.23411

机构:Kyoto University(京都大学); The University of Tokyo(东京大学)

作者:Naoya Tomida, Yuki Okamoto, Keisuke Imoto


18. LiteCASS: A Lightweight End-to-End Network for Real-Time Stereo Cinematic Audio Source Separation

LiteCASS:用于实时立体声电影音频源分离的轻量级端到端网络

AI 总结:针对现有电影音频源分离方法参数多、依赖GPU且仅支持单声道的问题,提出轻量级端到端网络LiteCASS,结合STFT子带重排与双U-Net实现实时立体声分离,以1.06M参数和0.72G MACs在DnR v3立体声扩展上取得最高平均SI-SDR。

链接:https://arxiv.org/abs/2609.23453

机构:Southwestern University of Finance and Economics(西南财经大学); Xiaomi Automobile Co., Ltd.(小米汽车有限公司); Wuhan University(武汉大学)

作者:Yuanxin Guo, Qiang Ji, Mengmei Liu, Yuhan Lv, Ningning Pan, Gongping Huang


19. ArtifactBench: Lineage-Aware Evaluation of AI-Generated Music Detectors under Distribution Shift

ArtifactBench:分布偏移下AI生成音乐检测器的谱系感知评估

AI 总结:本文提出谱系感知评估套件ArtifactBench,在分布偏移下系统评估AI音乐检测器,揭示聚合分数掩盖的生成器与真实域性能差异。

链接:https://arxiv.org/abs/2609.23550

机构:Intrect

作者:Heewon Oh


20. ART-NAD: An Articulatory Inversion-based Neural Acoustic Distance for Pathological Speech Intelligibility Assessment

ART-NAD:基于发音逆变换的神经声学距离用于病理语音可懂度评估

AI 总结:针对病理语音可懂度评估,提出ART-NAD,用可解释的声道变量替换NAD的黑盒特征,在保持同等相关性(r=0.71)的同时提供发音偏差的可视化解释。

链接:https://arxiv.org/abs/2609.24046

机构:Nagoya University(名古屋大学); University of Cologne(科隆大学); University of Groningen(格罗宁根大学)

作者:Bence Mark Halpern, Thomas Tienkamp, Defne Abur, Tomoki Toda


21. Fast Time-Varying Exponentiated Convolution Methods for Generative Direction Dependent Reverberation

快速时变指数卷积方法用于生成方向相关的混响

AI 总结:本文提出时变指数卷积方法,将高斯噪声和脉冲响应转换为混响及修正频谱衰减场,推导两种快速递归算法并扩展到球谐域,以生成方向相关混响,实验验证了计算性能和分布外生成效果。

链接:https://arxiv.org/abs/2609.24809

机构:NuSpace Audio

作者:Yuancheng Luo


22. Automated Assessment of L2 Speech Rhythm Using Low-Frequency Amplitude Modulations

第二语言语音节奏的自动化评估:基于低频幅度调制的方法

AI 总结:针对非母语语音节奏评估中对齐易错的问题,提出基于卷积神经网络和低频幅度包络的声学评估方法,在speechocean762上训练,其包络一阶导数模型与人类评分相关性最高,为L2节奏评估提供无需对齐的稳健方案。

链接:https://arxiv.org/abs/2609.24818

机构:Universidade Estadual de Campinas(坎皮纳斯州立大学)

作者:João Lima, Lucas Ueda, Paula Costa