分享武汉大学电子信息学院智能音频与语音感知实验室在Interspeech 2026中稿的13篇论文,论文涵盖语音增强、声源定位、声音事件检测、音频表征、音频大模型等多个研究方向。

⏩一、多通道语音增强与鲁棒波束形成

Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming

作者:邓咏怡,裴汉晨,马建波,黄公平,陈景东,Jacob Benesty

合作单位:Dolby Laboratories,西北工业大学,INRS-EMT

传统最小方差无失真响应MVDR 波束形成方法在实际多通道语音增强中容易受到麦克风自噪声、阵列失配和设备差异等因素影响。现有MVDR 方法通常依赖人工设定固定的白噪声增益 WNG 阈值或对角加载参数,难以适应复杂且动态变化的声学环境。针对这一问题,本文提出一种联合学习噪声协方差估计与WNG 约束的鲁棒 MVDR 波束形成框架。该方法设计双分支神经网络,一条分支用于估计噪声协方差矩阵所需的时频噪声信息,另一条分支用于预测频率相关的 WNG 约束,从而在鲁棒性与空间指向性之间实现自适应权衡。进一步地,本文将可微的WNG 约束 MVDR 层嵌入端到端训练流程,使模型能够在无需显式 WNG 标签监督的条件下,自动学习适合当前声学场景和阵列状态的鲁棒性控制策略。实验结果表明,该方法在有噪、混响和阵列失配条件下均能稳定提升语音增强性能,在 SNR gain、SDR、STOI 和 PESQ 等指标上优于固定 WNG 或固定对角加载参数的基线方法。

论文链接:https://arxiv.org/abs/2606.24137

⏩二、复杂声场声音事件检测

BG-CRNN: Boundary-Guided Dynamic Attention for Sound Event Detection in Complex Scenarios

作者:林宗穆,白仲鑫,白吉生,李真茹,党婷,黄公平,陈景东,Jacob Benesty

合作单位:哈尔滨工程大学,西安邮电大学,墨尔本大学,西北工业大学,INRS-EMT

声音事件检测需要在连续音频中判断事件类别并定位其起止时间,但在复杂嘈杂声场下,模型容易受到背景噪声干扰,尤其在低信噪比条件下,时序边界定位精度会明显下降。针对这一问题,本文提出一种边界引导卷积循环网络BG-CRNN,通过显式建模声音事件边界,提升模型在复杂场景中的检测鲁棒性。该方法融合CNN 与 ATST-Frame 自监督模型进行多尺度声学特征提取,并设计了两个核心模块:动态边界变换器(DBT)和边界引导注意力(BGA)。首先,模型融合时频特征与高层语义表征,并对齐时间维度;随后,DBT 通过双分支预测事件边界并生成分段掩码,将自注意力限制在单一声学片段内部,从而减少跨片段噪声干扰;BGA 依据边界特征生成门控权重,并结合可学习残差连接,自适应强化有效事件区域。最终,边界优化后的特征被送入 RNN,输出逐帧声音事件检测结果。训练阶段,模型联合采用加权边界损失、SED 监督损失和 Mean Teacher 一致性损失,实现多任务半监督学习。实验结果表明,BG-CRNN 在 DESED 和 WildDESED 数据集上,在 10 dB 至 -5 dB 的全信噪比区间均优于 CRNN、EADSED 和 LLM 辅助方法等主流基线;在 -5 dB 强噪声条件下,微调模型的 PSDS1 达到 0.191,显著提升了复杂声场下声音事件检测的时序定位鲁棒性。

⏩三、低资源发音错误检测与诊断

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

作者:杨静,张舒庆,邓咏怡,李攀,党婷,黄公平,陈景东,Jacob Benesty

合作单位:墨尔本大学,西北工业大学,INRS-EMT

准确的音素识别是现代标准阿拉伯语发音错误检测与诊断MDD 的关键,但该任务长期受到真实学习者语音数据稀缺,以及合成语音与真实学习者语音之间领域差异的限制。针对上述问题,本文提出一种融合感知的两阶段端到端框架,将预训练编码器与因果扩张时序卷积网络结合,以更好地保留细粒度音素变化信息。该方法首先利用母语者语料和合成语料学习通用映射关系,随后适应少量真实学习者数据,从而缓解领域偏移并避免过度校正。为进一步增强预测稳定性,本文引入多检查点集成推理与N-gram 重打分机制。在 QuranMB.v2 测试集上的实验结果显示,该系统取得 0.7201 的 F1 分数,相比基线 0.4414 实现 63.1% 的相对提升,并在 IqraEval.2 Challenge 中取得领先表现,为低资源现代标准阿拉伯语发音错误检测与诊断建立了新的性能基准。

⏩四、面向跨领域音频表征的动态门控注意力融合方法

WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

作者:林明达,丁蕾,周昕悦,熊甜甜,裴汉晨,黄公平,张浩,陈景东,Jacob Benesty

合作单位:腾讯AI Lab,INRS-EMT

尽管预训练音频模型在特定任务中已经取得了较好表现,但如何在多样化音频场景中学习更通用、更稳健的跨领域表征,仍然是音频理解中的重要挑战。针对这一问题,本文提出一种用于跨领域音频表征学习的双编码器融合方法,称之为WQ-Fusion。该方法融合Whisper 与 Qwen 两类互补预训练模型,并通过自适应特征调制模块与元素级门控注意力机制,克服传统静态特征拼接方式难以动态筛选信息的局限。模型能够根据不同音频任务和输入内容,自适应选择并强化相关的声学维度与语义维度,从而实现更有效的异构信息融合。实验结果表明,WQ-Fusion 通过动态路由不同来源的音频表征信息,取得了 0.836 的综合评分,显著优于最强单编码器基线模型,验证了双编码器融合策略在跨领域音频表征学习中的有效性。

论文链接:https://arxiv.org/abs/2606.26556

⏩五、音乐源恢复与音频生成重建

DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration

作者:倪悠然,谭诗弘,王玉竹,黄公平

合作单位:芬兰坦佩雷大学信号处理研究中心

音乐源恢复任务不仅需要从混合音频中分离不同乐器或人声干音,还需要逆向处理压缩、混响、均衡、动态范围控制等非线性制作效果。针对现有方法难以同时保持语义一致性与波形级重建精度的问题,本文提出一种名为DTT-BSR+的两阶段级联音乐源恢复系统。该方法将语义分布拟合与波形级信号重建解耦:第一阶段利用DTT-BSR 分离器,从退化混合音频中生成符合干净声源先验分布的初步原始声源信号估计;第二阶段采用改进版Demucs 纯回归网络 Demucs-L,以第一阶段输出为输入,并通过联合时域 L1 损失和多分辨率 STFT 损失进行优化,进一步提升局部波形细节的重建质量。实验结果表明,DTT-BSR+ 在所有八种乐器原始声源信号上的多梅尔信噪比MMSNR 均优于单阶段 DTT-BSR 基线,并在人声、吉他、合成器、贝斯和鼓五种干音上超过当前先进的 X-LANCE MSR 系统。此外,本文还通过分解 FAD-CLAP 指标,揭示了信号重建精度与语义分布拟合之间可能存在的隐性权衡,为未来面向不同干音类型的音乐源恢复系统设计提供了参考。

论文链接:https://arxiv.org/abs/2606.24127

⏩六、紧凑麦克风阵列声源定位

End-Fire Degradation–Robust DOA Estimation for Compact Linear Microphone Arrays

作者:文政,王华洋,白仲鑫,郭欣,黄公平,童琪琪,张娅玲

合作单位:哈尔滨工程大学,广东沐光智能照明有限公司

紧凑线性麦克风阵列在实际设备中应用广泛,但当声源位于端射方向附近时,DOA 估计往往会出现明显性能下降。本文从理论上分析了这一现象,将紧凑线性阵列中的端射退化归因于远场平面波模型下 TDOA 到方位角的病态非线性映射,即微小的延迟扰动会在端射区域被显著放大,从而导致定位不稳定。为在不扩大阵列孔径的情况下缓解端射退化问题,本文在可靠性感知相变框架内提出两种改进方法:加权增强的转向响应功率SRP 方法,以及改进的 TDOA 估计方案。同时,本文还构建了真实世界数据集,用于定量评估近端射方向下的 DOA 估计性能。实验结果表明,所提出的方法能够显著提升端射区域的定位精度和稳定性,同时保持具有竞争力的DOA 估计性能。

⏩七、自监督语音模型的自适应联邦微调

Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations

作者:郭欣,赵春蕊,贾鸿,党婷,黄公平,郑显睿,高岩

合作单位:奥克兰大学,墨尔本大学,剑桥大学,Flower Labs

自监督语音模型在语音识别、关键词识别等任务中表现突出,但在联邦学习场景下进行模型微调时,常面临设备算力差异大、任务复杂度不同、边缘端显存受限等问题。传统全模型联邦微调策略容易导致低资源客户端训练负担过重,并产生明显的掉队者效应。针对这一挑战,本文提出一种基于早期退出机制的自适应联邦微调框架。该方法将静态SSL 骨干网络转换为弹性多分支架构,并在中间层插入轻量化预测头,使不同客户端能够根据自身硬件约束和任务复杂度动态选择最大训练深度。在局部训练阶段,低资源设备只需执行到预设深度的前向与反向传播,从而降低计算和显存开销;在服务端聚合阶段,模型采用深度感知的层级部分聚合机制,对不同深度的模型更新进行独立加权融合。实验结果表明,该框架在ASR、关键词识别等五项语音任务中均保持出色性能,相比全模型微调最高可降低43.27% 的边缘端显存开销,有效提升了异构联邦学习环境下语音模型适配的灵活性与效率。

论文链接:https://arxiv.org/abs/2603.21888

⏩八、Localizing and Editing Knowledge in Large Audio-Language Models

作者:Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

合作单位:墨尔本大学、奥克兰大学

大规模音频语言模型在语音理解任务中表现突出,使语音成为访问事实知识的自然接口。然而,这类模型通常基于静态语料训练,可能编码错误或过时事实。现有模型编辑方法主要面向文本LLM,难以解释连续语音表示、声学模块和语言模块中知识的存储位置。该工作构建了首个面向 LALM 知识定位与编辑的音频基准,并提出 speech-driven locate-then-edit 框架:先通过 speech-aware causal tracing 定位支持事实检索的层和模块,再在定位位置进行编辑。实验显示,事实知识由音频和文本模块共同编码,音频侧编辑比文本编辑或微调更有效。

论文链接:https://arxiv.org/pdf/2603.14343

⏩九、Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models

作者:XiangyuanXue,JiajunLu, Yan Gao, Gongping Huang, Ting Dang, Hong Jia

合作单位:墨尔本大学、奥克兰大学,剑桥大学

语音情感描述任务旨在利用大规模音频语言模型,从语音中生成包含上下文感知的情感描述。然而,在真实部署中,边缘设备算力有限,同时将生物特征语音上传至云端也存在隐私风险。针对这一问题,本文提出一种基于Uncertainty-Guided Speculative Decoding 的边云协同框架。该方法由轻量边缘模型先在本地生成情感描述草稿,并通过不确定性评估筛选出高风险token block,仅将这些高不确定性片段上传至更强的云端模型进行验证与修正。这样既减少了云端交互成本,也避免了完整语音数据频繁上传。实验结果显示,该方法在 MER2024 数据集上显著提升 BLEU,最高提升 62.7%,同时相比纯边缘模型实现更低延迟和更高 token throughput,为隐私友好、低延迟的语音情感理解部署提供了新方案。

论文链接:https://arxiv.org/pdf/2603.11397

⏩十、Activation Steering for Accent Adaptation in Speech Foundation Models

作者:JinuoSun, Yang Xiao, Sung Kyun Chung,QiuchiHu, Gongping Huang, Eun-Jung Holden, Ting Dang

合作单位:墨尔本大学

口音差异仍然是自动语音识别中的重要挑战。多数现有口音适应方法依赖参数微调,但对口音信息在模型中的编码方式缺乏可解释分析。本文将口音变化视为隐藏表示空间中的可解释子空间,并通过提取不同层的编码器激活,估计口音引起的表示偏移方向。作者进一步将这些方向注入特定层,分析其如何使带口音语音表示向标准语音表示对齐,从而得到逐层的口音敏感性分布。基于这一发现,论文提出无需更新模型参数的inference-time accent steering 方法,在推理阶段通过激活调控实现口音适应。实验结果表明,该方法在 8 种口音上均实现了稳定的词错误率下降,为语音基础模型中的口音鲁棒性与可解释适应提供了新的思路。

论文链接:https://arxiv.org/pdf/2603.05813

⏩十一、Geometrically Constrained Decentralized Independent Vector Analysis for Distributed Microphone Arrays

作者:陈昶达,杨懿晨,刘威,朱冰,黄公平,Shoji Makino,王帅

合作单位:早稻田大学,南京大学,西北工业大学

分布式麦克风阵列能够为会议、远程协作和智能空间等场景提供更丰富的空间信息,但跨阵列语音分离通常面临通信开销高、隐私风险以及声源排列不一致等问题。针对现有去中心化IVA 方法在不同阵列间容易出现声源索引错配的不足,本文提出GC-Dec-IVA,将到达方向信息DOA 引入去中心化独立向量分析过程,通过几何约束引导不同阵列保持一致的声源分配。同时,本文设计了新的源模型,以削弱原有Dec-IVA 中过强的跨阵列依赖,提升噪声环境下的稳定性。实验结果表明,该方法在 2 至 8 个麦克风阵列的混响仿真环境中,能够有效提升语音分离性能和跨阵列排列一致性。

⏩十二、LaS-LCA: Layer-Selected Latent Cross-Attention Adapters and Margin-Mixup for Robust Cross-Lingual Speaker Verification

作者:申旭,赵艺豪,吴欣威,梁好,朱瑜杰,王煜锦,刘威,黄公平, Shoji Makin

合作单位:早稻田大学

跨语言说话人验证需要在不同语言语音之间判断说话人身份是否一致,但语言不匹配会显著干扰说话人表征。针对这一问题,本文提出LaS-LCA,一种面向跨语言说话人验证的层选择潜在交叉注意力适配框架,在冻结大规模预训练模型的基础上实现高效鲁棒适配。该方法选择w2v-BERT 2.0 中更适合说话人建模的高层特征,并通过共享潜在交叉注意力和一维卷积模块,将多层表示整合到语言无关的说话人嵌入空间中。同时,本文引入 embedding-level margin-mixup 策略缓解有限跨语言数据上的过拟合。实验结果表明,LaS-LCA 在 TidyVoiceX benchmark 上取得1.40% EER和0.66 MinDCF,显著优于基线模型,展现出良好的跨语言鲁棒性。

⏩十三、LLM-HB: Language-Aware LLM-Guided Hotword Biasing for Code-Switching ASR

作者:Yuxuan He, Genshun Wan, Pengcheng Li, Gongping Huang, Jianqing Gao, Yanmin Qian

合作单位:上海交通大学,科大讯飞人工智能研究院

语码转换语音中常同时包含多种语言,频繁的语言切换容易导致自动语音识别系统出现跨语言混淆,尤其影响人名、地名和专有名词等热词识别。针对这一问题,本文提出LLM-HB,一种面向语码转换语音识别的语言感知大语言模型引导热词偏置框架。该方法以Whisper 作为语音编码器,引入 MoE adaptor 建模多语言声学表征,并通过辅助语言预测头增强语言判别能力;同时利用大语言模型提示方式注入热词信息,引导模型在解码时关注目标词。实验结果表明,在 ASRU2019 中英语码转换测试集上,LLM-HB 将 MER 从 7.34% 降至5.85%,相对下降20.30%,同时将热词相关B-MER 从 22.11% 降至8.99%,有效提升了语码转换场景下的热词识别能力。

此次多篇论文被Interspeech 2026 接收,体现了武汉大学电子信息学院智能音频与语音感知实验室在语音与音频处理领域的持续积累与开放合作。未来,实验室将继续面向真实复杂声学场景,围绕智能声学感知、语音增强与分离、声源定位、多语言语音理解、音频语言模型和高效语音模型训练等方向开展深入研究,推动语音与音频技术的创新发展与实际应用。