近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享西工大音频语音与语言处理研究组(ASLP@NPU)中稿的8篇论文,涉及智能语音处理领域的众多研究方向。以下是本届会议发表论文的相关信息,附带论文原文链接,与大家分享。
作者列表:穆秉甡,郭鹏程,孙照凯,王帅,刘和鑫,邵明辰,谢磊,Eng Siong Chng,肖龙帅,丰强泽,王大亮
合作单位:南京大学、南洋理工大学、华为、数据堂
论文摘要:本文总结了Interspeech 2025多语言对话语音语言模型(MLC-SLM)挑战赛,该挑战赛旨在推动构建高效的多语言对话语音大语言模型(SLLMs)的探索。我们详细介绍了MLC-SLM挑战赛的任务设置、发布的总时长约为1604小时的真实世界多语言对话语音数据集,以及供参与者使用的基线系统。MLC-SLM挑战赛吸引了来自13个国家的78支队伍参与,在两项任务中产生了489份有效的排行榜结果和14份技术报告。基于参与者的提交内容,我们提炼出了关于构建SLLMs的宝贵见解,旨在为该领域的发展贡献力量。
论文Arxiv网址:https://arxiv.org/pdf/2509.13785
作者列表:李国健,王成有,薛鸿飞,王水源,高德辉,张子晗,林宇柯,李文杰,肖龙帅,付中华,谢磊
合作单位:华为
论文摘要:全双工交互对于自然的人机交流至关重要,但由于其需要稳健的话轮转换(turn-taking)检测来判定系统何时应当说话、倾听或保持沉默,这一任务依然充满挑战。现有的解决方案要么依赖专用的话轮转换模型,但这些模型大多未开源;而少数可用的开源模型往往受限于巨大的参数量,或仅支持单一模态(如仅利用声学或语言学信息)。另一种方法是对大语言模型(LLM)基座进行微调以赋予其全双工能力,但这往往需要海量的全双工数据,而这类数据在开源领域依然十分匮乏。为了解决这些问题,我们提出了Easy Turn,一个开源的、模块化的话轮转换检测模型。该模型融合了声学和语言学的双模态信息,用于预测四种对话话轮状态:完成(complete)、未完成(incomplete)、反馈语(backchannel)和等待(wait)。此外,我们还随之发布了Easy Turn 训练集,这是一个包含 1,145 小时、专为训练话轮转换检测模型而设计的语音数据集。与 TEN Turn Detection 和 Smart Turn V2 等现有开源模型相比,我们的模型在开源的 Easy Turn 测试集上实现了最先进(SOTA)的轮次转换检测准确率。相关数据和模型已在 GitHub 上公开。
论文Arxiv网址:https://arxiv.org/abs/2509.23938
Github主页:https://github.com/ASLP-lab/Easy-Turn
Demo Page:https://aslp-lab.github.io/Easy-Turn/
论文Arxiv网址:https://arxiv.org/abs/2509.18004
开源地址:https://github.com/ASLP-lab/WenetSpeech-Chuan
Demo Page:https://aslp-lab.github.io/WenetSpeech-Chuan/
作者列表:邵明辰,穆秉甡,王成有,李海,闫影,付中华,谢磊
合作单位:爱奇艺
论文摘要:基于语音编码器、适配器和大语言模型(LLM)构建的语音大语言模型(SLLM),在英语和中文等高资源语言中展现了卓越的多任务理解性能。然而,在泰语等低资源语言中,其有效性显著降低。这种局限性主要源于三个因素:(1)现有的常用语音编码器(如 Whisper 系列)在低资源语言上表现欠佳,且缺乏对更广泛口语理解任务的支持;(2)基于自动语音识别(ASR)的对齐范式需要训练整个 SLLM,导致计算成本高昂;(3)低资源语言的语音-文本配对数据稀缺。为了克服泰语这一低资源语言面临的挑战,我们推出了XLSR-Thai,这是首个针对泰语的自监督学习(SSL)语音编码器。它是通过在 36,000 小时泰语语音数据上对标准 SSL XLSR 模型进行持续训练获得的。此外,我们提出了U-Align,这是一种语音-文本对齐方法,与典型的基于 ASR 的对齐方式相比,它更具资源效率且在多任务上更有效。最后,我们提出了Thai-SUP,这是一个利用高资源语言生成泰语口语理解数据的流程,由此构建了首个超过 1,000 小时的泰语口语理解数据集。多项实验证明了我们的方法在构建泰语多任务理解 SLLM 方面的有效性。我们将开源 XLSR-Thai 和 Thai-SUP 以促进未来的研究。
论文Arxiv网址:https://arxiv.org/abs/2509.14804
开源地址:https://huggingface.co/datasets/mcshao/Thai-understanding
作者列表:马国斌,姚继珣,宁子谦,姜月鹏,熊玲欣,谢磊†,朱鹏程†
合作单位:吉利汽车研究院
论文摘要:零样本语音转换(VC)旨在在保留语言内容的同时,将源说话人的音色迁移到任意未见过的目标说话人上。随着应用场景不断增长,模型对流式推理能力的需求日益迫切,这也促使人们亟需一种同时具备高速、轻量、高保真特性的模型。然而,现有的流式方法通常依赖自回归(AR)或非自回归(NAR)框架:前者往往需要较大的参数规模才能获得较强性能,后者则常常难以泛化到未见说话人。为此,我们提出 MeanVC,一种轻量且支持流式推理的零样本 VC 方法。MeanVC 引入了带有分块自回归去噪策略的扩散 Transformer,将 AR 与 NAR 两类范式的优势结合起来,实现高效的流式处理。通过引入 Mean Flows,MeanVC 在训练时回归平均速度场,从而能够在推理阶段通过直接从流轨迹起点映射到终点,仅用一步采样即可实现零样本 VC,并获得更优的语音质量与说话人相似度。此外,我们还引入扩散对抗式后训练以缓解过度平滑问题,进一步提升语音质量。实验结果表明,MeanVC 显著优于基线系统,在更高效率与显著更少参数量的条件下,实现了更好的转换质量。
论文Arxiv网址:https://arxiv.org/pdf/2510.08392
开源地址:https://github.com/ASLP-lab/MeanVC
样例展示:https://aslp-lab.github.io/MeanVC
作者列表:王子谦,夏咸军,黄传增,谢磊
论文摘要:本文提出了一种风格感知的两阶段框架 S²Voice,通过在自回归模型中集成 FiLM 调节和风格感知交叉注意力来增强细粒度风格建模,并引入全局说话人嵌入以改善流匹配(Flow-matching)解码器中的音色保持能力。此外,论文还构建了自动化数据处理流水线并采用了 SFT(有监督微调)结合 DPO(直接偏好优化)的训练策略。该系统在 SVCC 2025 的两个赛道(域内转换与零样本转换)中均荣获第一名,在自然度、风格相似度和歌手相似度上均表现优异。
论文Arxiv网址:https://arxiv.org/abs/2601.13629
Demo Page:https://honee-w.github.io/SVC-Challenge-Demo/
作者列表:马国斌,夏宇轩,姚继珣,薛蕙心,刘和鑫,王帅,刘灏,谢磊
合作单位:南京大学、上海音乐学院、南洋理工大学
论文摘要:本文总结了 ICASSP 2026 自动歌曲审美评估挑战赛,该挑战聚焦于预测 AI 生成歌曲的主观美学评分。挑战赛包含两个赛道:赛道 1 面向整体音乐性评分的预测,赛道 2 则聚焦于五个细粒度审美维度评分的预测。该挑战受到研究社区的广泛关注,吸引了来自学术界和工业界的大量参赛提交。表现最优的系统显著超越了官方基线,显示出在将客观度量与人类审美偏好对齐方面取得了实质性进展。挑战赛结果建立了一个标准化基准,并推动了面向现代音乐生成系统的人类对齐评估方法的发展。
论文Arxiv网址:https://arxiv.org/pdf/2601.07237
赛事官网:https://aslp-lab.github.io/Automatic-Song-Aesthetics-Evaluation-Challenge/
作者列表:赵致闲*,王水源*,李国健*,薛鸿飞*,王成有*,王帅,肖龙帅,张子晗,卜辉,徐昕,王新升,刘和鑫,Eng Siong Chng,李宏毅,李海洲,谢磊
合作单位:南京大学、华为、希尔贝壳、Soul AI lab、南洋理工大学、香港中文大学(深圳)
论文摘要:在大语言模型(LLM),特别是音频大模型(Audio-LLMs)和全能模型(Omni-models)飞速发展的推动下,口语对话系统取得了显著演进,逐步缩小了人机交互与人人交互之间的差距。要实现真正的“类人”交流,系统必须具备双重能力:一是能够感知用户情绪状态并产生共鸣的情感智能;二是能够应对动态、自然对话流(如实时话轮转换)的稳健交互机制。因此,我们在 ICASSP 2026 上发起了首届“类人口语对话系统挑战赛”(HumDial),旨在对这两种双重能力进行基准评测。本次挑战赛依托于一个源自真实人类对话的大规模数据集,建立了涵盖两个赛道的公平评估平台:(1)情感智能,侧重于长程情感理解与共情回应生成;(2)全双工交互,系统性评估“边听边说”条件下的实时决策能力。本文概括介绍了相关数据集、赛道设置以及最终结果。
论文Arxiv网址:https://arxiv.org/abs/2601.05564
