近日,IEEE 国际声学、语音与信号处理会议(ICASSP 2026)公布了论文录用结果。本期分享西工大音频语音与语言处理研究组(ASLP@NPU)中稿的8篇论文,涉及智能语音处理领域的众多研究方向。以下是本届会议发表论文的相关信息,附带论文原文链接,与大家分享。


01、Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods

作者列表:穆秉甡,郭鹏程,孙照凯,王帅,刘和鑫,邵明辰,谢磊,Eng Siong Chng,肖龙帅,丰强泽,王大亮

合作单位:南京大学、南洋理工大学、华为、数据堂

论文摘要:本文总结了Interspeech 2025多语言对话语音语言模型(MLC-SLM)挑战赛,该挑战赛旨在推动构建高效的多语言对话语音大语言模型(SLLMs)的探索。我们详细介绍了MLC-SLM挑战赛的任务设置、发布的总时长约为1604小时的真实世界多语言对话语音数据集,以及供参与者使用的基线系统。MLC-SLM挑战赛吸引了来自13个国家的78支队伍参与,在两项任务中产生了489份有效的排行榜结果和14份技术报告。基于参与者的提交内容,我们提炼出了关于构建SLLMs的宝贵见解,旨在为该领域的发展贡献力量。

论文Arxiv网址:https://arxiv.org/pdf/2509.13785


02、Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

作者列表:李国健,王成有,薛鸿飞,王水源,高德辉,张子晗,林宇柯,李文杰,肖龙帅,付中华,谢磊

合作单位:华为

论文摘要:全双工交互对于自然的人机交流至关重要,但由于其需要稳健的话轮转换(turn-taking)检测来判定系统何时应当说话、倾听或保持沉默,这一任务依然充满挑战。现有的解决方案要么依赖专用的话轮转换模型,但这些模型大多未开源;而少数可用的开源模型往往受限于巨大的参数量,或仅支持单一模态(如仅利用声学或语言学信息)。另一种方法是对大语言模型(LLM)基座进行微调以赋予其全双工能力,但这往往需要海量的全双工数据,而这类数据在开源领域依然十分匮乏。为了解决这些问题,我们提出了Easy Turn,一个开源的、模块化的话轮转换检测模型。该模型融合了声学和语言学的双模态信息,用于预测四种对话话轮状态:完成(complete)、未完成(incomplete)、反馈语(backchannel)和等待(wait)。此外,我们还随之发布了Easy Turn 训练集,这是一个包含 1,145 小时、专为训练话轮转换检测模型而设计的语音数据集。与 TEN Turn Detection 和 Smart Turn V2 等现有开源模型相比,我们的模型在开源的 Easy Turn 测试集上实现了最先进(SOTA)的轮次转换检测准确率。相关数据和模型已在 GitHub 上公开。

论文Arxiv网址:https://arxiv.org/abs/2509.23938

Github主页:https://github.com/ASLP-lab/Easy-Turn

Demo Page:https://aslp-lab.github.io/Easy-Turn/


03、WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
作者列表:戴宇航*,张子萸*,王帅,李龙豪,郭钊,左天伦,王水源,薛鸿飞,王成有,王晴,徐昕、卜辉、李杰、康健、张彬彬,谢磊
合作单位:希尔贝壳,中国电信人工智能研究院(TeleAI),南京大学,WeNet开源社区
论文摘要:大规模开源方言数据的匮乏严重阻碍了语音技术的发展,对于使用广泛的四川方言而言,这一挑战尤为严峻。为了弥补这一关键缺口,我们推出了 WenetSpeech-Chuan,这是一个包含 10,000 小时语音、标注丰富的语料库,它基于我们独创的 Chuan-Pipeline 构建而成。Chuan-Pipeline 是一个完整的方言语音数据处理框架。为了便于进行严格的评估并展示语料库的有效性,我们还发布了高质量的
ASR 和TTS基准测试数据集 WenetSpeech-Chuan-Eval,其中包含人工验证的转录文本。实验表明,基于 WenetSpeech-Chuan 训练的模型在开源系统中达到了最先进的性能,并且其结果与商业系统相当。作为最大的四川方言开源语料库,WenetSpeech-Chuan 不仅降低了方言语音处理研究的门槛,而且在促进人工智能公平性和减少语音技术中的偏见方面发挥着至关重要的作用。语料库、基准测试、模型和收据均可在我们的项目页面上公开获取。

论文Arxiv网址:https://arxiv.org/abs/2509.18004

开源地址:https://github.com/ASLP-lab/WenetSpeech-Chuan

Demo Page:https://aslp-lab.github.io/WenetSpeech-Chuan/


04、Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

作者列表:邵明辰,穆秉甡,王成有,李海,闫影,付中华,谢磊

合作单位:爱奇艺

论文摘要:基于语音编码器、适配器和大语言模型(LLM)构建的语音大语言模型(SLLM),在英语和中文等高资源语言中展现了卓越的多任务理解性能。然而,在泰语等低资源语言中,其有效性显著降低。这种局限性主要源于三个因素:(1)现有的常用语音编码器(如 Whisper 系列)在低资源语言上表现欠佳,且缺乏对更广泛口语理解任务的支持;(2)基于自动语音识别(ASR)的对齐范式需要训练整个 SLLM,导致计算成本高昂;(3)低资源语言的语音-文本配对数据稀缺。为了克服泰语这一低资源语言面临的挑战,我们推出了XLSR-Thai,这是首个针对泰语的自监督学习(SSL)语音编码器。它是通过在 36,000 小时泰语语音数据上对标准 SSL XLSR 模型进行持续训练获得的。此外,我们提出了U-Align,这是一种语音-文本对齐方法,与典型的基于 ASR 的对齐方式相比,它更具资源效率且在多任务上更有效。最后,我们提出了Thai-SUP,这是一个利用高资源语言生成泰语口语理解数据的流程,由此构建了首个超过 1,000 小时的泰语口语理解数据集。多项实验证明了我们的方法在构建泰语多任务理解 SLLM 方面的有效性。我们将开源 XLSR-Thai 和 Thai-SUP 以促进未来的研究。

论文Arxiv网址:https://arxiv.org/abs/2509.14804

开源地址:https://huggingface.co/datasets/mcshao/Thai-understanding


05、MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

作者列表:马国斌,姚继珣,宁子谦,姜月鹏,熊玲欣,谢磊†,朱鹏程†

合作单位:吉利汽车研究院

论文摘要:零样本语音转换(VC)旨在在保留语言内容的同时,将源说话人的音色迁移到任意未见过的目标说话人上。随着应用场景不断增长,模型对流式推理能力的需求日益迫切,这也促使人们亟需一种同时具备高速、轻量、高保真特性的模型。然而,现有的流式方法通常依赖自回归(AR)或非自回归(NAR)框架:前者往往需要较大的参数规模才能获得较强性能,后者则常常难以泛化到未见说话人。为此,我们提出 MeanVC,一种轻量且支持流式推理的零样本 VC 方法。MeanVC 引入了带有分块自回归去噪策略的扩散 Transformer,将 AR 与 NAR 两类范式的优势结合起来,实现高效的流式处理。通过引入 Mean Flows,MeanVC 在训练时回归平均速度场,从而能够在推理阶段通过直接从流轨迹起点映射到终点,仅用一步采样即可实现零样本 VC,并获得更优的语音质量与说话人相似度。此外,我们还引入扩散对抗式后训练以缓解过度平滑问题,进一步提升语音质量。实验结果表明,MeanVC 显著优于基线系统,在更高效率与显著更少参数量的条件下,实现了更好的转换质量。

论文Arxiv网址:https://arxiv.org/pdf/2510.08392

开源地址:https://github.com/ASLP-lab/MeanVC

样例展示:https://aslp-lab.github.io/MeanVC


06、S²Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

作者列表:王子谦,夏咸军,黄传增,谢磊

论文摘要:本文提出了一种风格感知的两阶段框架 S²Voice,通过在自回归模型中集成 FiLM 调节和风格感知交叉注意力来增强细粒度风格建模,并引入全局说话人嵌入以改善流匹配(Flow-matching)解码器中的音色保持能力。此外,论文还构建了自动化数据处理流水线并采用了 SFT(有监督微调)结合 DPO(直接偏好优化)的训练策略。该系统在 SVCC 2025 的两个赛道(域内转换与零样本转换)中均荣获第一名,在自然度、风格相似度和歌手相似度上均表现优异。

论文Arxiv网址:https://arxiv.org/abs/2601.13629

Demo Page:https://honee-w.github.io/SVC-Challenge-Demo/


07、The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge

作者列表:马国斌,夏宇轩,姚继珣,薛蕙心,刘和鑫,王帅,刘灏,谢磊

合作单位:南京大学、上海音乐学院、南洋理工大学

论文摘要:本文总结了 ICASSP 2026 自动歌曲审美评估挑战赛,该挑战聚焦于预测 AI 生成歌曲的主观美学评分。挑战赛包含两个赛道:赛道 1 面向整体音乐性评分的预测,赛道 2 则聚焦于五个细粒度审美维度评分的预测。该挑战受到研究社区的广泛关注,吸引了来自学术界和工业界的大量参赛提交。表现最优的系统显著超越了官方基线,显示出在将客观度量与人类审美偏好对齐方面取得了实质性进展。挑战赛结果建立了一个标准化基准,并推动了面向现代音乐生成系统的人类对齐评估方法的发展。

论文Arxiv网址:https://arxiv.org/pdf/2601.07237

赛事官网:https://aslp-lab.github.io/Automatic-Song-Aesthetics-Evaluation-Challenge/


08、The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era

作者列表:赵致闲*,王水源*,李国健*,薛鸿飞*,王成有*,王帅,肖龙帅,张子晗,卜辉,徐昕,王新升,刘和鑫,Eng Siong Chng,李宏毅,李海洲,谢磊

合作单位:南京大学、华为、希尔贝壳、Soul AI lab、南洋理工大学、香港中文大学(深圳)

论文摘要:在大语言模型(LLM),特别是音频大模型(Audio-LLMs)和全能模型(Omni-models)飞速发展的推动下,口语对话系统取得了显著演进,逐步缩小了人机交互与人人交互之间的差距。要实现真正的“类人”交流,系统必须具备双重能力:一是能够感知用户情绪状态并产生共鸣的情感智能;二是能够应对动态、自然对话流(如实时话轮转换)的稳健交互机制。因此,我们在 ICASSP 2026 上发起了首届“类人口语对话系统挑战赛”(HumDial),旨在对这两种双重能力进行基准评测。本次挑战赛依托于一个源自真实人类对话的大规模数据集,建立了涵盖两个赛道的公平评估平台:(1)情感智能,侧重于长程情感理解与共情回应生成;(2)全双工交互,系统性评估“边听边说”条件下的实时决策能力。本文概括介绍了相关数据集、赛道设置以及最终结果。

论文Arxiv网址:https://arxiv.org/abs/2601.05564

赛事官网:https://aslp-lab.github.io/HumDial-Challenge/