中文口语语言处理国际学术会议(International Symposium on Chinese Spoken Language Processing, ISCSLP)是国际语音通信协会中文口语语言处理特别兴趣组(ISCA SIG-CSLP)的旗舰会议,每两年举办一次。ISCSLP 2026 将于 2026 年 11 月 14–17 日在马来西亚槟城举办。

本期分享ASLP中稿的8篇论文,以下是发表论文的相关信息。

更多会议信息请见会议网站:https://iscslp.org/2026/

01

论文题目:dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition

作者列表:田文杰,穆秉甡,马国斌,耿雪龙,赵致闲,黄英刚,谢磊

合作单位:英炜智慧

论文摘要:基于大语言模型的语音识别(LLM-ASR)准是准,解码却要逐 token 自回归,延迟随句长线性上涨,实时场景很难扛。离散扩散大语言模型(dLLM)把生成改成并行迭代去噪,理论上绕开了这个瓶颈,但它是直接搬到 ASR 上会浪费算力:从纯噪声开始去噪、输出长度写死、每个 token 都走一样的步数。dLLM-ASR 把解码重构成先验引导的自适应去噪:轻量 ASR 先验初始化去噪起点、锚定输出长度;长度自适应剪枝在第一轮就删掉高置信的填充 token;置信度早停让已收敛的 token 提前退出迭代 —— 算力只花在模糊的位置上。实验里,dLLM-ASR 的 WER 与自回归 LLM-ASR 相当,推理加速 4.44 倍,在 LLM 规模的基线中取得最好的精度 - 效率权衡。

论文预印版:https://arxiv.org/abs/2601.17902


02

论文题目:DualSpecSE: A Dual-Path Speech Enhancement Network Integrating Mel and Complex Spectrograms

作者列表:李星辰,王子谦,刘子楷,朱毅可,张子晗,肖龙帅,谢磊

合作单位:华为

论文摘要:本文提出了 DualSpecSE,一种采用双路径架构、联合建模 Mel 频谱图和复数频谱图的语音增强框架,以提升 ASR 性能和语音重建质量。Mel 分支学习粗粒度的声学表征,并生成增强后的 Mel 频谱图,以直接用于 ASR,而复数分支则进一步细化细粒度的频谱细节,以实现高保真度的波形重建。在 CleanMel 的跨频带模块和窄带模块基础上,DualSpecSE 引入交互模块和融合模块,以实现两个分支之间的有效信息交换。该模型能够同时输出增强后的 Mel 频谱图和复数频谱图,而无需预训练声码器。实验结果表明,该方法在语音保真度、感知质量和 ASR 性能方面均取得了稳定的提升。代码和音频样例均已提供。

Demo page:https://github.com/StellanLi/SenSE-demo

论文预印版:https://arxiv.org/abs/2609.13911

03

论文题目:Source - Adaptive Data Curation for Bilingual NVV-Aware ASR

作者列表:曹雨昂 詹其瑞 胡景斌  张子萸 陈云翔 刘厚盾 冯溯 吴本谷 谢磊 薛浏蒙

合作单位:语图智能,媲美

论文摘要:非言语发声(Nonverbal Vocalizations, NVVs)如笑声、叹息、呼吸声和咳嗽等,承载着情感与交互信息,但传统自动语音识别(ASR)系统通常会将其丢弃。本文提出了一个面向 ISCSLP 2026 NVVSpeech Challenge Track 1 的中英双语系统,该任务要求在转录文本中同时输出词汇内容及 16 类 NVV 标签,并保持其相对位置。我们的 NVV-Aware Whisper 通过检查点兼容的词汇表重映射适配 Whisper-medium,使词汇 token 与内联 NVV 标签能够在统一的自回归序列中联合解码,而无需扩展词汇表。为了提供可靠且多样的监督信号,我们进一步提出一种源自适应数据策展策略:一方面通过声学增强和多模态大语言模型过滤来精炼公开 NVV 语料,另一方面通过自动化预处理与标注从真实媒体数据中挖掘自发 NVV。在官方双语评测协议下,所提系统将最终得分从 33.32 提升至 53.61,消融实验验证了各数据策展模块之间的互补增益。

论文预印版:https://arxiv.org/pdf/2609.09929


04

论文题目:Bridging Data, Reasoning, and Alignment: A Unified Framework for Context-Aware Instruction-Following TTS

作者列表:胡景斌,王璐宇,夏康翔,田文杰,詹其瑞,张皓宇,陈云翔,刘厚盾,谢磊,薛浏蒙

合作单位:媲美,南京大学

论文摘要:本文针对 ISCSLP 2026 CoT-TTS Challenge 中要求 TTS 系统根据对话历史首先生成 Chain-of-Thought(CoT)推理过程,再合成具有上下文适应性的语音这一任务,提出了一套系统化的优化方案。尽管官方基线采用了统一的模型架构,但其在上下文理解、指令遵循以及语音生成质量方面仍存在一定局限。为此,我们首先构建了一套完整的数据处理,利用 FullSubNet 对原始语音进行降噪,通过 Qwen3-ASR 重新转写语音文本,并借助 Qwen3.5-35B-A3B 对对话历史与 CoT 之间的一致性进行分析与筛选;同时,结合 Qwen3-TTS 与 Seed-VC 进行高质量语音数据蒸馏,并通过严格的质量过滤最终获得 545K 条高保真指令数据。在此基础上,我们进一步提出 Context-Aware Direct Preference Optimization(CA-DPO) 方法,通过级联式数据筛选策略,依次利用 ASR 预筛选、LLM 擂台赛筛选以及说话人相似度验证构建高置信度的偏好数据对,并在 DPO 训练过程中显式强化 “Context → CoT → Speech” 三者之间的整体一致性,从而提升模型对上下文信息的理解能力、CoT 推理与语音表达之间的对齐能力以及最终的指令执行效果。此外,我们构建了一套针对 CoT-TTS 任务的独立评测方案,包括 500 条测试样本以及基于 LLM-as-Judge 的自动评测框架,从推理能力与语音执行一致性两个层面分别评价模型性能。实验结果表明,经过上述数据处理、数据蒸馏与偏好对齐策略优化后,所提出系统在客观和主观评价指标上均显著优于官方基线,验证了所提出的数据处理与上下文感知偏好优化方法在提升 Context → CoT → Speech 全链路一致性以及上下文感知语音生成能力方面的有效性。

Demo page: https://hujingbin1.github.io/CoT-TTS-Demo-Page/

论文预印版:https://arxiv.org/pdf/2609.14740

05

论文题目:Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation

作者列表:胡景斌,詹其瑞,曹雨昂,张子萸,陈云翔,刘厚盾,冯溯,吴本谷,谢磊,薛浏蒙

合作单位:语图智能,媲美,南京大学

论文摘要:本文提出了一种基于大规模音频语言模型(Large Audio-Language Model, LALM)反馈的偏好优化框架,用于提升连续自回归语音模型对非言语声音(Non-Verbal Vocalization, NVV)的可控生成能力。针对 NVV 生成中高质量偏好数据获取成本高、传统监督数据难以刻画复杂听感偏好等问题,我们在无需人工偏好标注的情况下,通过将包含 NVV 的真实语音转录文本与大语言模型生成的语义对齐 Prompt 相结合,构建双语 NVV Prompt 语料库,并采用随机模型 Rollout 生成同一 Prompt 下的多个候选语音,再利用 LALM 对候选语音进行自动评估与排序,从而构建 chosen–rejected 偏好样本对。在此基础上,我们设计了一种两阶段的偏好优化策略:首先采用 Rejection Sampling Fine-Tuning(RSFT),利用 LALM 筛选出的高质量候选语音对模型进行监督微调,使模型充分学习优选样本中的 NVV 生成模式;随后提出 Anchored Flow-DPO,基于 utterance-level Flow Matching loss 构建成对偏好优化目标,在无需显式计算序列似然的情况下实现 DPO 的偏好学习,同时保留 chosen 样本的 Flow Matching 训练目标作为 SFT anchor,以增强训练稳定性并避免偏好优化过程中模型生成能力的过度偏移。实验结果表明,在官方 NVVSpeech Challenge Track 2 的 1,600 条测试集上,所提出方法取得了 75.80 的 Final Track2Score,其中中文和英文分别达到 79.39 和 72.21,相比 VoxCPM2 baseline 提升 1.84 分。进一步分析表明,性能提升主要来源于 NVV Accuracy 和 NVV Perceptual Effect 的显著改善,同时 Overall Quality 基本保持稳定,验证了所提出的 LALM 自动偏好数据构建与两阶段偏好优化策略对于提升连续自回归语音模型 NVV 可控生成能力的有效性。

Demo page: https://hujingbin1.github.io/NVV-TTS-Demo-Page/

论文预印版:https://arxiv.org/pdf/2609.11260

06

论文题目:X-Pred MeanFlow for Streaming Token-to-Mel Speech Decoding

作者列表:解晗轲、任夏明、詹其瑞、胡景斌、李文豪、张皓宇、尤若楠、王成有、陈云翔、刘厚盾、冯溯、谢磊

合作单位:媲美

论文摘要:本文针对离散语音 toke@n 生成范式中流式对话场景下的 token-to-mel 声学解码效率瓶颈——flow-matching 解码器质量高但依赖多步采样,MeanFlow 虽将采样步数压缩至极少步,却在极低 NFE 下难以保持声学细节——提出 X-Pred MeanFlow,一个面向流式合成的少步 token-to-mel 解码器。我们首先将 MeanFlow 以 mel 空间预测的形式重参数化:解码器直接预测广义 mel 场,并由解析关系反推出采样所需的平均速度,在完整保留 MeanFlow 恒等式与采样流程的同时,为解码器提供直接的声学预测目标,缓解了速度场监督下声学细节收敛缓慢的问题。进一步地,我们提出层级选择性块掩码注意力:将 token 与 mel 序列按时间对齐分块,在不同 DiT 层上分别配置历史块与未来块预算,使大部分层聚焦当前块内的局部声学细化,仅由少量层跨块交换有界上下文,从而在有界感受野与可控 look-ahead 之间取得平衡,并支持严格流式与有界前瞻流式两种模式;配合滑动窗口的 packet 级推理,使每包计算量与显存占用不随生成序列长度增长。我们在 Emilia 语料上训练了 159M(Small)与 341M(Base)两个规模的 DiT 解码器,采用 S3Tokenizer v2 语义 token 与固定 HiFi-GAN 声码器,统一 2.0M 更新预算与 CFG-aware 训练。实验表明,在 2/3 NFE 设置下 X-Pred 在 UTMOS、说话人相似度(SIM)与词错误率(WER)上全面优于 Direct-uMeanFlow,且 Small 规模 X-Pred 的自然度超过 Base 规模 Direct-u;流式评测中,层级选择性有界上下文(LS-Bounded)在 3 NFE 下取得 3.310 UTMOS 与 0.543 RTF,在数百秒音频上实现零超时、稳定的包级实时声学解码。

论文预印版:https://arxiv.org/pdf/2609.12728

07

论文题目:Modeling, Scaling, and Decoding: Optimizing Controllable Speech Generation with Nonverbal Vocalizations

作者列表:张子萸、陈韵、王太辉、李函昭、谢启聪、陈日林、赵致闲

论文摘要:非语言发声(nonverbal vocalizations,NVVs)的可控合成对于实现自然且富有表现力的语音至关重要,但由于 NVV 在声学表现上具有高度多样性,且其在现有语料库中的分布严重不均衡,这一任务仍面临较大挑战。为解决这些问题,我们构建了一套 NVV-aware DiTAR 系统。该系统对连续语音潜在表征进行建模,将 16 个目标 NVV 类别编码为专用 token,并对终止预测机制进行适配,使其能够区分话语中间出现的非语言发声与真正的话语边界。在训练阶段,我们首先利用包含多样化 NVV 语音的大规模双语数据进行预训练,随后在经过定向合成数据增强和频率感知重平衡处理的语料库上继续开展有监督微调。在推理阶段,我们对声学提示进行选择,调节语言模型引导与噪声注入的强度,并采用结合多指标筛选的 Best-of-N 采样策略,以减少生成失败。最终系统取得了 62.786 的官方加权双语得分,在 ISCSLP 2026 NVVSpeech Challenge Track 2 的参赛系统中,普通话赛道排名第一、英语赛道排名第二,并获得综合排名第一。消融实验表明,定向数据增强对数据稀缺的 NVV 类别提升最为显著;与此同时,要实现稳健的候选样本筛选,需要在 NVV 正确性、词汇忠实度和感知质量之间取得平衡。

论文预印版:https://arxiv.org/abs/2609.14231

08

论文题目:Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge

作者列表:贾尚岳,马婧茹,李仰卓,骆道平,田博文,卢汉宸,任文泽,陈云翔,刘厚盾,冯溯,谢磊,薛浏蒙

合作单位: 媲美,台大,北理工

论文摘要:非语言发声(non-verbal vocalizations,NVVs)承载着重要的副语言信息,但传统自动语音识别(ASR)系统往往会忽略这类信息。ISCSLP NVVSpeech Challenge 要求在监督数据有限且类别分布高度不均衡的条件下,对词汇内容和 16 类 NVV 进行联合转录。为解决这一问题,我们提出了一套以数据为中心的 NVV-aware ASR 流程,主要包括跨数据集标签统一和两阶段采样策略。我们首先将不同来源数据中的异构标签映射至官方标签体系,并剔除无法可靠映射的样本。在训练阶段,首先采用平方根类别采样以缓解长尾分布问题,随后使用类别均匀采样进行微调。在本地验证集上,平方根类别采样在所测试的单阶段设置中取得了最佳表现。最终,两阶段系统取得了 63.86 的官方得分,并在 Track 1 中排名第四。

论文预印版:https://arxiv.org/abs/2609.23462