INTERSPEECH 2026 论文预讲会由中国中文信息学会、CCF语音对话与听觉专委会、深圳市人工智能学会、语音之家发起,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2026 录用论文的作者进行报告交流。

INTERSPEECH 2026 论文预讲会第七期邀请到新西兰惠灵顿维多利亚大学工程与计算机科学学院的徐亮和北京理工大学的孟柏杨做本次会议的分享,欢迎大家观看。

第七期-个人联合专场

时间:7月20日(周一)19:00 ~ 20:00

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)

时间报告主题报告人
19:00-19:30基于漂移模型的语音增强徐亮
19:30-20:00以相似性为证据:面向鼾声分类的可解释孪生网络框架孟柏杨

嘉宾&主题

嘉宾简介:徐亮,现就读于新西兰惠灵顿维多利亚大学工程与计算机科学学院,博士生二年级,研究方向为语音增强与生成式建模。

报告题目:基于漂移模型的语音增强( Speech Enhancement Based on Drifting Models)

摘要:我们提出了 DriftSE,一种基于漂移模型(Drifting Models)的新型生成式语音增强框架,将去噪问题建模为一个动态平衡过程。与依赖多步迭代采样的传统扩散模型不同,DriftSE 通过在训练阶段演化映射函数的前向推送分布(pushforward distribution),使其直接收敛至干净语音分布,从而支持一步推理。这一演化过程由一个可学习的"漂移场"(Drifting Field)驱动,该校正向量引导样本向干净语音分布的高密度区域移动,同时该机制天然支持基于非配对数据的训练,因为其匹配的是分布层面而非逐样本的配对关系。我们在两种建模方式下研究了该框架:一是从带噪观测直接映射,二是从高斯先验出发的随机条件生成模型。在 VoiceBank-DEMAND 基准数据集上的实验表明,DriftSE 能够在单步推理中实现高保真度的语音增强效果,性能优于多步扩散基线方法,为语音增强任务确立了一种新的建模范式。

论文链接:https://arxiv.org/abs/2604.24199

代码链接:https://github.com/LiangXu123/DriftSE

Demo链接:https://liangxu123.github.io/driftse/

嘉宾简介:孟柏杨,北京理工大学计算机科学与技术专业本科生,主要研究方向包括医学音频分析、小样本学习和可解释人工智能。目前参与鼾声智能分析相关研究,关注如何利用深度学习模型识别不同上气道阻塞部位对应的鼾声特征。

报告题目:以相似性为证据:面向鼾声分类的可解释孪生网络框架(Similarity as Evidence: An Explainable Siamese Framework for Snore Sound Classification)

摘要:鼾声中包含与上气道阻塞位置相关的声学信息,但不同类型鼾声之间差异较小,同时部分类型样本数量有限,使得传统分类模型较难获得稳定结果。本报告介绍一种基于孪生网络的鼾声分类方法,通过度量学习构建具有区分性的声音嵌入空间,并利用类别中心和相似支持样本完成分类。该方法不仅能够给出预测结果,还可以展示与待测鼾声较为相似的参考样本,并结合激活可视化帮助理解模型的判断依据。实验在包含软腭、口咽侧壁、舌根和会厌四类鼾声的数据集上进行,结果表明,类别中心分类方法的宏平均召回率达到0.638,优于Softmax分类头及部分传统基线方法。最后,报告还将介绍模型设计、实验结果、可视化分析以及目前存在的局限和后续研究方向。

参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看

👇👇👇

预讲会征集

INTERSPEECH 2026  论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。

为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2026 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。