INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。
INTERSPEECH 2023 论文预讲会 - 第九期邀请到武汉大学国家多媒体软件工程技术研究中心和昆山杜克大学语音及多模态智能信息处理实验室进行联合专场分享,欢迎大家预约观看。

下面是预讲会的回顾:
分享主题:A Snoring Sound Dataset for Body Position Recognition: Collection, Annotation, and Analysis
摘要:阻塞性睡眠呼吸暂停低通气综合征 (Obstructive Sleep Apnea-Hypopnea Syndrome,OSAHS)是一种由上呼吸道阻塞引起的慢性呼吸障碍。打鼾是OSAHS的一个突出症状,以前的研究试图通过鼾声来定位上呼吸道的阻塞部位。尽管取得了一些进展,但由于睡眠体位对上呼吸道结构的影响,阻塞部位的识别在临床环境中仍然具有挑战性。为了应对这一挑战,本文提出了一个基于鼾声的睡眠体位识别数据集(SSBPR),该数据集由 7570 个鼾声片段组成,其中包含六个不同的睡眠体位标签:仰卧、仰卧但头偏左、仰卧但头偏右、左侧卧、右侧卧和俯卧。实验结果表明,鼾声表现出某些声学特征,使其能够有效地用来识别现实场景中睡姿。
郑友强
摘要:最近,基于神经网络的语音编解码器表现出比传统方法更好的性能。然而,在将传统编解码器与神经声码器结合的编解码器架构中,传统参数量化中的冗余现象在其中是可见的。在本文中,我们提出了一种名为CQNV的新颖框架,将传统参数编码器的粗量化参数与神经声码器结合,以降低比特率,并提高解码后语音的质量。此外,我们在神经声码器中引入了一个参数处理模块,以增强传统语音编码参数的比特流在神经声码器中的应用,进一步提高重构语音的质量。在实验中,我们进行了主观和客观评估,结果显示了所提出的CQNV框架的有效性。具体而言,我们的方法在1.1 kbps的比特率下可以实现比Lyra和Encodec在3 kbps下更高质量的重构语音。
张轶群
论文链接:https://arxiv.org/abs/2307.13888
王兴明
摘要:很多语音信号处理系统的准确性和可靠性在噪声环境下往往会极具下降。本文讨论了在噪声环境中的鲁棒伪造语音检测方法构建。首先,我们尝试使用预训练的语音增强模型作为前端模型,并构建级联系统。然而实验结果表明,独立的增强模型降噪过程可能会扭曲语音合成系统产生的伪影或抹除包含在语音中的与伪造相关信息,最终导致整体伪造语音检测性能下降。因此,本文尝试构建了将前端语音增强模块与后端伪造检测模块联合的训练框架,在训练过程中同时使用交叉熵与均方差损失函数同时优化整体结构,实现对噪声场景的鲁棒伪造语音检测模型设计。本文所提出的联合训练框架在带噪场景的ASVSpoof 2019 LA数据集和FAD数据集上均验证了比朴素的伪造语音检测后端更加有效。此外,本文还提出了一种交叉联合训练方案,使单个模型的性能可以达到不同模型得分融合的结果,从而使联合框架更加有效和高效。
曾邦
摘要:主流的目标说话人分离方法使用目标人的声纹embedding作为参考信息。获取声纹embedding的方式主要有两种:一是使用预训练的说话人识别模型进行声纹提取,二是采用多任务学习联合训练说话人识别模型来提取声纹。然而,由这两种方案的声纹提取模块在训练时都需要考虑说话人的分类损失,所提取的声纹embedding对于目标说话人分离任务可能并不是最优的。本文提出一种新颖的、不依赖于声纹embedding的时域目标说话人分离网络SEF-Net。SEF-Net在Transformer解码器中使用跨多头注意力来隐式地学习注册语音的Conformer编码输出中的说话人信息并进行目标说话人分离。实验结果表明,SEF-Net与其他主流目标说话人提取模型相比具有可比性的性能。SEF-Net为在不使用预训练说话人识别模型或说话人识别损失函数的情况下进行目标说话人提取提供了新的可行方案。
章羽聪
摘要:本文提出了一种异常声音检测方法。通过多任务学习方法将异常样本曝光(outlier exposure)和内部建模(inlier modeling)融合在一个统一的框架内。基于异常样本曝光的方法可以有效地提取特征,但不具有很好的鲁棒性。内部建模能够生成鲁棒的特征,但这些特征的异常检测效果并不理想。为了弥补彼此的不足,一些串行和并行方法被提出来将这两种方法结合起来,但都可能会增加额外的步骤完成模型的建模,对于模型日后的训练和维护都带来不便。为了克服这些限制,我们使用多任务学习训练一个基于Conformer的编码器,用于异常感知的内部建模。此外,我们的方法在进行推理的时候考虑了多尺度的异常打分,可以更加全面的评估异常值。在MIMII和DCASE 2020任务2数据集上的实验结果表明,我们的方法优于最先进的单模型系统,并且与比赛中排名靠前的多系统集成模型有相当的能力。
论文链接:https://sites.duke.edu/dkusmiip/files/2023/07/zhang23_interspeech.pdf

为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿方式
投稿邮箱:jack@speechhome.com
联系人微信

