INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。
INTERSPEECH 2023 论文预讲会第一期邀请到清华大学和新疆大学进行联合专场分享,欢迎大家预约观看。

下面是预讲会的回顾:
方志华
分享主题:对抗噪声标签的鲁棒说话人识别
张剑
高虞安
李睿
摘要:由于缺乏训练数据以及口音与说话人和区域特征纠缠在一起,口音识别 (AR) 具有挑战性。本文旨在从两个角度提高 AR 性能。首先,为了缓解数据不足的问题,我们使用从预训练模型中提取的自我监督学习表示 (SSLR) 来构建 AR 模型。在 SSLRs 的帮助下,与传统的声学特征相比,它获得了显着的性能提升。其次,我们提出了一种持久性口音记忆(PAM)作为上下文知识来偏置 AR 模型。AR 模型的编码器从所有训练数据中提取的重音嵌入被聚类以形成重音码本,即 PAM。此外,我们提出了多种注意机制来研究 PAM 的最佳利用。我们观察到,通过选择最相关的重音嵌入可以获得最佳性能。
宋志达
摘要:主流的说话人验证系统在训练阶段通常使用one-hot编码的全连接(FC)层进行分类。假设使用一个大规模数据集(包含百万甚至更多说话人)进行训练,FC层参数的优化将占用大量内存和时间。本文中,我们提出使用动态全连接(Dynamic FC)层替换FC层。Dynamic FC层使用一个动态类队列存储说话人伪身份中心的一个子集。该层的内存占用仅取决于动态类队列的大小,不会随着训练数据集中说话人的数量增加而增加。此外,我们采用了一种基于身份的数据加载机制使得训练时间进一步节省。在VoxCeleb数据集上的实验结果表明,Dynamic FC层使用较少的参数数目就可以获得不错的性能。

为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿方式
投稿邮箱:jack@speechhome.com
联系人微信

