INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。

INTERSPEECH 2023 论文预讲会第七期邀请到厦门大学智能语音实验室进行专场分享,欢迎大家预约观看。



下面是预讲会的回顾:

王峰

分享主题:Conformer-based Language Embedding with Self-Knowledge Distillation for Spoken Language Identification

摘要:基于 Conformer 的结构已被证明可以有效提高语种识别(LID)的性能。然而,当对短语音片段进行语种识别时,经常会观察到性能的显著下降。在本文中,我们提出了一种新方法来缓解这个问题:通过在基于 Conformer 的 LID 架构中引入自蒸馏技术。实验结果显示该方法在16,000 Hz 采样率的 OLR21 和 8,000 Hz 采样率的 LRE22数据集上都有效。本文提出的方法增强了短时语音片段的语种识别性能。

黄凌烟

分享主题:Cross-Modal Semantic Alignment before Fusion for Two-Pass End-to-End Spoken Language Understanding
摘要:两阶段模型同时结合语音和语义信息,可以有效地改善端到端口语理解(E2E SLU)的性能。然而现有的两阶段模型通常只是简单地融合了语音和文本嵌入,没有考虑过语音和文本两个模态之间存在的固有差异。我们提出了一种融合前跨模态语义对齐(CSAF)方法,引入了一个共享语义记忆模块将两个模态的嵌入映射到同一语义空间,并使用一个多模态门控网络来生成融合的嵌入。我们在FSC Challenge和SLURP两个数据集上进行了实验,结果表明我们的方法能显著提高意图识别准确率。

管文豪

分享主题:Interpretable Style Transfer for Text-to-Speech with ControlVAE and Diffusion Bridge
摘要:随着对自主控制和个性化的语音生成的需求,语音中的风格控制和转换变得越来越重要。在本文中,我们提出了一种新的语音合成系统,该系统可以以可解释性和高保真度进行风格转换。系统通过结合变分自编码器和扩散细化器来获得细化后的梅尔谱。其次,通过设计VQVAE的扩散桥,以有效地学习复杂的离散风格表示,并提高风格转换的性能。同时我们引入ControlVAE来提高重建质量,并同时具有良好的可解释性。最终的实验表明了我们方法的有效性。


论文征集
INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。


投稿方式

投稿邮箱:jack@speechhome.com


联系人微信