INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。
INTERSPEECH 2023 论文预讲会第五期邀请到上海师范大学进行专场分享,欢迎大家预约观看。

下面是预讲会的回顾
王雪菲
分享主题:Multi-pass Training and Cross-information Fusion for Low-resource End-to-end Accented Speech Recognition
摘要:低资源重口音语音识别是当前ASR技术在实际应用中面临的重要挑战之一。在这项研究中,我们提出了一个基于Conformer的架构,称为Aformer,以利用大量非口音和有限口音训练数据的声学信息。在Aformer中设计了一个普通编码器和一个口音编码器来提取互补的声学信息。此外,我们使用多通道的方式训练Aformer,并研究了三种交叉信息融合方法,以有效地结合来自一般编码器和口音编码器的信息。结果表明,在六个域内和域外口音测试集上,我们提出的方法优于强大的Conformer基线,词/字错误率相对减少了10.2%到24.5%。
李黎
分享主题:Phonetic-assisted Multi-Target Units Modeling for Improving Conformer-Transducer ASR system摘要:在端到端的自动语音识别(ASR)中,开发有效的目标建模单元是非常重要的,也是大家一直关注的问题。我们提出一种语音辅助的多目标单元(PMU)建模方法,以渐进式表征学习的方式增强Conformer-Transducer ASR系统。具体来说,PMU首先使用语音辅助子词建模(PASM)和字节对编码(BPE)分别产生语音诱导和文本诱导的目标单元;在此基础上,我们提出了三种增强声学编码器的框架,包括基本PMU、paraCTC和paCTC,它们集成了不同层次的PASM和BPE单元,用于CTC和transducer多任务训练。在LibriSpeech和口音ASR测试集上的实验结果表明,与传统的BPE相比,提出的PMU方法显著降低了LibriSpeech clean、other和6个重音ASR测试集的WER,分别降低了12.7%、6.0%和7.7%。
INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。
为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿方式
投稿邮箱:jack@speechhome.com
联系人微信
