INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。
INTERSPEECH 2023 论文预讲会 - 第十期邀请到西北工业大学音频语音与语言处理研究组(NPU-ASLP)进行专场分享,本期是NPU-ASLP的第二场,研究方向是语音识别与说话人识别,欢迎大家预约观看。

下面是预讲会的回顾:
黄凯勋
分享主题:基于热词短语预测网络的热词语音识别
摘要:上下文信息在语音识别技术中起着至关重要的作用,将其纳入端到端语音识别模型在近期引起了广泛关注。然而,以往的深度偏置(Deep Biasing)方法在偏置任务方面缺乏明确的监督。本文为基于注意力的深度偏置方法引入了一种上下文短语预测网络,该网络利用上下文嵌入来预测话语中的上下文短语,并通过计算偏置损失来辅助深度偏置模型的训练。本文方法在各种端到端语音识别模型中实现了显著的词错误率(WER)降低。在LibriSpeech语料库上的实验证明,本文提出的模型相对于基线模型实现了12.1%的相对WER改进,上下文短语的WER相对减少了40.5%。此外,通过应用上下文短语过滤策略,我们还有效地避免了使用更大的偏置列表时WER的攀升。徐天翼
分享主题:基于Transducer的流式自适应热词语音识别摘要:深度偏置(Deep Biasing)方法能纳入额外的上下文信息,是个性化词汇语音识别的一个有效解决方案。然而,对于工业应用的语音助手来说,总是偏重于这种具有高预测分数的个性化词汇会大大降低识别普通词汇的性能。为了解决这个问题,我们提出了一种基于Context-Aware Transformer Transducer for Speech Recognition(CATT)的自适应改进,利用偏置编码器和预测器嵌入来对上下文短语的出现进行流式预测。这种预测被用来动态地控制热词列表的开关,使该模型能够适应个性化和普通场景。在Librispeech和内部语音助手数据集上的实验表明,对于非热词场景与基线相比,我们的方法可以分别实现6.7%和20.7%的WER和CER的相对减少,在英文和中文测试集上可以缓解96.7%和84.9%的相对WER和CER的增加。此外,我们的方法尽可能地降低了在个性化场景中的性能影响,同时保持了transducer流式推理流程。梁宇颢
分享主题:多说话人语音识别中可感知边界的序列化输出训练摘要:最近提出的序列化输出训练(SOT)通过一个特殊标记分隔不同说话人的讲话内容,简化了多说话人自动语音识别(ASR)的流程。然而频繁的说话人切换会使切换点的预测变得困难。为了解决这个问题,我们提出了可感知边界的序列化输出训练(BA-SOT),它通过说话人切换检测任务和边界约束损失明确地将边界知识纳入解码器。我们还引入了一个两阶段的CTC策略,使用字符级的SOT CTC恢复时间背景信息。除了常用的字符错误率(CER),我们还引入了句子相关的字符错误率(UD-CER)来进一步衡量说话人切换预测的精度。与原始SOT相比,BA-SOT的CER/UD-CER相对降低了5.1%/14.0%,利用预训练的ASR模型对BA-SOT模型初始化,可以将CER/UD-CER进一步降低8.4%/19.9%。薛鸿飞
分享主题:跨语言语音识别中基于联合语音表征学习的音素到词转码器摘要:UniSpeech通过使用多任务自监督学习明确地将潜在表征与音素单元对齐,在跨语言自动语音识别(ASR)方面取得了优秀的性能。然而,尽管学习到的这些潜在表征可以从高资源语言迁移到低资源语言,但直接从这些音素相关表征预测单词在下游ASR中仍然具有挑战性。本文提出了TranUSR,一个由预训练的UniData2vec和一个从音素到字词的Transcoder组成的两阶段模型。首先,与UniSpeech不同,UniData2vec使用来自教师模型的连续和上下文表征代替离散的量化表征,进行音素感知的预训练,从而提高了提取跨语言特征的能力。然后,在额外的文本帮助下,Transcoder学习将音素后验概率翻译成字词,使模型能够直接生成字词。在Common Voice数据集上的实验表明,与UniSpeech相比,UniData2vec降低了5.3%的音素错误率(PER),而Transcoder相比于字素微调则获得了14.4%的相对词错误率(WER)下降。王晴
分享主题:基于伪孪生网络的音色保留的说话人识别黑盒对抗攻击摘要:本文提出了一种用于说话人识别的音色保留的对抗性攻击方法,不仅可以利用声纹模型的弱点,还可以在黑盒攻击条件下保留目标说话人的音色。具体来说,我们通过在语音转换模型的训练过程中添加一个对抗性约束条件来生成保留目标说话人音色的假音频。我们利用一个伪孪生网络结构从黑盒声纹模型中学习,同时约束内在相似性和结构相似性。内在相似性损失是为了学习内在的不变性,而结构相似性损失是为了确保替代的声纹模型与固定的黑盒声纹模型共享相似的决策边界。替代模型用来生成保留音色的假音频进行攻击。在Audio Deepfake Detection Challenge 2022(ADD 2022)数据集上的实验结果表明,我们提出的方法在白盒和黑盒场景下的攻击成功率分别高达60.58%和55.38%,并且可以同时欺骗人类和机器。
INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。
为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿方式
投稿邮箱:jack@speechhome.com
联系人微信
