SLT 2024特殊议题Stutter Speech & Dysarthria Speech将于2024年12月2日10:30-12:30在澳门悦榕庄举行。本次会议邀请了来自学术界和工业界的专家们,共同探讨语音障碍和人工智能技术结合的前沿研究。本次特殊议题将聚焦于口吃与构音障碍语音的识别与处理,分享最新的研究成果和技术进展。期待通过跨领域的深入交流,推动语音障碍相关技术的实际应用。

会议详情:https://2024.ieeeslt.org/program/

特殊议题主题:Stutter Speech & Dysarthria Speech

时间:2024年12月2日10:30-12:30

地点:澳门悦榕庄演讲厅 (Lecture Hall at Banyan Tree Macau)

特殊议题主持人:杜俊(中国科学技术大学)、谢磊(西北工业大学)


会议议程

时间演讲者题目
10:30-10:45周家名南开大学KNN-CTC:Enhancing ASR via Retrieval of CTC Pseudo Labels
10:45-11:00薛鸿飞西北工业大学Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
11:00-11:15黄尚坤北京远鉴研究中心Enhanced ASR for Stuttering Speech: Combining Adversarial and Signal-Based Data Augmentation
11:15-11:30刘小康中科院深圳先进技术研究院An End-To-End Stuttering Detection Method Based On Conformer And BILSTM
11:30-11:45高铭中国科学技术大学Summary Of Low-Resourse Dysarthria Wake-Up Word Spotting Challenge
11:45-12:00孔玉祥小米科技有限公司Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach for SLT 2024 LRDWWS Challenge
12:00-12:15王诗瑶南开大学PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
12:15-12:30颁奖典礼


嘉宾&主题

周家名

简介:周家名,南开大学计算机学院人类语言技术实验室,一年级博士生,导师为秦勇教授。主要研究方向语音识别,领域适配。

报告题目:kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels

报告摘要:检索增强语言模型在各种自然语言处理(NLP)任务上都取得了成功。但是由于构建细粒度音频文本数据存储方面的挑战,难以应用于自动语音识别(ASR)中。本文提出了 kNN-CTC,通过利用连接主义时间分类 (CTC) 伪标签来建立帧级音频文本键值对,避免了精确对齐的需要。进一步,我们引入了“跳过空白帧”策略,该策略忽略 CTC 空白帧,以减少数据存储大小。通过将 k 最近邻检索机制整合到基于CTC的ASR系统中并利用细粒度、剪枝后的数据存储, kNN-CTC 在域内、域外等场景下均取得了性能提升。我们的代码开源在https://github.com/NKUHLT/KNN-CTC。

薛鸿飞

简介:薛鸿飞,西北工业大学音频语音与语言处理研究组,二年级硕士生,导师为谢磊教授。主要研究方向多语种语音识别。

报告题目:Findings of the 2024 Mandarin Stuttering Event Detection and AutomaticSpeech Recognition Challenge

报告摘要:口吃语音挑战赛旨在为口吃群体研发语音技术,特别是针对普通话的口吃事件检测(SED)和自动语音识别(ASR)。挑战赛专注于两个赛道:(1)SED,其核心目标在于构建口吃事件检测系统;(2)ASR,致力于打造能够精准识别口吃语音的稳定高效系统。在数据支持方面,我们充分借助了开源的普通话口吃数据集 AS - 70,并将其精心拆分为全新的训练集与测试集,以服务于本次挑战赛。本报告阐述了该数据集的相关信息,解读了挑战赛各赛道的详情,剖析了顶尖系统的性能表现,着重突出了检测精准度的显著提升以及识别错误率的有效降低。我们的研究结果强调了专用模型和增强策略在研发口吃语音技术方面的潜力。

黄尚坤

简介:黄尚坤,硕士毕业于新疆大学,现就职于北京远鉴研究中心。主要研究方向为多语种语音识别,曾在ICASSP、SLT等学术会议发表多篇论文,在CHIME-8、ICASSP2024 ICMC-ASR等赛事中取得优异成绩。

报告题目:Enhanced ASR for Stuttering Speech: Combining Adversarial and Signal-BasedData Augmentation

报告摘要:ASR系统在识别口吃语音时面临着诸多挑战,其中关键因素包括口吃语音数据的稀缺以及口吃语音与流利语音之间显著的特征不匹配。为应对这些挑战,本研究采用了数据增强技术。我们通过对流利语音进行语速和节奏的变换、插入静音片段以及重复语音片段,来模拟口吃语音的整体包络特征。此外,我们还引入了基于生成对抗网络(GAN)的扰动技术,以模拟口吃语音的细粒度特征。将这两种方法结合,能够显著提升ASR系统对口吃语音的识别能力。我们的系统在SLT2024 StutteringSpeech挑战赛的赛道2中获得了第一名,取得了12.30%的字符错误率,相比官方基线系统降低了35.87%。

刘小康

简介:刘小康,中国科学院深圳先进技术研究院博士在读,导师为王岚教授,燕楠教授,研究方向为言语障碍的自动评估、自动语音识别和语音转换。

报告题目:An End-To-End Stuttering Detection Method Based On Conformer And BILSTM

报告摘要:口吃是一种神经发育性言语障碍,其特征是常见的言语症状,如停顿、感叹、重复和延长。言语语言病理学家通常通过观察这些症状来评估口吃的类型和严重程度。存在许多有效的端到端方法用于口吃检测,但一个常见的被忽视的问题是该过程中涉及的任务之间的不确定关系。使用合适的多任务策略可以提高口吃检测性能。本文提出了一种新颖的口吃事件检测模型,旨在帮助言语语言病理学家评估口吃的类型和严重程度。首先,Conformer模型从口吃语音中提取声学特征,然后是长短期记忆(LSTM)网络来捕获上下文信息。

最后,我们探索了口吃的多任务学习,并提出了一种有效的多任务策略。实验结果表明,我们的模型优于当前最先进的口吃检测方法。在基于AS-70数据集[1]的SLT 2024口吃语音挑战赛中,我们的模型比基线方法提高了平均F1分数24.8%,并获得了第一名。在此基础上,我们分别对LSTM和多任务学习策略进行了相关的广泛实验。结果表明,我们提出的方法比基线方法提高了平均F1分数39.8%。

高铭

简介:高铭,中国科学技术大学语音及语言信息处理国家工程研究中心博士在读,导师为杜俊副教授,研究方向为语音信号处理,从事构音障碍的语音处理相关研究,联合高校、企业组织多个构音障碍相关赛事,并联合发表多篇论文。

报告题目:Summary OF Low-Resourse Dysarthria Wake-Up Word Spotting Challenge

报告摘要:本次报告将对LRDWWS 挑战赛进行介绍和总结。LRDWWS 挑战赛旨在为构音障碍患者开发说话人依赖型唤醒词检测系统。构音障碍是一种运动性言语障碍,影响患者的发音、流利度和语音清晰度。由于语音模式的不稳定,构音障碍患者在使用语音激活的智能设备时常面临困难。本次挑战赛首次引入普通话构音障碍语音数据集,鼓励创新性解决方案,以提升语音控制技术的可访问性和可用性,吸引了来自4个国家的25支团队参与。

孔玉祥

简介:孔玉祥,小米语音识别算法工程师。

报告题目:Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach forSLT 2024 LRDWWS Challenge

报告摘要:语音已经成为一种流行的用户界面,但对于构音障碍患者来说,语音变异性带来了巨大的挑战。本文提出了一个端到端基于预训练的双滤波器构音唤醒词识别(PD-DWS)系统,用于SLT 2024低资源构音唤醒词识别挑战。我们的系统提高了音频建模和双滤波器策略的性能。在音频建模方面,我们提出了一种基于预训练数据向量2 (d2v2)的创新d2branch -d2v2模型,该模型可以通过统一的多任务微调范式同时建模自动语音识别(ASR)和唤醒词识别(WWS)任务。此外,引入了双滤波器策略,在保持相同的误拒率的同时降低了误接受率(FAR)。实验结果表明,PD-DWS系统的FAR为0.00321,FRR为0.005,在test-B评估集上的总分为0.00821,在挑战中获得第一名。

王诗瑶

简介:王诗瑶,南开大学硕士在读,研究方向为构音障碍语音识别,导师是秦勇教授。分别在Interspeech 2024和SLT 2024会议上以一作身份共发表论文两篇。

报告题目:PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up WordSpotting Challenge

报告摘要:针对SLT 2024低资源构音障碍唤醒词识别(LRDWWS)挑战赛,我们引入了PB-LRDWWS系统。该系统将用于原型构建的构音障碍语音内容特征提取器与基于原型的分类方法相结合。特征提取器是一个经过微调的HuBERT模型,通过使用交叉熵损失的三阶段微调过程获得。经过微调的HuBERT从目标构音障碍说话人的注册语音中提取特征以构建原型。分类是通过计算目标构音障碍说话人的评估语音的HuBERT特征与原型之间的余弦相似度来实现的。尽管我们的方法很简单,但实验结果证明了其有效性。我们的系统在LRDWWS挑战赛的最终Test-B中获得了第二名。