由清华语音与音频技术实验室(THUsatlab)组成的THUEE队伍参加OpenASR20挑战赛取得多项语种第一名,本文主要介绍比赛中所搭建的系统。

一、比赛介绍
OpenASR20挑战赛是美国高级情报局(IARPA)在2020年承办的国际自动语音识别赛事,依托项目为“英语检索任意语种的机器翻译”(MATERIAL)。比赛旨在评估低资源语种的ASR技术的现状。比赛共包括十个低资源小语种,分别为阿姆哈拉语,粤语,瓜拉尼语,爪哇语,库尔曼吉-库尔德语,蒙古语,普什图语,索马里语,泰米尔语,越南语。对于每个语种分别设置受限和非受限两个赛道,前者只允许使用给定的目标语种10小时语音数据,文本数据不作约束;后者则对于数据的使用没有限制。我们参与了全部10个语种的受限赛道。
比赛的评测指标为词错误率(WER),评测数据集为每个语种5小时音频数据,此外每个语种提供10小时数据用于系统验证。对于比赛中的10个语种,索马里语数据来自IARPA MATERIAL项目,其余9个语种数据均来自IARPA BABEL项目,音频格式为电话对话,采样率为8kHz, 44.1kHz或48kHz。
二、系统描述
我们搭建了hybrid自动语音识别系统,整体流程如下图所示。主要环节包括数据预处理、数据增广、声学模型和语言模型的训练、解码以及重打分、系统融合等后处理。


1)数据预处理:包括数据清洗和语音活动检测VAD,分别针对训练数据和测试数据进行,由于评测数据并未进行切分,VAD在解码测试阶段是必不可少的环节。下表展示了部分语种经过数据清洗前后的识别结果。


2)数据增广:在有限的10h数据基础上,数据增广尤为重要,我们将速度扰动,音量扰动,添加混响,频谱增强SpecAugment等手段进行组合使用,获得较明显提升。对比结果如下表所示,其中Non为未使用数据增强,“+SA”表明采用频谱增强,“+SVP+SA”指同时使用速度扰动音量扰动及频谱增强,相比于未进行数据增强的基线词错误率平均降低接近10%。


3)声学模型:主要使用的是CNN-TDNN-F-A架构,由卷积神经网络CNN,低秩分解的时延神经网络TDNN-F结合自注意机制构成;使用MFCC和pitch特征,并结合了说话人特征i-vector。对于声学模型中上下文长度的设置我们进行了相关实验,包括[-15;6],[-12;9]和[-9;9]三组设置,结果如下表所示,可以发现不同上下文长度对于最终系统影响不大,但借助后续系统融合可以实现较明显性能提升。


4)语言模型:我们使用SRILM训练得到N-gram模型,除了官方给定的10h文本数据外,额外加入了BABEL数据集中相应语种的文本数据。完成训练后,解码得到词格,在此基础上使用TDNN-LSTM语言模型进行重打分。下表展示了我们在不同语言模型设置下取得的结果,可以发现通过使用BAEBL文本数据训练的语言模型,我们将平均词错误率降低2.2%,进一步借助重打分则可以再降0.7%。


三、后期探索
在比赛之后我们借助wav2vec2.0无监督预训练模型进行语音识别系统的搭建,展现了预训练模型在低资源条件下的优越性能。我们分别构建了基于wav2vec2.0预训练模型的端到端系统和传统混合系统,系统框图如下所示。


其中wav2vec2.0预训练模型选择XLSR-53,该模型由53个语种共计5.6万小时音频数据训练得到。在实验过程中我们将音频重采样为16kHz以保持与预训练模型的匹配。为了帮助XLSR-53模型更好地适用于目标语种,我们先使用目标语种的无标注音频数据对XLSR-53继续自监督训练,随后再使用10小时标注数据进行模型微调,该方法记为”FT2”,对应于直接微调”FT1”。在将预训练模型以特征提取器的形式接入到混合系统中时,需要注意前者帧移为20ms,而后者为10ms,可以通过修改预训练模型中的步长或者两帧共享同一帧特征来解决。我们在普什图语上进行了实验,标注数据为10小时,额外用到的无标注音频数据为68小时。实验结果如下表所示,包括“FT1”,“FT2”的对比,端到端系统(CTC)和混合系统(hybrid)的对比,以及两种帧移处理方法(change stride、copy)的对比。


此外,在混合系统中我们对于预训练模型中不同Transformer层的表征提取以及数据增强方法进行了消融实验,如下表所示。我们发现对于经过微调后的XLSR-53模型,使用最后一层(24层)的Transformer输出用于声学模型训练结果最优,速度扰动和频谱增强两种数据增强方法依旧适用,多系统融合可以获得进一步性能提升。

小结
  • 在基于传统混合系统进行低资源语音识别时需要综合考虑各方面配置与改进,包括声学模型,语言模型,数据增强,数据清洗等,此外集外词的处理对于系统整体性能提升会有较大帮助,值得进一步探索。
  • 借助预训练模型进行低资源小语种语音识别可取得更优性能,利用目标语种的相关音频资源、使用合适的预训练表征、设计合理的下游模型结构则可以进一步降低词错误率。
https://doi.org/10.1109/asru51503.2021.9688260