语种识别(Language recognition)是指通过语音片段来判断目标语言种类的分类识别任务。本文主要讨论基于无监督预训练的语种识别,即借助语音音频数据进行自监督训练得到预训练模型,在此基础上提取高维表征以进一步用于后续语种识别分类任务。

不同语种的主要区别在于音素的排列与组合方式,因此需要长时信息才能做出有效与合理的判断。最近被提出并广泛应用的预训练模型以其强大的序列建模能力在语音识别系列任务上表现突出,我们认为无监督预训练模型能够有效获取音频数据的上下文信息,因此可以得到足够的长时特征用于语种分类。
我们构建了多个基于无监督预训练模型的语种识别系统,与传统方法进行对比分析,其中预训练方法包括自回归预测编码(APC,VQ-APC),对比预测编码(CPC)以及非自回归预测编码(NPC)。


因此,我们将最近提出的基于无监督学习的语音预训练方法应用于语种识别系统,包括自回归预测编码(APC,VQ-APC),对比预测编码(CPC)以及非自回归预测编码(NPC)。下面对不同的方法分别进行简要介绍。
自回归预测编码(Autoregressive Predictive Coding,APC)是一种生成性模型。给定一段输入序列,来预测未来时段的频谱,通常使用L1损失函数。矢量量化的自回归预测编码(Vector-Quantized APC)是APC的离散化进阶版本,通过在自回归层之间添加额外的矢量量化层,实现了从连续表征到离散码字的转换。下图展示了VQ-APC的基本结构。

- 对比预测编码(Contrastive Predictive Coding,CPC)是一种对比学习方法。输入音频通过编码器得到隐藏表征,再经过自回归网络后得到序列特征,我们选择距离目标点较近的隐藏表征作为正例,而距离较远的作为负例,在此基础上进行鉴别性训练。示意图如下所示。

非自回归预测编码(Non-autoregressive Predictive Coding,NPC)也是一种生成性模型,但该方法借助掩码重建而不是预测回归,此外,模型中的卷积块可以通过感受野来限制信息的前向传递过程,以确保重建过程只依赖于目标语音的周围信息,而不会使用到目标片段的信息。其网络结构如下图所示。


实验中,我们使用两个数据集进行无监督预训练,分别为英语数据集Librispeech和多语言数据集CSS10。其中,Librispeech数据集为朗读英语,我们只使用clean 100小时和360小时子集;CSS10数据集包括10个语种,分别只包含一位说话人,总时长约为140小时。
对于语种识别任务,我们使用来自东方语种识别(OLR)2020挑战赛的数据集,包括AP16-OL7、AP17-OL3和AP20-OLR-channel测试。将前两个数据集放在一起使用,集合包括10个语种,超过200个说话人,总时长约为100小时。AP20-OLR-channel测试集是不同声道条件下的6种语言数据集,总时长约为10小时。
A
在第一组实验中,我们使用Librispeech的100小时英语语音数据进行预训练。随机选择AP20数据集的10%作为有监督训练数据集,其余90%的数据用于测试,结果在表1中。

为了对比不同数据量的影响,我们也使用AP16-OL7+AP17-OL3进行了重复实验,结果如表2所示,实验设置与AP20相同。系统性能通过准确度和C_avg进行评估。

从结果中我们可以发现,基于预训练的语种识别系统相比于传统系统性能更好,但不同的预训练方法之间并没有太大区别。对于不同的分类器而言,MLP和RNN的分类效果略好于线性分类器。对比表1和表2的结果,我们可以发现有监督数据的数量以及语言的数量对预训练模型系统性能影响不大。因此,可以认为基于预训练的方法是低资源条件下的合适选择。
B
接下来我们使用多语言数据集CSS10进行语音预训练,有监督数据集仍然使用AP16-OL7+AP17-OL3,实验结果如表3所示。

与单语言预训练模型相比,CPC模型的性能变化不大,略有下降。这也说明预训练表征可以跨语言使用,英语数据集可以为预训练模型提供足够的语音信息。
C
在最后一组实验中,我们进行了domain-mismatch测试,即AP16-OL7+AP17-OL3用于训练,AP20用于测试。由于AP20中只包括6种语言,我们选择了AP16-OL7+AP17中对应的6种语言的语音数据。

从表4中的结果可以看出,在跨声道测试中,系统性能均明显下降。这说明预训练没有为跨声道测试提供足够的信息。因此我们将预训练数据量增加到360小时。

表5中的数字表明,更多的预训练数据可以提高系统性能,domain-mismatch的问题需要更大量的预训练数据来缓解。
D
为了更好地说明基于无监督模型的系统的工作机制,我们用t-SNE可视化了自监督模型学习到的表征,不同的颜色代表不同的语言。从图中我们可以发现,不同语种是可分离的,而聚类状态也表明存在其他无关信息,如说话人、口音和声道信息。

最后针对基于预训练的语种识别进行简单总结。
优点突出:预训练模型可以获得区分性较好的表征;在标注数据有限的条件下也可以获得较好的效果,同时充分利用无监督数据;下游分类任务中,使用简单的分类器也能获得令人满意的性能。
但也存在一定的局限性:提取的表征可能包含不相关的信息;通用性和鲁棒性受到用于预训练的语音数据的限制;此外,预训练的时间与计算资源成本相对较高。
在未来的工作中,我们将针对语种识别任务更改预训练方法以增强无监督特征的鲁棒性,减少说话人和信道信息对于分类结果的影响。
作者简介

于海彬,本科四年级,现就读于清华大学电子工程系,目前在张卫强老师课题组接受本科生科研训练。

赵靖,本科毕业于清华大学电子工程系,目前攻读清华大学电子工程系硕士,导师为张卫强老师。研究方向为基于无监督预训练的低资源语音识别和关键词检索。
