前言:本文是Google于2021年9月27日发表的最新论文(10月1日更新第二版),详细介绍了Google最近一段时间在语音识别半监督领域的最新进展,包括使用一百万小时的无标签数据来训练80亿参数量的超大模型,同时还通过预训练语音识别模型在音频分类等非语音识别领域达到或超过最优效果,并且目前语音领域的SoTA也是他们在去年提交的半监督方案(语音识别state-of-the-art方案(2021.09)),本文是其延续性工作,时隔一年,有了更丰富的实验,更大量的数据,更多样的任务,强烈推荐阅读,尤其是大规模使用无监督数据达到如此好的效果,语音的ImageNet时刻似乎更近了。


本文主要分析的是半监督学习在非语音识别领域的效果,最后给出一些讨论和未来的工作方向。

VI. NON-ASR TASKS

我们现在探索预训练Conformers表示在音频分类任务中的效用。在本节中,我们考虑 Conformer XL Non-RA,这是一种不使用相对注意力的 Conformer XL 模型,结果证明它在这些任务上的表现优于其相对注意力模型。

A. 非语义语音 (Non-Semantic Speech,NOSS) 基准

任务和数据集(Tasks and Datasets):非语义语音基准(NOSS)是语音分类任务的基准,用于比较语音表示的有用性。该基准测试包括各种任务,例如语音情感识别、说话人识别和语言识别,但特别排除了关注单词含义的任务。我们在我们的表征评估中包括两个健康相关的语音任务:语音期间的掩码检测和环境人声,如咳嗽和打喷嚏。下表描述了各数据集:




评估(Evaluation):对于每个(model, layer, task)三元组,我们使用 Scikit-Learn 库(逻辑回归、平衡逻辑回归、线性判别分析)训练三种类型的线性模型。给定模型和任务,我们选择产生最大开发集性能的layer和regression 方法,并在下表中报告该配置的测试集性能与先前报告的最新结果。在表中的第二行中,我们展示了我们使用先前研究的方法获得的音频表示进行的基线 NOSS 任务评估的结果。




• 我们仅使用特定于任务的线性层在4/7公共任务上实现了新的SoTA(见表 X)。在Conformer embedding上训练的线性模型在Voxforge、CREMA-D、SAVEE 和 Masked Speech 上的表现优于先前报告的结果,这些结果是通过使用复杂的、特定于任务的架构和训练实现的。

• 仅在声学特征上的Conformers 就可以与使用多模态数据的其他模型竞争。特别是,我们在之前使用视觉和声学特征获得的 SoTA CREMA-D 结果上实现了 20% 的相对改进。我们的结果比 Dementia-Bank 上的 SoTA 差,后者是通过使用额外的文本信息和声学特征实现的。

• 没有使用relative attention的Conformer XL始终是性能最佳的特征(见表 X)。使用下面提供的平均准确度度量的分析也证实了这一点。

• 在大多数任务中,除了YAMNet的ESC-50性能之外,所有四个Conformer模型都优于其他非语义语音表示(表 XI 中的“基线”行)的所有先前 SoTA 数字,其监督训练集的标记类是ESC-50的超集。

平均准确度度量(Average Accuracy Measure):我们使用所有NOSS任务的平均准确度度量作为量化embedding一般质量的指标。在下图中,我们绘制了作为模型层函数的平均准确度度量,从索引为层 -1的位置嵌入层开始。 Conformer 模型的曲线在模型的倒数第二层截断。




• 我们发现来自大多数Conformer layers的embedding优于以前的结果。这表明预训练的 Conformer模型中的表征对于非语义语音任务的普遍有用性,而不仅仅是与语言相关的任务。
• 最好的 Conformer 层在网络的中间,而不是在倒数第二个位置。这表明,即使 Conformer 学习了新的 SoTA 非语义语音表示,也可以修改训练程序以进一步改进。


B. AudioSet

数据和概述:在前面的部分中,我们已经在各种各样的语音处理任务中展示了 Conformer 模型的能力。我们现在评估我们的无监督表示对音频事件分类的非语音任务的效用。为此,我们考虑常用的 AudioSet 基准,其中包括近200万个音频剪辑,每个剪辑都有一个或多个从 527 个类的本体中提取的标签。更具体地说,我们使用了最近几篇论文使用的无监督表示评估协议。这包括:

1、使用我们预先训练的 Conformer 模型为每个剪辑提取固定维度的帧级表示;

2、使用 AudioSet 在顶部训练一个简单的帧级分类器,该分类器由具有 512 个 ReLU 单元的单个隐藏层和具有 527 个独立 sigmoid 输出的线性分类层组成;

3、将此应用于每个评估剪辑并平均汇集帧级分数以报告整体平均精度值。

过去使用这种评估范式的方法使用相同的音频集训练数据进行无监督预训练。因此,除了使用我们用YT-U预训练的模型报告性能外,还使用 AudioSet预训练了一个额外的ConformerX以限制域不匹配并使结果与过去的工作更具有可比性。表 XII 比较了过去几种方法的 AudioSet 分类性能和从预训练的 ConformerXL 派生的各种表示(有和没有relative attention)。对于每个 Conformer 模型,我们报告输出(第 24 层)和最佳内部 Conformer 层的性能,这些性能使用作为开发集的 AudioSet 训练的一小部分确定。




结论:我们可以从这些结果中得出几个结论。首先,我们发现虽然最终 Conformer 输出层定义的表示滞后于所有过去的方法,但选择内部层的性能明显更好,就像上面的NOSS实验的情况一样。这表明wav2vec 2.0预训练目标与音频事件分类任务不太匹配,但它仍然会产生有用的内部表示。其次,相对注意力导致此任务的性能略有下降,这与NOSS一致,与 ASR 结果相反。与NOSS任务一样,AudioSet 基准测试涉及整个剪辑级别的预测,我们假设这可能会降低相对位置信息的价值。第三,我们发现即使在单独对语音 (YT-U) 进行预训练时,我们仍然在第 10 层学习表示,与过去的方法相比,该表示在 AudioSet 基准测试 (0.308 mAP) 上表现良好,即使该模型尚未暴露于 AudioSet 本体的多样性。然而,当我们使用域内 AudioSet 数据重新训练 ConformerXL 时,我们实现了额外的改进。我们的 AudioSet-pre-trained ConformerXL 性能为 0.340 mAP,超过了过去单独使用频谱图进行训练和评估的所有工作。大多数过去的单峰方法严重依赖于学习过程中的增强,需要仔细选择其类型以针对此任务进行优化。然而,Conformer 模型在不使用任何类型的增强的情况下获得了强大的性能,而是完全由架构设计和预训练目标驱动。


VII. 讨论及未来方向

A. ASR Model and Data Efficiency

数据效率(Data Efficiency):我们发现增加模型大小、预训练、上下游自训练对训练性能有积极影响,但主要是在有标记数据效率方面。当标记的数据集大小变得非常大时,许多这些方法的效果会变小。


大模型的预训练和训练稳定性(Pre-training and Training Stability for Large Models):我们发现随着模型变得非常大,对标记数据集的训练变得更加困难和脆弱。更大模型的训练成本加剧了这个问题,使得超参数调整的成本高得令人望而却步。结果,our8B 模型在完整的 VoiceSearch 数据集上几乎无法训练。大型模型训练经过预训练后变得稳定。


模型压缩(Model Compression):从这项工作中产生的一个自然研究方向是找到实际受益于巨型模型实现的性能提升的方法。研究如何以最小的性能损失压缩巨型模型将是此类努力的关键要素。


B. Downstream ASR Tasks

P-或PS-模型?(P- or PS-models?):由于PS-模型利用额外的上游标记数据,因此在一般的小型下游任务上,应该期望它比P-模型表现更好,这就是我们发现的。同时,还有一些因素使PS模型表现得更糟。PS模型在针对上游任务优化的文本环境(例如,文本规范化、标记化)中进行训练,而 P 模型可以从一开始就在下游任务的原生环境中进行训练,这可能与上游任务有很大不同。此外,这些因素(例如标记化)的差异可能会使使用可用的下游资源(例如 LM 融合)变得笨拙。


完整语音搜索集的下游NST训练(Downstream NST training for full Voice Search sets):应用本文中使用的标准下游 NST 配方对 YT-U 或 YT-T 进行伪标记,使用每个词的置信度过滤 50%,并将伪标记数据与标记数据混合,无法提高 fullVoice Search 集的性能。我们的实验是用英语(美国)和匈牙利语(HU)全语音搜索集进行的,实际上导致性能略有下降。一个初步的结论可能是,当标记的数据集集大小变得非常大时,伪标记变得不那么有效,尽管需要更深入的调查来加强这一断言。


C. Downstream Non-ASR Tasks

超越编码特征(Beyond Encoded Features):在这项工作中,我们限制了使用大型预训练模型作为非 ASR 任务的特征编码器。超越这种用途以进一步改进一般的音频分类任务会很有趣。


文本来源知乎,文章作者:蘑菇炖提莫