编者按:2019年底,清华大学语音处理与机器智能实验室(THU-SPMI)推出了基于CTC-CRF的ASR工具包CAT,在多个基准数据集上取得了前沿性能(State-Of-The-Art,SOTA)。近期CAT工具包有了较大改动,升级版本命名为CAT-v2,让我们一睹为快~

综合了混合系统和端到端系统的优势,在保持端到端系统简洁性同时,保留了声学模型(AM)与语言模型(LM)的必要模块化(modularization),就像在人类听觉和大脑皮层系统中,听觉与语言是分区的。这样利于在大量已获取的文本数据上进行语言模型训练,利于跨领域实现语言模型即插即用,利于使用发音词典,在不具备发音词典时也可通过使用字素免去发音词典。
基于条件随机场(CTC-CRF)的声学模型,直接实现了序列鉴别训练(sequence discriminative training),并克服了有向图序列模型(如Attention, RNNT)固有的标签偏置(Label Bias)和曝光偏置(Exposure Bias)缺陷。
代码完全开源,使用Pytorch神经网络架构,支持多机多卡并行训练,支持流式识别,提供常用数据集实验脚本(目前包括英语(wsj, swbd, librispeech)、汉语(thchs30, aishell-1, hkust),闽南语(formosa)、多语言(CommonVoice)),对初学者友好且规范,力求结果可复现(reproducible),方便探索创新研究,助力语音识别研究者!CAT导出模型亦可直接用于生产环境。

相较于v1,CAT-v2从数据并行(DataParallel)迁移到更加高效的分布式数据并行(DistributedDataParallel)来支持模型训练。
模型配置方面,v2提供了对JSON文件读取的支持,你可以在一个JSON文件中完整地定义模型训练时用到的超参数。
此外,v2还对模型训练过程进行了升级,保证了实验结果的可复现性,添加了训练过程的视觉化,让你更好地监控训练过程,调参炼丹

https://github.com/thu-spmi/CAT/blob/master/egs/libri/exp/libri_phone/monitor.png
CAT-v1可以灵活地支持音素(phoneme)或者字素(grapheme)。基于字素(grapheme)的大颗粒建模单元(如wordpiece),在发音词典难以建立时可以实现免词典,具有相当灵活性,同时通过字素组合提高了性能。
本次升级完善了对wordpiece作为CAT建模单元的支持,并在英语和德语数据集上进行验证。实验结果表明,在字素到音素(grapheme-to-phoneme)一致性比较低的英语数据集上,wordpiece-based系统稍弱于phone-based系统;在字素到音素一致性比较高的德语数据集上,wordpiece-based系统稍优于phone-based系统。在具体实现上,CAT-v2使用了开源工具SentencePiece来进行tokenization,通过改变tokenization时的配置来灵活选取建模单元。
在声学模型方面,CAT-v2由BLSTM/VGGBLSTM迁移到当前ASR领域的SOTA模型Conformer。Conformer由Google团队于2020年5月提出,全称为卷积增强的Transformer,是在Transformer模型上的改进。Transformer的self-attention机制可以较为高效地从长上下文中捕捉全局信息,而卷积结构则能在有限短上下文中较为高效地提取信息。能否将二者的特性融合,构造出对全局和局部信息都具有高效提取能力的模型?
Conformer正是基于这样的思想设计:具体而言,Conformer在Transformer encoder的基础上,将单层全连接层改为两层三明治结构全连接层,其中除了包括self- attention层外,还在self-attention层后增加了一个卷积模块。为了使attention层能对不同序列长度都具有较好的泛化性能,Conformer中参考Transformer-XL使用了相对位置编码(Relative positional encoding);卷积模块中包括多个神经网络层,包括一维的分离卷积(separate convolution,由pointwise convolution和depthwise convolution构成,相比于一般的卷积参数更少)和GLU、Swish激活层以及归一化层。

05、实验结果
首先,在英语SWBD和Librispeech上对基于Conformer的CTC-CRF系统,分别使用phone和wordpiece进行了实验。实验结果分别见表1和表2。
从表1和表2可以看出,wordpiece-based系统和phone-based系统性能接近,达到与文献中前沿结果(SOTA)相当水平。

表 1

表 2
此外,对基于Conformer的CTC-CRF系统,在CommonVoice德语数据集上进一步比较phone-based和wordpiece-based系统性能,结果见表3。可以看出,在德语数据集上wordpiece-based系统性能稍优于phone-based系统性能。

表 3
最后,对BLSTM/VGGBLSTM/Conformer模型进行了小规模数据集(SWBD,260小时)的消融实验(见表4),均基于phone-based的CTC-CRF从而公平比较。
结果显示,Conformer(12.5M,14.2%)相比BLSTM(13.5M,15.0%),在参数规模接近的条件下,词错误率(WER)有显著降低;对比CAT-v1的最好模型VGGLSTM(39.2M,14.3%),Conformer仅使用其1/3的参数,就达到甚至略微超过了其性能。一系列实验均表明,通过支持Conformer,CAT-v2拥有了更加强劲的声学模型。

表 4
06、结语
CAT致力发展数据高效端到端语音识别,使用分立的声学模型(AM)与语言模型(LM),取得了前沿性能,将继续在先进性、灵活性和规范性上助力语音识别研究者!
注:本文叙述时省去了相关引用信息,感兴趣的读者可以参考最新的文章:
https://arxiv.org/abs/2107.03007
Github地址:https://github.com/thu-spmi/CAT
