随着移动互联网技术的发展,互联网基础应用不再局限于文本输入,而是更加倾向于采用语音这一高效便捷的输入方式。特别是在机器翻译领域,实时的语音翻译技术已经成为人们出行交流的得力助手。自动语音翻译技术旨在实现不同语言间语音的直接转换。其核心流程通常涵盖三个关键模块:语音识别(ASR)、文本翻译(MT)和语音合成(TTS)。实际应用中,用户输入的语音信号通常是实时、口语化的。这种口语风格的语音与书面文本存在显著差异,主要体现在其包含的不流利因素上,如重复、停顿、修正和冗余等。这些不流利因素会导致语音文本中出现大量噪声单词,因此,语音文本的顺滑处理任务逐渐受到研究人员的重视。


#01、方法介绍

语音文本顺滑任务的方法大体上可以分为四类:基于噪声信道模型的方法、基于序列标注的方法、基于句法的方法、基于神经网络的方法。[1]在具体的特征选择方面,一般分为文本特征和与声学有关的特征,如音律特征等。

基于噪声信道的顺滑方法是最早被提出来的检测方法。该方法将顺滑任务类比为信号去噪的过程,通过减少噪声来优化文本输出。类似于统计机器翻译的策略,该方法运用了对数线性模型以应对语音中的噪声问题,并显示出了显著的效果。

随后,为了进一步提升性能,语言模型和重排序模型被相继融入TAG模型之中。[2]

基于序列标注的识别算法是将语音顺滑任务当做序列标注问题,该方法大致可归为两类。一类是基于词的方法,该方法运用序列标注模型为句子中的每个词分配一个标签,进而依据这些标签来判断词的类型,如Qian等人[3]选用的Max-Margin Markov Networks方法。另一类是基于块(chunk)的方法,其输出为带有标签的短语块,而非与输入等长的标签序列。这类方法的优势在于能够利用块级别的特征,如Ferguson 等[4]使用的Semi-Markov Model方法在顺滑任务上展现出了优于其他基于词的序列标注方法的性能。虽然传统的序列标注模型通过设计复杂的离散特征能在一定程度上应对长距离依赖问题,但由于训练语料的规模限制,常常会受到稀疏性的困扰。此外,这类方法还无法保证生成的句子在句法上的合理性。

基于句法的顺滑算法是一种处理语音不流畅问题的方法。Lease等人[5]提出了一个基于概率上下文无关文法(PCFG)句法分析器的语音顺滑模型。该模型的核心观点是,语音中经常出现的噪声单词(如填充词、重复词等)在句法结构上往往与整句话的语法结构存在冲突。因此,通过分析句子的句法结构,可以有效地辅助识别这些不流畅的单词。实验结果显示,句法分析确实有助于识别语音中的噪声,从而提升了语音文本的顺滑度。

近年来,深度学习技术在自然语言处理领域展现出了卓越的建模能力,这一趋势也扩展到了语音顺滑任务。Wang等人[6]率先将深度学习技术引入语音顺滑领域,他们提出的基于端到端神经网络的语音顺滑模型,通过序列到序列的建模方式,取得了优异的实验结果。随后,Wang等人[7]进一步探索了深度学习技术与句法模型的结合,提出了一种新型的基于循环神经网络的语音顺滑建模方法。该方法充分利用了长短期记忆网络(LSTM)的序列建模能力,并结合了句法结构信息,从而在语音顺滑任务中取得了非常好的识别效果。


#02、专利分析

荣耀终端有限公司[8]提出将经过语音识别后的待处理文本输入文本顺滑模型,得到第一顺滑结果,根据待处理文本对应的原始的文本困惑度与第一顺滑结果对应的文本困惑度,将低的困惑度对应的文本作为顺滑文本。该文本顺滑模型采用样本数据进行初始训练,文本顺滑模型的训练集是由迭代更新的加噪规则对样本数据进行加噪得到的,迭代更新的加噪规则是基于对预测标签和真实标签进行偏差分析得到的,其中,预测标签为训练过程中的文本顺滑模型对测试集进行标签预测得到的。由于在多轮迭代训练的过程中,利用主动学习的思想,根据预测标签与真实标签的偏差,迭代更新加噪规则;基于迭代更新的加噪规则,对样本数据进行加噪,扩大了规则覆盖范围,扩充数据丰富性,增大训练数据,提高了文本顺滑模型的性能,进而提高了语音文本的顺滑效果。

北京中科智加科技[9]提出一种基于无监督预训练模型T5-base的多任务fine-tuning文本顺滑模型和训练方法。在样本构造方面,通过扩充顺滑和不顺滑样本集,增加样本多样性;多任务神经网络模型实现不流畅序列标签标注任务和流畅文本生成两个任务,可以在文本不流畅检测的同时也能得到顺滑之后的文本;在训练阶段,使用多任务联合学习方法去做参数微调,得到文本顺滑模型权重。其中,针对流畅文本生成不可控的问题引入缓解机制Copy机制和Coverage机制,提升顺滑后文本的忠诚度和流畅度。模型利用集束搜索选择最优的顺滑文本序列,利用CRF选择最优的标签序列,在真实的数据集上进行验证,辅助序列标注任务并实现在语音转写真实场景中符合规范的文本书面语。

京东科技[10]提出了一种文本顺滑处理方法,该方法首先通过预训练的文本顺滑模型对待处理的文本进行分析,标记出文字不流畅的部分,然后基于这些标签对不流畅的文本进行顺滑处理,得到更加流畅的文本。文本顺滑模型由编码器、文字标签分类器和语句流畅分类器组成,它们共同通过预训练来学习如何识别并处理不流畅的文本。预训练过程中,模型通过处理带有噪声和流畅性标签的文本样本来学习,并通过比较处理前后的文本语义差异来优化模型,直至达到预设的准确度阈值。在顺滑处理阶段,模型能够准确地识别并删除不流畅的文字,从而生成更加流畅易读的文本。

文本顺滑技术的应用已成为提升语音识别准确度和文本可读性的关键。多种方法被提出以实现语音文本的自然流畅表达。这些方法通过构建和训练特定的文本顺滑模型,对语音识别后的文本进行后处理,以消除不流畅、冗余或错误的文本片段。这些模型通常基于大量样本数据进行训练,通过迭代更新加噪规则和引入多任务学习等方法,提高模型的泛化能力和性能。同时,利用编码器、分类器等组件,模型能够精准地识别并处理不流畅的文本,生成更加符合规范、流畅易读的书面语。这些方法的应用不仅提升了语音识别的整体效果,也为用户提供了更加优质的文本体验。


[1] 基于自注意力机制的口语文本顺滑算法.

[2] An improved model for recognizing disfluencies in conversational speech.

[3] Disfluency detection using multi-step stacked learning.

[4] Disfluency Detection with a Semi-Markov Model and Prosodic Features.

[5] Early deletion of fillers in processing conversational speech.

[6] A neural attention model for disfluency detection.

[7] Transition-based disfluency detection using LSTMs.

[8] 荣耀终端有限公司. 一种文本顺滑方法、设备及存储介质:CN202310682675.8[P].

[9] 北京中科智加科技有限公司. 一种文本顺滑的语音识别方法、系统及存储介质:CN202210262971.8[P].

[10] 京东科技信息技术有限公司. 文本顺滑处理方法、装置、电子设备及存储介质:CN202310217943.9[P].