作者朱耀明

论文链接: https://arxiv.org/abs/2202.00468代码链接: https://github.com/Yaoming95/UniPunc
以往的标点恢复模型可以分为单模态和多模态两类:简单而言,单模态模型仅依赖纯文本信息做标点恢复,而多模态模型会同时接受文本与其对应的语音信号,联合两种输入做标点恢复。
两类标点恢复模型各自面临一定的局限性:
对于单模态模型而言,由于人类语言天然带有歧义性,许多句子可能存在多种标点断句的方式,而不同的标点会带来大相径庭的句义——对此,英国作家琳恩·特拉斯曾举过一对生动的例子:panda eats shoots and leaves(熊猫吃嫩芽和叶片)与panda eats, shoots, and leaves(熊猫吃饭、开枪、并离开)。此外,由于不涉及语音信息,单模态模型时常无法获知说话人的情感态度,这会导致模型在一些句子末尾难以抉择以句号还是问号作为结束符。

图1:琳恩·特拉斯所举的标点歧义例句,她还基于这个生动的例子写作了一本畅销书[1]以引导公众对于标点符号的重视

图2:UniPunc 总架构
三、在两类模态下都可以提升性能
论文选取了多个单模态(如BERT,SAPR[6]),多模态 (如MuSe[7]、TTS数据增强[8]) 的SOTA模型作为实验的比较基线,其中多模态模型仅在 English-Audio 数据集上进行训练,因为它们不支持纯文本的处理,单模态模型则在两种数据集上进行实验作为基线结果。
作者在多模态数据集 English-Audio 和混合模态数据集 English-Mix 下训练了两套 UniPunc 模型,分别记作 UniPunc-Audio 和 UniPunc-Mix ,以方便和单模态基线、多模态基线做全面对比。论文采用了句号、逗号、问号三种标点恢复的准确率、召回率以及F1分数作为评价指标。下图展示了作者的实验结果:

图3:UniPunc主实验结果
主要结论有以下三点:
1. UniPunc-Mix 能取得最后的标点恢复效果,证明了新框架的有效性;
2. 在不引入单模态数据的情况下,仅使用 English-Audio 训练的 UniPunc-Audio 也在性能上超越了SOTA多模态基线;
3. 在有音频的测试数据上,UniPunc-Mix 的效果略好于 UniPunc-Audio,作者调查发现,加入的单模态纯文本主要提升了 UniPunc-Mix 标点恢复的召回率。
作者还使用论述了 UniPunc 框架具有一定的普适性:通过把 UniPunc框架嫁接到传统的单模态基线 BiLSTM 上,或者是把它和 contextual dropout 方法[9]联合使用,它都可以继续提升原模型或者原方法的性能:

图4:UniPunc普适性实验结果
四、总结
作者在来源TED演讲集的数据上进行了实验,证明了 UniPunc 的性能优势,以及它对混合模态数据处理的普适性。
[2]Kenton, Jacob Devlin Ming-Wei Chang, and Lee Kristina Toutanova. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” In NAACL-HLT 2019.
[3]Baevski, Alexei, et al. “wav2vec 2.0: A framework for self-supervised learning of speech representations.” In NeurIPS 2020.
[4] Cattoni, Roldano, et al. “MuST-C: A multilingual corpus for end-to-end speech translation.” Computer Speech & Language 2021.
[5] Salesky, Elizabeth, et al. “The Multilingual TEDx Corpus for Speech Recognition and Translation.” In Interspeech 2021.
[6] Wang, Feng, et al. “Self-attention based network for punctuation restoration.” In ICPR, 2018.
[7] Sunkara, Monica, et al. “Multimodal Semi-Supervised Learning Framework for Punctuation Prediction in Conversational Speech.” In Interspeech 2020.
[8] Soboleva, Daria, et al. “Replacing human audio with synthetic audio for on-device unspoken punctuation prediction.” In ICASSP 2021.
[9] Silva, Andrew, Barry-John Theobald, and Nicholas Apostoloff. “Multimodal Punctuation Prediction with Contextual Dropout.” In ICASSP 2021.
