国际最受关注的自然语言处理自然语言处理(NLP)顶级会议 ACL 2022 于今年 5 月 22 日至27 日举行,包括爱尔兰都柏林的线下会议及线上会议两部分。
来源丨腾讯AI Lab微信(tencent_ailab)
腾讯 AI Lab 共有 20 篇论文被收录(含 5 篇 findings),涵盖对话与文本生成、机器翻译、文本理解、语言模型等方向。本文为部分入选论文解读。腾讯 AI Lab 自然语言处理团队的研究内容囊括从自然语言理解到生成的整个链条,及对 AI 系统可解释性以及算法底层机制等理论研究,并持续向 NLP 及 AI 社区分享其领先研究成果。此前已发布多项系统及数据:●文本理解系统 TexSmart
https://texsmart.qq.com/
●交互翻译系统 TranSmart
https://transmart.qq.com/
●智能创作助手 Effidit
https://effidit.qq.com/
●腾讯中文词向量数据
https://ai.tencent.com/ailab/nlp/zh/embedding.html
A Model-Agnostic Data Manipulation Method for Persona-based Dialogue Generation本文由腾讯AI Lab主导,与悉尼大学合作完成。为了更好地构建智能对话机器人,越来越多的研究开始考虑把显式的人物个性信息包含到生成模型中。但是这类人物个性化对话的数据大小通常受限,进而限制了直接使用现有数据所训练出的对话生成模型的性能。本文作者认为,此类任务中数据上的挑战主要来源于两个方面:首先,收集此类数据来扩充现有数据集的代价很大;其次,该数据集中每一个样本的学习难度都要比传统对话数据更高。因此,本文针对以上两点问题,提出了一种新的个性化对话数据处理方法,该方法独立于模型因此可以和任意一种个性化对话生成模型结合进而提升其性能。本文首先对原始数据样本进行蒸馏,剔除难以学习的样本进而让模型可以更容易地拟合蒸馏后的样本分布。之后,使用多种不同的方法来有效地增强蒸馏后的样本,使其变得更多样进而缓解其数量不足的问题。最后,目标模型会使用我们构建的数据课程进行训练,即先在增强后的蒸馏数据上进行训练,之后再在原始样本上进行训练。实验表明,该方法可以有效地提升两种对话生成模型(Transformer和GPT2)在此类任务上的性能。
Lexical Knowledge Internalization for Neural Dialog Generation本文由腾讯AI Lab主导,与香港大学,华东师范大学,上海人工智能研究院合作完成。本文提出使用知识内化的方法来把词汇知识嵌入补充到神经对话模型当中。相较于基于知识的对话模型直接依赖于一个外部检索到的知识,该方法尝试将关于每个输入单词的词汇知识嵌入到对话模型的参数当中。为了应对规模巨大的词汇知识,本文采用了对比学习的方法,并利用维基百科的弱监督信息构建了一个词级别的词汇知识检索器。该方法在多个数据集和模型架构上验证了有效性。Towards Abstractive Grounded Summarization of Podcast Transcripts本文由腾讯AI Lab主导,与中佛罗里达大学合作完成。播客最近迅速普及,播客转录文本的摘要对内容提供者和消费者都有实际好处,可以帮助消费者快速决定是否会收听播客,并减少内容提供者编写摘要的认知负担。然而,播客摘要面临重大挑战,包括与输入相关的事实不一致。口语记录中的语音不流畅和识别错误加剧了这个问题。本文探索了一种新颖的抽象摘要方法来缓解这些挑战。具体来说,我们的方法学习生成一个抽象的摘要,同时将摘要段对应转录的特定部分,以允许对摘要细节进行全面检查。我们在大型播客数据集上对所提出的方法进行了一系列分析,并表明该方法可以取得了可观的结果。接地的摘要在定位包含不一致信息的摘要和转录片段方面带来了明显的好处,从而显著地在自动和人工评估指标,都提高了摘要质量。Learning-by-Narrating: Narrative Pre-training for Zero-Shot Dialogue Comprehension本文由腾讯AI Lab主导,与北卡罗来纳大学教堂山分校合作完成。对话理解需要捕获话语中的各种关键信息,这些信息有可能分散于多轮对话的不同位置或者隐含在话语中。因此,对话理解模型需要综合多种自然语言理解能力,例如复述、总结、常识推理、隐含知识推理等。本文提出了一个“边讲边学”(leaning-by-narrating)的预训练策略。该策略通过在预训练过程中引导模型对输入对话的内容进行叙述,从而使模型学习并理解对话中的关键信息。然而,目前还没有公开的大规模对话-叙述平行语料库能够支持这种预训练策略。为此,我们首先收集了大量电影字幕及情节摘要数据,通过将二者进行自动切分和对齐,从而构建了一个对话-叙述平行语料库-DIANA。然后,在该语料库上对模型进行生成式预训练,并在四个对话理解的下游任务中对模型性能进行评估。实验结果表明,该模型在零试学习的场景下性能显著优于先前的模型。同时发现DIANA中蕴含着多种类型的知识,可以提高模型在多种细粒度对话理解层面的能力。
Event Transition Planning for Open-ended Text Generation本文由腾讯AI Lab主导,与香港大学、山东大学、上海人工智能研究院合作完成,被会议接收为Findings长论文。开放式文本生成任务,例如对话生成和故事完成,需要模型在有限的先前上下文中生成连贯的延续,给当今的神经自回归文本生成器带来了新的挑战。尽管这些神经模型擅长生成流畅的文本,但它们很难建模给定上下文中的事件与可能发生的事件之间的因果关系。为了弥合这一差距,本文提出了一种新颖的两阶段方法,可明确地建模开放式文本生成中的事件转移规划。该方法可以理解为一种经过特殊训练的从粗到细的算法,其中事件转换规划器提供“粗略”的事件骨架,而第二阶段的文本生成器会细化骨架。在两个开放式文本生成任务上的实验表明,该方法在连贯性和多样性方面有效地提高了生成文本的质量。
1. 弥合无监督神经机器翻译训练和推理之间的数据差距Bridging the Data Gap between Training and Inference for Unsupervised Neural Machine Translation本文由腾讯AI Lab主导,与上海交通大学合作完成。作为无监督神经机器翻译的重要组成部分,回译利用目标语言的单语数据生成伪平行数据。无监督神经机器翻译模型在这些源端是翻译句子的伪平行数据上进行训练,但往往对自然书写的源端文本进行翻译推理。源端数据在训练和推理之间的差异阻碍了无监督神经机器翻译模型的翻译性能。通过精心设计的实验,我们确定了源端数据差异性的两个代表性特征:(1)风格差异(即翻译与自然文本风格)导致较差的泛化能力;(2)内容差异诱使模型产生偏向目标语言的幻觉内容。为了缩小这种数据差异,我们提出了一种在线的自训练方法,它同时使用{自然的源端句子,翻译的目标端句子}的伪平行数据来模拟推理的场景。在多个广泛使用语言对上的实验结果表明,我们的方法通过弥补风格和内容上的差距,超过了两个强基线模型(XLM和MASS)。2. 理解和提高针对机器翻译的序列到序列预训练模型Understanding and Improving Sequence-to-Sequence Pretraining for Neural Machine Translation本文由腾讯AI Lab主导,与香港中文大学和阿尔伯塔大学合作完成。本研究旨在理解和改进针对机器翻译系统的序列到序列的预训练研究,特别是针对预训练解码器。我们发现序列到序列的预训练是一个双刃剑:一方面这个模块可以提高翻译模型的译文的准确性和多样性;另一方面,由于预训练和下游翻译任务的不同,预训练解码器会引入生成风格的偏移以及过度自信的问题,从而限制模型性能。基于以上的发现,我们提出了两种简洁而有效的方法来提高预训练模型在下游翻译任务上的表现,包括领域内预训练和输入自适应。前者将预训练模型在领域内单语数据上继续训练,从而缩小预训练模型与下游翻译任务数据分布上的差异。后者对下游翻译任务的输入数据进行加噪,并将加噪数据与原始数据混合训练翻译任务模型,从而更好的将预训练模型的知识迁移到下游翻译任务模型。我们在多个翻译任务上进行了实验,验证了我们的方法可以有效地提高模型翻译效果和鲁棒性。

3. BiTIIMT:一种基于双语文本填充的交互式机器翻译方法BiTIIMT: A Bilingual Text-infilling Method for Interactive Machine Translation本文由腾讯AI Lab主导,与南京大学合作完成。交互式机器翻译(INMT)通过人工干预,可以保证高质量的译文输出。现有的交互式系统通常采用约束解码算法(LCD):它可以采用一种灵活的方式进行翻译,从而避免了自左向右翻译范式的约束。然而,由于约束解码的原因,这种交互系统在翻译效率和翻译质量上存在明显的不足。本文提出了一种新颖的交互翻译系统,即基于双语文本填充的交互翻译模型。它的基本思想是一个双语文本填充(BiTI)任务:对于给定的源语言和人工校对的翻译译文片段,自动地进行句子填充从而获得更好的译文。通过将这个任务转化为序列到序列的任务,本文提出了一种简单有效的方法来进行实现。这种实现方法的优势是,它的解码效率与标准NMT的效率相同,而且它可以充分地利用人工校对的信息进行准确的词预测。实验结果表明,该方法在翻译质量、效率和一致性上都优于词约束解码方法。4. 低频词重分布:充分利用单语数据增强非自回归翻译Redistributing Low-Frequency Words: Making the Most of Monolingual Data in Non-Autoregressive Translation本文由腾讯AI Lab主导,悉尼大学合作完成。知识蒸馏(KD)是训练非自回归翻译(NAT)模型的首要步骤。它可以简化NAT的模型训练,但代价是丢失翻译低频词的重要信息。本文提出了一个有吸引力的替代方案:单语KD。该方案利用从原始平行数据训练的AT老师来蒸馏额外的单语数据,从而训练AT学生。单语KD能够将原始双语数据的知识(隐式编码在AT教师模型中)和新的单语数据知识传递到NAT学生模型。在8个WMT基准数据集上对2个先进的NAT模型进行的大量实验表明,单语KD通过改善低频词翻译而始终优于标准KD方法,且不引入任何计算开销。同时,单语KD具有良好的可扩展性,当给定更多计算开销,其可以通过与标准KD融合、反向单语KD融合或扩大单语数据规模来进一步增强。大量的分析表明,这些技术可以有效地融合,从而进一步召回在标准KD中丢失的有用信息。令人鼓舞的是,我们的方法融合标准KD后,在WMT14英-德和德-英数据集上分别获得了30.4和34.1 BLEU值。