自18年谷歌BERT横空出世以来,预训练语言模型一跃成为自然语言处理领域的研究热点,海量数据与大规模模型的预训练+少量下游任务数据微调(Pre-training + Fine-tune)也成为NLP任务的新范式。
从在开源数据集上进行评测到业务实践中的价值体现,预训练语言模型都被证明能够显著提高模型性能和算法效果。如果说预训练语言模型是2019年以来NLP领域的关键词,随着GPT系列模型的诞生,各大公司和研究机构的军备竞赛为其又冠上了大规模这一限定词。

4月19日,阿里巴巴达摩院发布中文社区最大规模预训练语言模型PLUG(Pre-training for Language Understanding and Generation)。该模型参数规模达270亿,集语言理解与生成能力于一身,在小说创作、诗歌生成、智能问答等长文本生成领域表现突出,其目标是通过超大模型的能力,大幅提升中文NLP各类任务的表现,取得超越人类表现的性能。

发布后,PLUG刷新了中文语言理解评测基准CLUE分类榜单历史纪录。 自去年OpenAI发布超大规模预训练语言模型GPT-3引发全球热议后,中文领域同类模型的训练进程备受关注。 与GPT-3类似,阿里达摩院本次发布的PLUG有望广泛应用于文本生成领域,成为“万能写作神器”。 更重要的是,此类超大模型拥有极强的通用性,或将成为AI时代的新型基础设施之一。


相较于Open AI的GPT-3等其他大规模生成模型,PLUG具备如下几个独特优势:

  • PLUG是目前中文社区最大规模的纯文本预训练语言模型。

  • PLUG集语言理解与生成能力于一身,在语言理解(NLU)任务上,以80.614分刷新了Chinese GLUE分类榜单的新记录排名第一; 在语言生成(NLG)任务上,在多项业务数据上较State-of-the-art平均提升8%以上。

  • PLUG可为目标任务做针对性优化,通过利用下游训练数据finetune模型使其在该特定任务上生成质量达到最优,弥补之前其它大规模生成模型few-shot inference的生成效果不足,适于应用在实际生成任务。

  • PLUG采用了大规模的高质量中文训练数据(1T以上),同时,PLUG采用encoder-decoder的双向建模方式,因此,在传统的zero-shot生成的表现上,无论是生成的多样性,领域的广泛程度,还是生成长文本的表现,较此前的模型均有明显的优势。

  • PLUG开放了体验功能供学术领域试用。


(注: 4月19日,PLUG刷新CLUE分类榜单纪录,排名仅次于“人类”)


此前,达摩院机器智能实验室自研的NLU语言模型StructBERT与NLG语言模型PALM均在各自领域取得了SOTA的效果。 简单来说,StructBERT模型通过加强句子级别(Sentence Structural Objective)和词级别(Word Structural Objective)两个层次的训练目标中对语言结构信息的建模,加强模型对于语法的学习能力。 PALM模型则结合了Autoencoding和Autoregression两种预训练方式,引入Masked LM目标来提升encoder的表征能力,同时通过预测文本后半部分来提升decoder的生成能力。

此次大规模语言模型的训练,达摩院团队汲取二者所长,提出了一个简单的框架,用来进行NLU&NLG联合训练。 相比于GPT系列模型,该大规模生成模型以StructBERT作为encoder,有着很强的输入文本双向理解能力,从而可以生成和输入更相关的内容。


整个训练流程分为两个阶段:

  • 首先在第一阶段,达摩院团队训练了一个24 layers/8192 hidden size的标准StructBERT模型作为encoder。 这个过程共计训练了300B tokens的训练数据,规模与GPT-3的训练规模相当。

  • 在第二阶段,达摩院团队将这个encoder用于生成模型的初始化,并外挂了一个6 layers / 8192 hidden size的decoder,在训练生成模型的过程中,在encoder端和decoder端均随机确定长度[32, 512]进行数据采样,确保适应下游广泛的生成任务。 这一阶段共计训练了100B tokens的训练数据,前90%的训练中,团队保留了Masked LM任务以保持模型的NLU能力,后10%的训练中,去掉MLM任务进行微调,以使得生成的PPL降到更低,能取得更好的生成效果。



PLUG生成模型有着很强的长文本生成和建模能力,相比于GPT系列模型的单向建模,PLUG对输入的理解是双向建模的,因此能够在给定小段输入的条件下,生成和输入内容相关且信息量丰富的长文本。




关于大规模预训练语言模型的发展趋势,达摩院深度语言模型团队负责人黄松芳表示,“一方面将从数据驱动(Data-driven)逐步发展到知识驱动(Knowledge-driven),探索数据和知识深度融合的预训练语言模型; 另一方面将不仅仅追求模型参数规模扩大,而会更关注超大模型的落地应用实践,探索低碳、高效、业务可用的预训练语言模型。 ”

接下来,PLUG将扩大参数规模至2000亿级,并进一步提升文本生成质量。 与PLUG发布同步,达摩院宣布近期将开源阿里巴巴深度语言模型体系大部分重要模型。 阿里达摩院语言技术实验室负责人司罗表示,“达摩院NLP团队将进一步攻克自然语言处理领域科研难题,完善中文及跨语言人工智能基础设施,让AI没有难懂的语言,并探索通用人工智能之路。 ”


在超大规模预训练模型领域,除发布以中文为核心的PLUG外,阿里达摩院、阿里云计算平台团队还联合智源研究院、清华大学发布了面向认知的超大规模新型预训练模型“文汇”,以及联合清华大学发布了超大规模多模态预训练模型“M6”。


测试地址:https://nlp.aliyun.com/portal#/BigText_chinese