
本文由清华大学与香港中文大学、腾讯 AI Lab 合作,提出了一种基于图神经网络和多模态信息的对话交互建模方法(Graph-based multi-modal context modeling)以及基于该方法的对话风格语音合成(Conversational TTS)系统,以提升回复的合成语音的语音风格(speaking style)表现力效果。给定当前待合成语音的回复文本,该方法首先从之前的对话历史上下文中提取出文本和语音的多模态表征;然后利用对话图卷积网络(DialogueGCN)建模对话过程中各说话人之间的互交互与自交互过程,生成包含对话交互上下文信息的新表征;进而通过注意力机制汇总,为当前待合成语音的回复文本提供更好的对话交互上下文信息表征。相对于传统的基于循环神经网络(RNN)或者只考虑纯文本信息的对话交互建模方法,本文所提方法合成的语音更加符合当前对话场景的需求,表达方式更加自然、更加多样。本文还提出了一个英语对话数据集,并已经开源,感谢字节跳动为该数据集的标注提供支持。

论文预印版:
https://arxiv.org/abs/2106.06233
开源英语对话数据集:
https://github.com/thuhcsi/english-conversation-corpus
合成样例试听:
https://thuhcsi.github.io/icassp2022-conversational-tts/

不同于传统的语音合成系统,对话风格语音合成需要根据对话的上下文中的多模态信息,分析其中的各种依赖关系,推断出符合当前对话上下文情境的当前句语音风格,并合成出对应的语音。
然而现有的对话语音合成系统通常只考虑对话上下文中的文本信息,忽略了对话中的语音信息。同时现有的对话语音合成系统的对话交互建模方法一般为一个单向的门限循环神经网络(Gated recurrent unit, GRU)。这种建模方法只能建模对话中的时序(temporal)依赖关系,而忽略了对话中的说话人之间(inter-speaker)依赖关系及说话人之内(intra-speaker)依赖关系。这些信息模态和依赖关系建模的缺失,可能会导致不恰当的语音风格推断,进而影响语音交互系统的用户体验。
本文提出了一种基于图神经网络和多模态信息的对话交互建模方法。该方法首先提取出对话上下文中的多模态信息,并通过对话图卷积神经网络(dialogue graph convolutional network, DialogueGCN)建模对话中的各种依赖关系,包含时序依赖关系以及不同说话人之间、同一说话内部的依赖关系,并通过注意力机制(attention mechanism)汇总为当前句所需的对话上下文表征,以预测当前句的语音风格。本文进而提出了一个基于 FastSpeech 2 的对话风格语音合成系统。该系统根据上述基于图神经网络和多模态信息的对话交互建模推断出当前句的语音风格,从而合成出符合当前对话场景需求的具有对应风格的语音。
基于图神经网络和多模态信息的对话交互建模方法

为了充分理解当前对话的交互情境,我们首先从对话上下文的历史语句(past utterances)中提取出多模态信息,包含文本信息及语音信息。首先通过 BERT 和 Tacotron 编码器(encoder)来获得每句话的句级别文本信息表征。同时通过预训练的参考编码器(reference encoder)及全局语音风格注意力机制(GST attention)提取出每句话的句级别语音风格作为其语音信息表征。文本信息表征和语音信息表征拼接后即为上下文中每句话的多模态信息表征。
我们进一步将这些信息构建成一张图。图的每个节点表示对话上下文中的一句话,包含对应语句的多模态信息表征。图的边包含所有可能的有向边及自回(self-loop)边,并通过边类型来描述对话中的时序关系与说话人关系。每个边的类型是一个由时序顺序及起止说话人标签构成的三元组,其中时序顺序包括过去到未来(past to future)及未来到过去(future to past),说话人标签为当前说话人在对话上下文中首次出现的顺序。最后,边权由每句话的多模态信息表征及注意力机制计算得到。
接下来我们利用 DialogueGCN 对每句话的信息表征进行对话交互建模。DialogueGCN 由一层关系图卷积网络(relational graph convolutional network, RGCN)及一层普通图卷积网络(graph convolutional network, GCN)构成。第二层 GCN 的输出与原始的多模态信息表征进行拼接,即为对话上下文中每句话经过对话交互建模后的表征。
最后,我们利用注意力机制将每句话经过对话交互建模后的表征汇总为一个上下文表征并推断当前句的语音风格。注意力机制的查询项(query)为当前句的文本信息表征及说话人标签,键(key)、值(value)为上述对话上下文中每句话经过对话交互建模后的表征。最后我们拼接注意力机制的查询项与输出,并通过线性变换将其映射为当前句的语音风格。
基于 FastSpeech 2 的对话风格语音合成系统
我们利用 FastSpeech 2 结合前文所提的对话交互建模方法构建对话风格语音合成系统,其结构如下图所示。其中,FastSpeech 2 编码器(encoder)、可变信息模块(variance adaptor)及解码器(decoder)由语音风格可控 FastSpeech 2 预训练得到。

语音风格可控 FastSpeech 2
我们通过一个语音风格可控 FastSpeech 2 来预训练对话交互建模所需的语音风格提取模块及最终的对话语音合成系统中的 FastSpeech 2 相关模块。语音风格可控 FastSpeech 2 由 FastSpeech 2 结合类似 Tacotron 中的语音风格学习与控制方法得到。同时,我们通过域对抗学习(domain adversarial learning)及梯度反转层(gradient reversal layer)去除语音风格中的说话人信息。

英语对话数据集(已开源)
我们从 YouTube 收集了 66 个视频构成了一个英语对话数据集。这些视频原用于英语口语教学,绝大多数语句都有着清楚、准确的发音。这些视频总计约 24 小时,可被进一步切分为超过 2 万个对话片段,其中每个片段包含 5 个历史语句和 1 个当前句。
该数据集由专业团队进行了标注。其句级别文本正确率、说话人标记正确率、起止时间正确率都达到了 95% 。
对比实验
我们的基线方法基于 GRU 建模上下文中的文本信息来进行对话交互建模。该方法使用 BERT 提取出上下文中每句话的句级别的文本信息表征,并通过一个 GRU 进行对话交互建模,并同样使用 FastSpeech 2 合成语音。
根据实验结果,我们可以看到本文所提的方法在主观评测和客观评测中均优于基线方法。在主观评测中,平均有 55% 的情况所提方法合成的语音更加符合当前对话交互的上下文情境。

消融实验
我们进一步进行了消融实验。我们首将基线方法中的对话交互建模方式修改为本文所提的基于图神经网络的对话交互建模方法,但仍然使用基线模型的文本信息表征,而没有语音信息表征。如表2第二行所示,该方法优于基线方法,说明了基于图神经网络的对话交互建模的有效性。我们进一步从本文所提的模型中去除语音信息,只使用文本信息表征进行建模,从表2第四行可以看到,该方法劣于本文所提方法,说明了多模态信息的有效性。
05 结论
为了充分理解对话交互情境,本文提出了一种基于图神经网络和多模态信息的对话交互建模方法以及基于该方法的对话风格语音合成系统。相对于传统的对话语音合成系统,本文所提的方法可以充分利用对话上下文中的多模态信息,并通过图神经网络建模对话中的时序依赖关系及不同说话人之间、同一说话人内部的依赖关系,从而合成出具有更加符合当前对话交互情境需求的具有相应语音风格的语音。消融实验分别验证了多模态信息和图神经网络的有效性。
