近期,实验室与出门问问AI Lab、华盛顿大学合作的论文“Region Proposal Network Based Small-Footprint Keyword Spotting“发表在IEEE Signal Processing Letters期刊上。针对关键词检出任务,该论文提出了一种基于“区域提出网络”( RPN)的方法,可以精确的检测关键词的出现以及位置。现对该论文进行解读与分享。


  • 论文题目:Region Proposal Network Based Small-Footprint Keyword Spotting

  • 作者列表:Jingyong Hou, Yangyang Shi, Mari Ostendorf, Mei-Yuh Hwang, Lei Xie

  • 论文原文:http://lxie.npu-aslp.org/papers/2019SPL_HJY.pdf

  • 论文源码:https://github.com/jingyonghou/RPN_KWS.git



任务定义

语音关键词检出技术(Keyword Spotting,KWS)是从流式音频或语音句子里检测关键词的任务。该技术在很多应用中扮演着重要角色,其中最常见的应用是包括智能手机、智能音箱等各种设备上的唤醒词(wake-up word),比如,亚马逊的“Alexa”、Google的“Okay Google”、苹果的“Hi Siri”、华为的“小艺小艺”、小米的“小爱同学”等。除此之外,关键词检出还可以用作语音控制、语音搜索、热点词检测等。例如,近期腾讯“王者荣耀”游戏里开通了不良音频与脏话检测的功能。实际场景中,声学条件的复杂与可变性、设备与信道变化、语音的多样性和口音变化,对关键词检出的性能造成了极大的挑战。



图1:语音唤醒是关键词检出的典型应用场景


图2:不良语音检测也是通过关键词检出技术实现的


背景动机

传统的基于关键词/垃圾词(keyword/filler)隐马尔科夫模型(HMM)的KWS技术以及目前的基于深度学习的KWS方案均未考虑使用神经网络显式地学习对关键词同时进行分类和定位 (本论文发表后,近期Interspeech2019的一些关于关键词检出的论文也考虑了结合关键词的分类和定位任务)。这里显式地学习是指训练模型时的目标同时包含了关键词的分类和定位,传统方案仅仅显式地学习关键词的分类任务,并未显式地学习定位任务。


对关键词进行准确定位在一些应用中非常重要。比如:在唤醒系统中,如果我们能够获得关键词的准确位置信息,我们就可以准确地将终端设备接收到的关键词片段送到服务器端做二次验证;在脏话检测系统中,检测出关键词的准确信息可以方便我们准确地掩蔽该脏话;除此之外,我们认为联合关键词定位任务本身也能够提升关键词检出系统的性能。


基于RPN的方案

为了同时优化关键字检测和位置预测,我们提出使用“区域提出网络”(Region proposal network, RPN)的方法。RPN在物体检测任务首次被提出,通过联合优化物体分类和位置估计,在当时实现了非常划时代的物体检测的性能提升。与使用 RPN 处理简单静态图像的物体检测不同,本文针对语音信号序列特点,重新设计了 RPN 以处理流式音频信号。

同时我们公布了源代码:https://github.com/jingyonghou/RPN_KWS.git。


图3:所提方案的整体框架图


本方案的整体框架如图3所示。该系统由两个子模块组成:1)神经网络特征提取器,2)区域提出神经网络。
特征提取器的目的是从输入特征中提取更加丰富,更具表征力的特征,称之为“顶层”特征,这种特征利于我们后续的任务。在所提方案中,我们使用两层128节点的GRU 作为特征提取器(也可以用其他递归神经网络,自注意力模型或者卷积神经网络来替换特征提取器)。该网络的输入是语音声学特征向量序列,输出是“顶层”特征向量序列。
在介绍RPN之前,我们先介绍下锚框(Anchor)的概念。锚框就是可能包含关键词一些区域。图4给出了每一帧数据产生锚框的示意图,如图所示,对于第t帧语音,我们人工规定了K个锚框,分别是Anchor1, Anchor 2, …… ,Anchor K。这些锚框的结束位置都是t,而开始位置则从长度最短的Anchor 1 一直线性地增涨到长度最长的Anchor K。瞄框的最短和最长长度需要根据关键词的时长的统计信息来确定。而每帧数据的锚的个数K则需要根据数据去做调节,通常通过实验的方式来确定。


图4:锚框产生的示意图


RPN由两个子网络组成:M1 和M2。其中,M1用来对语音每一帧高层特征所对应的Anchor进行分类,预测每一个Anchor属于哪一个关键词或者不属于任何关键词。M2用来预测的包围框回归的参数以使得每个正Anchor(被分类成关键词的Anchor)的位置被正确变换到关键词的真实位置。


实验验证

我们使用出门问问公司Ticmini2智能音箱收集的数据来验证提出的方案。该数据由大约255K条语音数据组成,收集自788个说话人,总共225小时。所有数据中,有177小时的数据是非关键词(Non-keyword)的数据,剩下的为包含关键词“Hi Xiaowen”或“Nihao Wenwen”数据。该数据使用真实的阵列设备进行收集,收集过程反映了实际使用场景。说话人在距离智能音响的不同距离和角度进行录制,录制过程中会有不同声强级和种类的噪声被同时叠加在音频中。


图5:在Ticmini2唤醒测试数据集上不同系统的DET曲线比较。左图和右图分别是关键词“Hi Xiaowen”和“Nihao Wenwen” 的测试结果。


图5给出了不同系统在Ticmini2唤醒测试数据集上的DET曲线的比较。首先比较不同的RPN系统,“RPN lambda=0”代表未做包围框回归的RPN模型,“RPN lambda=3”代表做了包围框回归的RPN模型且训练时回归任务的损失函数的权重设置为3(“RPN lambda=3”是我们在发展集中得到的最好的RPN模型)。由图可以看出,在两个不同关键词的测试结果表明,把包围框回归作为训练损失函数的一部分可以有效地提升关键检出系统的性能。我们把“RPN lambda=3”系统与基线系统“Attention”也做了一个比较,结果显示我们的系统显著好于基线系统。相比基线系统,在固定误唤醒一个小时一次的情况下,在“Hi Xiaowen”测试集和“Nihao Wenwen”测试集上误拒绝率相对降低14.6%和23.4%。



图6:RPN网络输出结果示例


图6展示了两个包含关键词的句子的RPN网络输出结果。对于每一个例子,红色线的框表示关键词在句子中的真实位置(来自语音识别声学模型对齐的结果),蓝色线框表示RPN网络M1对该句子中所有Anchor的预测中该关键词的后验最大的Anchor,而绿色线框表示RPN网络的M2对上述的后验最大的Anchor进行包围框回归后预测的关键词的位置。由图可以观察到,Anchor可以对关键词的位置进行大概的估计但是并不准确。经过RPN的包围框回归后得的位置几乎可以准确地预测出关键词的位置信息。


表1: 在Ticmini2唤醒测试数据集上不同系统的平均交并比(IoU)(对于每一个单元格里两个数值的,第一个数值关键词“Hi Xiaowen”的平均IoU,第二个数值是关键词“Nihao Wenwen”的平均


表1展示了定量地对不同系统预测关键词位置的能力进行评估的结果。在不同的阈值下(不同的平均每小时错误唤醒次数(FA per hour)对应不同的阈值)对测试数据集中所有的正确命中的句子计算了关键词真实位置与不同方法预测出的位置的交并比(IoU)。对于表中的Anchor列,表示了在该命中的句子中选择一个后验最大的Anchor,计算它与关键真实位置的交并比。对于RPN列,表示将上述后验最大的Anchor根据网络预测出的变换参数做了空间变换后得到预测区域,用该区域与关键词的真实位置计算交并比。结果显示,相比根据Anchor获得关键词的位置,RPN得到的关键词的位置更加准确,在两个关键词的平均IoU都高达90%以上。我们尝试了不同的阈值,发现在正确命中样本上的平均IoU的结果在不同阈值上的表现差异并不大。


相关工作

除本文工作之外,实验室近期在关键词检出任务上有诸多工作,包括深度对抗学习提升KWS鲁棒性、基于声学词嵌入的复杂场景下关键词检出的二次验证、用于语言学习KWS的口音适应等,以下是一些代表性论文和论文链接,供大家参考。

  • Xiong Wang, Sining Sun, Lei Xie, “Virtual Adversarial Training for DS-CNN Based Small-Footprint Keyword Spotting”, ASRU2019, 14-18 December 2019, Singapore原文链接:http://lxie.npu-aslp.org/papers/2019ASRU_WX.pdf

  • Yougen Yuan, Zhiqiang Lv, Shen Huang, Lei Xie,“Verifying Deep Keyword Spotting Detection with Acoustic Word Embeddings”, ASRU2019, 14-18 December 2019, Singapore(合作单位:腾讯)原文链接:http://lxie.npu-aslp.org/papers/2019ASRU_YYG.pdf

  • Jingyong Hou, Pengcheng Guo, Sining Sun, Frank K.Soong, Wenping Hu, Lei Xie, “DOMAIN ADVERSARIAL TRAINING FOR IMPROVING KEYWORDSPOTTING PERFORMANCE OF ESL SPEECH”, ICASSP2019, 12-17 May, 2019, Brighton, UK(合作单位:微软)原文链接:http://lxie.npu-aslp.org/papers/2019SPL_HJY.pdf

  • Xiong Wang, Sining Sun, Changhao Shan, JingyongHou, Lei Xie, Shen Li, Xin Lei, “ADVERSARIAL EXAMPLES FOR IMPROVING END-TO-END ATTENTION-BASED SMALL-FOOTPRINT KEYWORD SPOTTING”, ICASSP2019, 12-17 May, 2019,Brighton, UK(合作单位:出门问问)原文链接:http://lxie.npu-aslp.org/papers/2019ICASSP-XiongWang.pdf

  • Changhao Shan, Junbo Zhang, Yujun Wang, Lei Xie,"Attention-based End-to-End Models for Small-Footprint Keyword Spotting", Interspeech2018, September 2-6, 2018, Hyderabad, India(合作单位:小米)原文链接:http://lxie.npu-aslp.org/papers/2018interspeech-SCH.pdf