本文主要介绍语音增强和关键词检测联合优化技术,及其在扫地机器人项目中的实践效果。
作者:纳跃跃、王子腾、王亮、付强

图1 联合推理框架与人类听觉系统的类比[5]
从人类听觉系统的工作循环中可以看出,除了从感知器官向大脑的自底向上的信息传递之外,还存在从大脑向感知器官自上而下的控制反馈。本文中的系统框架也借鉴了这种反馈机制,使得两个模块之间能够更紧密的进行配合,实现更高效的联合语音增强和关键词检测。
#01多通道关键词检测

图2 单通道关键词检测模块组合成多通道应用

#02多通道神经网络推理框架
y=f(x1, ...,xN)
#03自适应HMM解码器
#04数据模拟与模型训练
在以往的系统中,关键词检测模型往往采用单通道、短语音的训练方式。这种训练方式虽然实现简单,但不易与前级的语音增强模块做到完全匹配(输入通道数不同,语音增强算法不同),在一定程度上造成了性能损失。

#05在扫地机器人项目中的应用
扫地机器人作为一种特殊品类的家用电器,其使用场景中除了设备回声、人声干扰、环境噪声、房间混响等不利声学因素影响之外,机器人自噪声(ego-noise)的影响不可忽视,自噪声给语音增强和关键词检测任务带来了更加严峻的挑战。主要的难点有以下几方面:
第一,由于噪声源距离拾音设备较近,所以信号的信噪比极低(-10至-15dB);
第二,扫地机器人自噪声是一种复合噪声,其成分复杂多样,例如来自于机器人上的多个电动机、扫地和/或拖地刷、机器人的轮子、吸尘器等部件产生的噪声。该复合噪声中既包含方向性较为明显的点声源干扰成分,例如电动机噪声,又包含方向性较为模糊的散射噪声成分,例如吸尘器风噪。并且相对于语音干扰来说,扫地机器人自噪声是非稀疏的,不具有明显的谐波结构;
第三,扫地机器人工作过程中,其位置是相对于用户实时变化的。实时变化的语音信道将导致语音信号的统计信息难以被估计,从而增加了信号处理算法的难度。
为了应对这些困难,我们采用了如图5所示的实现架构。其中降噪方法使用的是multi-look MVDR波束形成[6],由于目标说话人方位未知,并且会发生移动,所以预先定义了若干方位来进行语音增强,避免了对目标统计量的估计。后续的关键词检测模块接收增强后的多通道音频特征,并预测各个发音单元的存在概率。同时,关键词缺失概率可以反馈回语音增强算法中,用于指导噪声协方差矩阵的估计,从而实现了语音增强和关键词检测的联合迭代优化。

图5 扫地机器人中的语音增强与关键词检测联合优化技术
||总结
在我们以往的项目中,语音增强和关键词检测为两个相互独立的模块,两个模块之间级联工作,数据前向传递。由于两个模块的目标函数和优化方法不同,每个模块各自最优并不能使得整体系统性能达到最优。
为了进一步提升整体系统性能,实现在训练阶段和推理阶段的语音增强和关键词检测联合优化,我们研发了若干相关技术,包括多通道关键词检测模型,多通道神经网络推理框架,自适应HMM解码器,相应的长音频数据模拟工具和训练工具,以及在推理阶段实现关键词检测到语音增强的信息反馈。这些技术都集成到了我们研发的端侧AI工具包中,在相关的项目应用中取得了较好的效果。
参考文献
[1] Na, Yueyue, et al. "Joint Online Multichannel Acoustic Echo Cancellation, Speech Dereverberation and Source Separation." Interspeech, 2021.
https://github.com/nay0648/unified2021
[2] Wang, Ziteng, et al. "Weighted recursive least square filter and neural network based residual echo suppression for the aec-challenge." ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2021.
[3] Ziteng Wang, et al. "A Semi-blind Source Separation Approach for Speech Dereverberation." INTERSPEECH. 2020.
[4] Yueyue Na, Ziteng Wang, Liang Wang, Qiang Fu. "Joint EGO-noise suppression and keyword spotting on sweeping robots". ICASSP 2022.
https://github.com/nay0648/ego2022
[5] Huang, Yiteng, et al. "Supervised noise reduction for multichannel keyword spotting." 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2018.
[6] Ji, Xuan, et al. "Integration of multi-look beamformers for multi-channel keyword spotting." ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2020.
[7] Zhang, Shiliang, et al. "Feedforward sequential memory networks: A new structure to learn long-term dependency." arXiv preprint arXiv:1512.08301 (2015).
[8] Ying, Dongwen, and Yonghong Yan. "Noise estimation using a constrained sequential hidden Markov model in the logspectral domain." IEEE transactions on audio, speech, and language processing 21.6 (2013): 1145-1157.
