2022年5月11日,由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、小米集团、语音之家、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙—小米的语音研究与应用在线上成功举办。

下面是本次沙龙的回顾:


Daniel Povey  

在本次沙龙中,Daniel Povey报告主题是“Next-Gen Kaldi“,主要围绕下面几个方面进行了分享:

k2:https://github.com/k2-fsa/k2

实现了可运行在CUDA设备上的FSA和FST算法,可无缝结合PyTorch和TensorFlow等主流的自动求导机器学习工具包,实现各种常用的语音识别训练函数,如CTC、MMI和RNN-T,以及多种解码算法。另外,k2已支持高效的剪枝RNN-T训练方法。

Lhotse:https://github.com/lhotse-speech/lhotse

作为下一代Kaldi的数据处理框架,提供多种常用的语音处理技术,包括语音增广、特征提取以及不定长序列处理等。

Icefall:https://github.com/k2-fsa/icefall

包含了k2的相关recipe,实现多种主流语音识别算法,目前主要涵盖基于MMI、CTC和RNN-T等模型。


王育军

王育军报告的主题是“小米语音交互的耳朵和嘴巴是怎样炼成的”,在分享中对小米的语音全栈技术做了整体的说明介绍,包含以下五个方面:
 小米的人工智能互联网包含哪些

小米除了有大家所熟知的手机外,还有小米的生态链,从2019年开始以Phone X AIoT为核心战略。


小米的人工智能相关工作
在能力板块包含了CV、NLP、语音声学以及机器学习等,另外应用板块包含小爱同学、智能拍照、智能营销等,能力板块对应的小米的人工智能实验室。

语音全栈技术相关内容
语音全栈技术是指小米在手机和AIoT平台上,建立了语音理解和生成两个大的技术方向,包括15个小的子方向。

语音技术的相关应用
目前小米的语音技术的应用主要是小爱同学的“耳朵”和“嘴巴”,基于此,详细介绍了小米语音交互的一个链路,即从用户提出意图到小米手机AIoT平台、经过一系列步骤,结果满足之后,生成语音反馈成用户。从理解和生成两大方面,就拾音(阵列拾音、视觉拾音、成分分析重建)、语音识别(语音唤醒、语音识别、情感感知、语种识别、唇语识别等)以及生成(AI作曲编曲、唇形生成等)等全栈语音技术做了详细介绍并举例说明。

语音技术和研究如何相互成就

在工程开发、云端架构搭建等工作的过程中将学术方面的心得记录下来,总结后在大会中进行发表,也会积极参加各类赛事。


至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!