2022年5月11日,由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、小米集团、语音之家、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙—小米的语音研究与应用在线上成功举办。
下面是本次沙龙的回顾:
Daniel Povey
在本次沙龙中,Daniel Povey报告主题是“Next-Gen Kaldi“,主要围绕下面几个方面进行了分享:
k2:https://github.com/k2-fsa/k2
实现了可运行在CUDA设备上的FSA和FST算法,可无缝结合PyTorch和TensorFlow等主流的自动求导机器学习工具包,实现各种常用的语音识别训练函数,如CTC、MMI和RNN-T,以及多种解码算法。另外,k2已支持高效的剪枝RNN-T训练方法。Lhotse:https://github.com/lhotse-speech/lhotse
作为下一代Kaldi的数据处理框架,提供多种常用的语音处理技术,包括语音增广、特征提取以及不定长序列处理等。Icefall:https://github.com/k2-fsa/icefall
包含了k2的相关recipe,实现多种主流语音识别算法,目前主要涵盖基于MMI、CTC和RNN-T等模型。
王育军
王育军报告的主题是“小米语音交互的耳朵和嘴巴是怎样炼成的”,在分享中对小米的语音全栈技术做了整体的说明介绍,包含以下五个方面:小米除了有大家所熟知的手机外,还有小米的生态链,从2019年开始以Phone X AIoT为核心战略。
在能力板块包含了CV、NLP、语音声学以及机器学习等,另外应用板块包含小爱同学、智能拍照、智能营销等,能力板块对应的小米的人工智能实验室。语音全栈技术是指小米在手机和AIoT平台上,建立了语音理解和生成两个大的技术方向,包括15个小的子方向。目前小米的语音技术的应用主要是小爱同学的“耳朵”和“嘴巴”,基于此,详细介绍了小米语音交互的一个链路,即从用户提出意图到小米手机AIoT平台、经过一系列步骤,结果满足之后,生成语音反馈成用户。从理解和生成两大方面,就拾音(阵列拾音、视觉拾音、成分分析重建)、语音识别(语音唤醒、语音识别、情感感知、语种识别、唇语识别等)以及生成(AI作曲编曲、唇形生成等)等全栈语音技术做了详细介绍并举例说明。在工程开发、云端架构搭建等工作的过程中将学术方面的心得记录下来,总结后在大会中进行发表,也会积极参加各类赛事。
至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!