在语音识别系统的现实使用环境中,噪声、干扰和混响几乎是无处不在的。在麦克采集到的音频信号中,这些不利因素和目标语音信号叠加在一起,会带来识别率的下降,而在远场环境中更是如此。如图3-1所示,远场环境中可能同时存在反射声、扬声器回声、干扰用户的声音、方向性噪声和弥散噪声等,这对语音识别系统的准确性提出了很大的挑战。语音前端算法是一组对语音数据进行预处理的算法,其目标是从数据中去除这些不利因素,并尽可能恢复原始的纯净语音,从而提升识别率。





关于本书作者
杨学锐
大疆创新语音交互算法负责人,复旦大学及Turku大学硕士,长期从事语音算法、深度学习、人工智能等领域的研究与商业落地,在相关领域发表多篇论文及专利。
晏超
北京邮电大学硕士,曾任职于HP Labs, Cisco, Technicolor等公司。现为云从科技语音算法负责人,从事语音识别、声纹识别、说话人日志、语音合成等方向的算法研发工作,构建了云从科技整套语音算法引擎与应用服务平台。
刘雪松
OPPO音频算法专家,复旦大学硕士,曾任职于美国国家仪器、声网、云从科技等公司。在信号处理、音频算法和语音算法等领域有丰富的实战经验,在相关领域发表多篇论文及专利。
编辑推荐
