亚马逊Alexa部门的研究人员最近发布了两篇关于语音识别的论文,远程语音识别的频域多声道声学模型和远程语音识别的多几何空间声学模型,(这两篇论文将于下月在布莱顿举行的第44届ICASSP国际声学、语音与信号处理会议上发表)。论文中他们提出了…
声浪
对于使用谷歌Pixel系列手机的用户来说,Gboard输入法的语音听写功能可谓是个神器,因为在很多时间,我们会发现打字聊天实在太累,语音消息有显得不太尊重,而Gboard输入法通过精准度高和错误率低的听写功能,完美的解决了这个难题。 但是由…
本文是面向 Web 开发者所写,介绍关于“语音交互”的一篇科普性质的文章,希望借助这篇文章,让开发者了解到什么是语音交互,以及YodaOS(https://github.com/yodaos-project/yodaos)中的技术实现。 作…
导读 基于联结时序分类(CTC)的声学模型不再需要对训练的音频序列和文本序列进行强制对齐,实际上已经初步具备了端到端的声学模型建模能力。 但是CTC模型进行声学建模存在着两个严重的瓶颈,一是缺乏语言模型建模能力,不能整合语言模型进行联合优化…
前文 今天我和大家聊聊FaceBook的《Convolutional Sequence to Sequence Learning》和Google的《Attention is All You Need》,它们都算是Seq2Seq上的创新,本质…
三岔路在前,让Transformer告诉你 正确的路在何方: 自然语言处理三大特征抽取器(CNN/RNN/TF)比较 全文导读 不久前我提出两个看法:一个是 Bert 这种两阶段的模式(预训练+Finetuning)必将成为 NLP 领域研…
全文导读 对于一些自然语言处理任务,比如聊天机器人,机器翻译,自动文摘等,传统的方法都是从候选集中选出答案,这对素材的完善程度要求很高,随着最近几年深度学习的兴起,国外学者将深度学习技术应用与自然语言的生成和自然语言的理解的方面的研究,并取…
全文导读 阿里在曾提出一种语音合成系统因其基于深度前馈序列记忆网络,在达到与基于双向长短时记忆单元的语音合成系统一致的主观听感的同时,合成速度是后者的400%,但是模型大小只有后者的四分之一,这对于内存占用和计算效率非常敏感的端上产品环境是…
1、背景 热词唤醒 (Keyword Spotting) 往往是用户对语音交互体验的第一印象,要做到准确快速。因此热词检测算法要同时保证高唤醒率和低误唤醒率,能够准确地区分热词和非热词的音频信号。主流的热词检测方法,通常使用深度神经网络来从…
这是一篇谷歌语音团队在2018 interspeech上分享。ppt很长,大概180页左右,讲述了谷歌团队如何从CTC、RNN-T、LAS一步一步趟坑过来,然后把LAS做成谷歌线上产品。非常敬佩这个强大的团队,特别感谢他们的分享,这里分享给…
