垃圾,词典里给出的解释是:“废弃无用或肮脏破烂之物”。其实在语音交互这个领域也是有很多“垃圾”需要过滤或者回收再利用,今天就让我们看看语音交互的垃圾分类图签。 本底噪音(ground noise)和背景噪音(background noise…
声浪
MASR 中文语音识别 MASR是一个基于端到端的深度神经网络的开箱即用的中文普通话语音识别工具。 最新更新:使用声学嵌入查找音近字 MASR的特点是: 开箱即用 只需要不到5分钟,你就可以运行本项目并完成第一次中文语音识别 使用与训练分离…
XLNet和Bert比,有什么异同?有什么模型方面的改进?在哪些场景下特别有效?原因又是什么?本文通过论文思想解读及实验结果分析,试图回答上述问题。 首先,XLNet引入了自回归语言模型以及自编码语言模型的提法,这个思维框架我觉得挺好的,可…
逆天的语言模型GPT-2又有最新开源进展了! GPT-2,这个造假新闻编故事以假乱真,能完成阅读理解、常识推理、文字预测、文章总结等多种任务的AI模型,从诞生开始就引起大量关注。 但因一开始只放出了117M的小型预训练模型,OpenAI还被…
随着目前人工智能产业的高速发展,人工智能技术也呈现出百家争鸣的态势。在经历了关键词搜索时代到语音交互时代的转变,作为人工智能领域「皇冠上的明珠」NLP 技术显然已经面临着一个最好的时代。 ————本文来自立委NLP频道
亚马逊Alexa部门的研究人员最近发布了两篇关于语音识别的论文,远程语音识别的频域多声道声学模型和远程语音识别的多几何空间声学模型,(这两篇论文将于下月在布莱顿举行的第44届ICASSP国际声学、语音与信号处理会议上发表)。论文中他们提出了…
对于使用谷歌Pixel系列手机的用户来说,Gboard输入法的语音听写功能可谓是个神器,因为在很多时间,我们会发现打字聊天实在太累,语音消息有显得不太尊重,而Gboard输入法通过精准度高和错误率低的听写功能,完美的解决了这个难题。 但是由…
本文是面向 Web 开发者所写,介绍关于“语音交互”的一篇科普性质的文章,希望借助这篇文章,让开发者了解到什么是语音交互,以及YodaOS(https://github.com/yodaos-project/yodaos)中的技术实现。 作…
导读 基于联结时序分类(CTC)的声学模型不再需要对训练的音频序列和文本序列进行强制对齐,实际上已经初步具备了端到端的声学模型建模能力。 但是CTC模型进行声学建模存在着两个严重的瓶颈,一是缺乏语言模型建模能力,不能整合语言模型进行联合优化…
前文 今天我和大家聊聊FaceBook的《Convolutional Sequence to Sequence Learning》和Google的《Attention is All You Need》,它们都算是Seq2Seq上的创新,本质…
