语音识别是AI领域的一项重要基础服务,同样也是vivo AI体系中举足轻重的能力,是Jovi输入法、Jovi语音助手等应用的基石。打造高准确率、高性能的语音识别引擎,才能给vivo亿级的语音用户带来良好的体验。基于wenet端到端语音识别工…
声浪
自从2020年小鹏P7上市后,其搭载的全场景语音交互系统就成为车载语音交互产品的标杆。小鹏G9发布也带来了语音系统的升级。因为目前市面上还没办法体验到最新的系统,本文根据B站的体验视频,对小鹏G9上的三个语音功能进行介绍和分析。 功能介绍…
流式语音识别的大厦已经落成,天空中只漂浮着两朵乌云:尖峰漂移和长尾数据。本文则主要关注前者。 1. 前言:想象力的游戏 作为本文的开篇,我想先致敬一下我心中的真神:麦克斯韦(Maxwell)。他最重要的贡献,就是发现了物质的一种新的存在形式…
WeNet在正式发布两年的时间里,成为非常热门的ASR生产工具,其面向生产的属性更是深受工业界的好评。近期,喜马拉雅团队在WeNet中支持了Squeezeformer的相关工作。本文由喜马拉雅珠峰智能实验室撰写,介绍了Squeezeform…
作者介绍 周维,58同城AI Lab语音算法部负责人。负责语音识别、语音合成算法研发。 58同城AI Lab部门简介 58同城AI Lab隶属TEG技术工程平台群,旨在推动AI技术在58同城的落地,打造AI中台能力,以提高前台业务人效、收入…
曾几何时,个人搭建语音识别系统是一件非常复杂的系统工程,需要涉及到语音识别算法、服务端开发、网络通信、前端开发等技术,个人开发者很难全栈掌握,甚至很难熟练的使用这些技术。 得益于语音识别技术的开源运动和深度学习应用技术的发展,日前,WeNe…
目前,WeNet实验性加入了对RNN-T的支持。本文从模型架构、代码实现、部分实验结果等三方面来介绍。该工作由 WeNet 社区姚卓远、丁涵宇、张悦铠、周鼎皓等同学共同完成,目前还在进一步完善。 1. U2/U2++-T
wenet中的模型用的是pytorch中的动态量化,只有部分算子如linear是量化的,其它如 CNN 是未量化的。也就是浮点和定点运算混合的。浮点输入碰到定点的算子时,会调用 Quantize 将输入转换为int8。定点输入碰到浮点算子时…
可能需要看一下你的word piece 是怎么对 ASR 分词的。
