Model Search:查找最佳机器学习模型的开源平台 2 月 19 日,谷歌 宣布 发布了 Model Search,这是一个开源平台,旨在帮助研究人员高效、自动地开发和创建机器学习模型。 神经网络(NN)技术是否成功,往往取决于此类模…

最新声浪
查看全部 →大多数人会认为研发语音识别技术是一条艰难的道路,投入会巨大,道路会很漫长。我们于2019年11月组建了3人团队自主研发语音识别技术,包括2名算法工程师和1名后端工程师,历经半年,自研语音识别引擎效果超过第三方采购厂商,成功打造了58语音识别…
近日,出门问问联合西北工业大学音频语音与语言处理研究组推出面向产品和工业界的端到端语音识别开源工具WeNet,WeNet致力于消除从端到端模型研究到产品落地中的鸿沟,探索更适合工业级产品的端到端解决方案。 目前WeNet项目已经开源到:ht…
GPT-3 除了文本联想、翻译、写诗,还能画画、做财务报表、编程,「一个模型就可以做所有事」。通用,就是 GPT-3 的革命性。 2016 年,AlphaGo 可以说确立了 AI 的「围棋霸权」。但人工智能专家李志飞却说,「AlphaGo…
在CCF第十二届常务理事会第三次会议上,CCF语音对话与听觉专业组升级为CCF语音对话与听觉专委会,并荣获专委综合进步奖。 在2021年1月31日召开的CCF第十二届常务理事会第三次会议上,通过了关于语音对话与听觉专业组升级为语音对话与听觉…
在二十年前刚刚加入谷歌时,我们关注的问题只有一个——如何面向这么多不同种类的联网计算机提供一整套质量出色且涵盖范围全面的网络信息搜索服务。到如今,尽管我们面临着各种各样的技术挑战,但谷歌已经基本达成了组织全球信息,并使其具备普遍可访问性的总…
语音到语音翻译已经被越来越多地应用在人们的日常生活和工作中。但是目前的语音翻译系统高度依赖于语音对应的文本,不能应用于如方言、少数民族语言等没有文字的语言。为此,微软亚洲研究院提出了语音翻译系统 UWSpeech,该系统可针对没有文字的语言…
Mel-filterbank经常被用于训练声音分类算法,然而它存在的偏差也令其有明显的局限性。近日,Google提出了一种优于Mel-filterbank的前端LEAF,这种前端可以创建出具有最小偏差的音频分类模型。 在机器学习中,梅尔滤波…
说起语音识别,大家的第一反应就是那些看起来眼熟却总也搞不清楚的概念和公式,比如MFCC、HMM、GMM、Viterbi图、解码对齐等等,再往下深入,哪个是哪个,具体用途是什么,就都说不清楚了,总觉得那得是业内大牛才能搞懂的。去网上搜索,各种…
歌唱合成SVS(singing voice synthesis)是根据歌词和乐谱信息合成歌唱,相比于TTS使机器“开口说话”,歌唱合成则是让机器唱歌,因此更具有欣赏性。 互联网的时代,人机交互更加频繁和智能,歌唱合成则添加了人机交互的趣味性…
