此次讲座从时频遮蔽的音频盲源分离基本原理开始,分析了经典时频遮蔽音频盲源分离方法的优势与局限性,随后讨论了最新深度学习方法应用在时频遮蔽音频盲源分离方向上的研究进展与瓶颈问题。最后分享了一些常用的音频盲源分离性能测试数据库,并探讨了今后音频…
声浪
《麻省理工科技评论》“十大突破性技术” 榜单迎来诞生二十周年的日子。2021“十大突破性技术” 发布会也于今天下午在杭州余杭未来科技城举办。 本次会议由中共杭州市余杭区委、杭州市余杭区人民政府、《麻省理工科技评论》主办,浙江省委组织部(人才…
AI虐我千百遍,我待AI如初恋。什么才是好AI?答:能落地的AI才是好AI。AI项目从无到有,最终落地开花,无非不是挖坑、踩坑、填坑的过程。本文从笔者的一些经历、经验、血泪教训展开,说一下AI项目研发过程中的感想。 被虐的案例 案例1:经过…
Facebook、哥伦比亚大学、佐治亚理工学院和达特茅斯大学的研究人员共同开发了一个框架——Vx2Text。这个框架可以帮助我们,从视频、音频等输入内容中提取信息,再以人类可以理解的文字,生成字幕或者回答问题等。 论文地址:https://…
滴滴是一个让出行变得更美好的公司,语音交互作为出行领域最安全,最自然的交互方式在滴滴内部有着广泛的应用前景,目前滴滴语音交互已经应用在智能外呼,司机端,地图,车机系统多个领域中。语音交互离不开自然语言理解,用户说的每一句话都应该得到正确的理…
Model Search:查找最佳机器学习模型的开源平台 2 月 19 日,谷歌 宣布 发布了 Model Search,这是一个开源平台,旨在帮助研究人员高效、自动地开发和创建机器学习模型。 神经网络(NN)技术是否成功,往往取决于此类模…
大多数人会认为研发语音识别技术是一条艰难的道路,投入会巨大,道路会很漫长。我们于2019年11月组建了3人团队自主研发语音识别技术,包括2名算法工程师和1名后端工程师,历经半年,自研语音识别引擎效果超过第三方采购厂商,成功打造了58语音识别…
近日,出门问问联合西北工业大学音频语音与语言处理研究组推出面向产品和工业界的端到端语音识别开源工具WeNet,WeNet致力于消除从端到端模型研究到产品落地中的鸿沟,探索更适合工业级产品的端到端解决方案。 目前WeNet项目已经开源到:ht…
GPT-3 除了文本联想、翻译、写诗,还能画画、做财务报表、编程,「一个模型就可以做所有事」。通用,就是 GPT-3 的革命性。 2016 年,AlphaGo 可以说确立了 AI 的「围棋霸权」。但人工智能专家李志飞却说,「AlphaGo…
