在业界,实时音视频的 QoE(Quality of Experience) 方法一直都是个重要的话题。之所以这么重要,其实是因为目前 RTE(实时互动)行业中还没有一个很好的可用于评价实时互动场景的 QoE 评价方法。 最古老的评定实时音频…
声浪
著名的开源录音编辑软件 Audacity 已被新成立的 Muse Group 公司收购,具体交易价格并未透露,好消息是 Audacity 仍将是免费和开源的。 Audacity 是最受欢迎的免费跨平台的开源音频编辑器之一。它可以在 Wind…
4月25日,余承东在华为开发者大会2021上(HDC.Cloud),发布盘古系列超大规模预训练模型,包括30亿参数的全球最大视觉(CV)预训练模型,以及与循环智能、鹏城实验室联合开发的千亿参数、40TB训练数据的全球最大中文语言(NLP)预…
随着技术的不断进步,使得我们每个人也越来越多地与Siri和Alexa等小工具互动。这些小工具现在也加入了Apple CarPlay和Android Auto等汽车助手的行列,甚至还有一些对语音生物特征识别敏感的应用程序。但是,设想一下,如果…
自18年谷歌BERT横空出世以来,预训练语言模型一跃成为自然语言处理领域的研究热点,海量数据与大规模模型的预训练+少量下游任务数据微调(Pre-training + Fine-tune)也成为NLP任务的新范式。 从在开源数据集上进行评测到…
The Multi-speaker Multi-style Voice Cloning Challenge 2021是爱奇艺、北京希尔贝壳科技有限公司、西北工业大学音频语音与语言处理研究组、清华大学深圳国际研究生院、新加坡国立大学、起源智能…
今天(4月13日)凌晨,NVIDIA GTC2021如约而至。其中三款基于Arm IP打造的处理器尤为引人关注: NVIDIA Grace:专为大规模人工智能和高性能计算应用而设计; BlueField-3 DPU:首款支持第五代PCIe总…
据知情人士透露,微软正在就收购全球最大语音识别技术公司Nuance Communications进行深入谈判。知情人士称,这笔交易最早可能在美国当地时间周日签署,最快将于周一宣布。 报道称,微软最早是于去年 12 月开始与该公司进行接触,并…
把老虎标成猴子,把青蛙标成猫,把码头标成纸巾……MIT、Amazon 的一项研究表明,ImageNet 等十个主流机器学习数据集的测试集平均错误率高达 3.4%。 我们平时用的机器学习数据集存在各种各样的错误,这是一个大家都已经发现并接受的…
根据3月29日在上海召开的全国声学大会语言声学分论坛上的现场报告整理而成。 报告摘要 在深度学习的推动下,语音识别取得了显著进展,但语音识别相关产品在落地上并不尽如人意。因此,在语音识别的基础技术上进行大胆创新,突破现有技术的边界,是人工智…
