Leaderboard 项目新增基于 WenetSpeech 数据集的 WeNet 预训练模型,识别准确率如下: 具体数字如下: 该模型可与公众号之前发布的开源测试集配合使用,进行本地复现和验证,模型的下载命令为: ops/pull mod…
声浪
唤醒 熟悉Kaldi ,并且搞清当中做语音唤醒的功能 一个不错的github 资https://github.com/zycv/awesome-keyword-spotting#opensource-code https://papersw…
我们常见的PLDA,是出自《Probabilistic Linear Discriminant Analysis for Inferences About Identity》,由Simon J.D. Prince和James H. Elde…
近日,由腾讯音乐娱乐集团(TME)主办的音乐娱乐技术盛会“TechME技术周”在深圳成功举办。本次会议以“Rock N Code,让技术发声”为主题。 会议中由TME技术领域专家、音乐行业优秀技术团队和语音界大咖对技术成果进行了分享,同时共…
2021年10月15日至18日,第十六届全国人机语音通讯学术会议(NCMMSC2021)在江苏省徐州市举行。作为国内语音领域广大专家、学者和科研工作者交流最新研究成果的重要平台,NCMMSC 受到了国内语音领域的广泛关注。 会议网址:htt…
第十六届全国人机语音通讯学术会议(NCMMSC 2021)公布“长短视频多语种多模态识别挑战赛”(Video Keyword Wakeup Competition)-— 汉语长短视频直播语音关键词(VKW)任务最终成绩。 历时4个月的征集与…
日前,西北工业大学音频语音和语言处理研究组(ASLP Lab)、出门问问、希尔贝壳联合发布1万小时多领域中文语音识别数据集 WenetSpeech,在腾讯会议天籁实验室、华为昇思 MindSpore、 西安未来人工智能计算中心等机构大力支持…
SpeechIO TIOBE ASR Benchmark 滚动测试报告 2021年10月 更新日志 最新更新日期:2021.10 2021年10月 场景:增加
1、素材来源 YouYube爬取美联储、白宫发布会、政要座谈会等时政素材的中文同传现场,原始时长约两个半小时。 场景上,本期测试的特点为英文、中文声音交叠,同时进行。本类素材,源语言说话人的音量一般会被压制的非常低,可听见,但听不清内容从语…
