新加入场景:
直播 带货
直播 王者荣耀
老罗语录
平台:
去掉谷歌:往期测试表明谷歌在中文领域的性能没有参考性,且其费用超过其余所有平台调用费用之和。
临时加入"阿里+"(阿里云的新算法预发试用版),同时并行测试公网正式版"阿里"供对比,试用版正式上线后会合并回"阿里",TIOBE的历史数据曲线以公网"阿里"为准
原搜狗知音平台更名为搜狗AI平台
新增测试:
全厂商 × 全场景 滚动刷新
滚动测试
最新滚动测试结果汇总

后记
在上图中,本期我们特意将纵轴的绘制范围,从原来的 [80,100] 调整到 [0,100]。大家可以用这个范围的视角,看一下新闻联播的横向对比(厂商间),以及新闻联播与本月加入的直播、老罗语录等困难场景的纵向对比(场景间)。有趣的是,场景的差别给各家厂商带来的性能下降,惊人的接近,这其中体现的,就是行业整体。
把场景对语音识别性能的这种巨大影响展现出来,是希望大家直观的认识到以往“XXX的语音识别达到97%的准确率/超越人类”这一类抛开具体场景的概述,纯粹是一种宣传手段。只要人们认可这种宣传,所有厂商就不得不跟风玩这个口头的数字游戏。而实际上,大家坐下来采集并标注一个基于真实业务的测试集,测后性能满足需求,就安稳的上线;性能不够就拉上厂商针对性的投入进行定制优化,才是正道。
本月腾讯应该有较大更新,对比历史有大幅度性能提升。
"阿里+"相比"阿里",在已有的高准确率场景下,有小幅提升,但对于困难场景,提升幅度巨大,说明这类的技术进步在提升语音识别的通用性,也即我们常说的泛化能力。
因为本月滚动测试的绘图范围拉宽,想了解厂商间的横向对比,读者可以查阅文章后面的历史测试数据表。
我们对于测试集的爬取大概都是提前两个月进行。测大众熟悉的材料,是我们的一个原则,所以也希望公众号的读者朋友们可以提供反馈给我们:
提起“经济&财经”,大家脑海中第一时间想到的素材是什么,可以是电视节目,网络视频,电台节目,播客,峰会论坛摄像视频等。
“辩论”场景下,大家又有什么推荐和想看的测试素材。
后台留言即可,我们都可以看到。
最后是个小声明,因为微信公众号文章的展示机制现在也转成推荐,这意味着即便你订阅了我们公众号,也不保证我们的内容能最终出现在你的推荐流中。参考了其他公众号的声明,通过公众号标星,对文章打标“在看”,朋友圈,聊天中的分享,都可以提高我们的信息出现在你视线中的概率。大家觉得我们生产的信息有参考意义,请酌情分享。也欢迎通过后台留言给我们反馈意见。
各场景历史测试结果
新闻联播

鲁豫有约 一日行

天下足球 世界杯往事

罗振宇 跨年演讲

李永乐老师 在线讲堂

直播 王者荣耀 张大仙&骚白

直播 带货 李佳琪&薇娅

老罗语录

