更新日志

新加入语音平台:

  • 创业公司 S


新加入场景:

  • 天下足球 世界杯往事

  • 罗振宇 跨年演讲

  • 李永乐老师 在线讲堂

测试框架:

  • 修复搜狗知音平台多句结果的解析bug

新增测试:

  • 全厂商 × 全场景 滚动刷新


滚动测试

最新滚动测试结果汇总


注:纵轴字准确率%,绘制范围为[80, 100],刻度为 1%



各场景历史测试结果

新闻联播



鲁豫有约 一日行



天下足球 世界杯往事



罗振宇 跨年演讲



李永乐老师 在线讲堂



后记

  • 我们在引言中反复提到,以现阶段AI技术的泛化能力,优化到极致的语音识别应用一定是不通用的,比较性能需要明确场景、应用领域。但以目前我们拿到的结果来看,谷歌在中文识别上,和国内其余厂商不在一个水平线上。这个差距之大,已经与场景、领域无关。毫无疑问谷歌是现代语音技术的开拓者,公众号的读者朋友们可以在此思考一下:技术,对一个语音识别服务性能的作用,是否是决定性的?我们在AI领域每天都见到的 “我们有最先进的技术,因此我们的性能最好” 这一逻辑链条是否足够充分?


  • 可以看到,在我们目前已经建立的测试场景下,整体的中文准确率已经达到90%,甚至95%以上,这说明各家的“通用”服务,在这些高质量场景下已经可以实用,若商业场景价值链清晰,做相应定制优化,性能只会更好。语音行业应用的探索,需要全社会更广泛的认知和共同尝试。当然,作为一个测试项目,我们后面也会选取更多样,更有挑战的测试场景供大家参考。


  • 后台有朋友留言询问测试的具体配置,这部分内容我们在系列文章最早期的[测试规范]中已经有详细说明,每篇文章的顶部有链接入口。需要注意,在实际实施中,有一点与最初定义的规范不一致:

    • 规范中,我们设想的是关闭VAD,使测试语音更接近核心引擎(因为我们的测试集都是经过人工切分的句子)

    • 实际实施中,我们发现大部分厂商并不提供 VAD(人声检测) 开关,且默认开启 VAD。在这个前提下,关闭VAD会为部分厂商带来不对等的性能优势,为了保证测试的一致性,我们最后决定把测试规范中的VAD配置统一为开启。

  • 我们一般在每月20日前完成当月测试,因此并不一定保证能覆盖月末的模型更新,新结果需要等到下月的滚动测试体现。