今天我们把 TIOBE 测试集中的 [新闻联播] 场景精标测试集免费分享给大家。


目的有以下几个:

  • SpeechIO TIOBE 项目发布至今已半年有余,回馈现有读者的关注。

  • 如果有厂商的开发同学关注 TIOBE,对我们的测试调用有疑虑,可以获取该测试集,并在后台联系我们,我们可以提供该测试集最近一次滚动测试的原始log,配合厂商同学做端到端调用的一致性验证。

  • 新闻联播场景可以说是一个“已经解决”的语音识别场景,行业的整体准确率基本上都已经接近或者达到人类水平,我们在每月的滚动测试中反复测试该数据集的参考意义不大,因此也更适合分享给大家。


测试集信息:

  • 场景:新闻播报

  • 领域:央视时政

  • 时长:共5069句测试音频,累计约9小时

  • 压缩包大小:约800M

  • 随压缩包,用户可获取一份 CC BY-ND 4.0的 license 授权,该授权意味着:

    • 你可以在任何场景(包括商业)使用该数据集

    • 你可以在下游项目中对该数据集进行再分发

    但需满足前提:

    • 对该数据集的使用和再分发过程中,需声明对数据集制作方的acknowledgement

    • 不许对数据集的内容及数据做出任何篡改


获取方式:

  • 关注公众号,在后台聊天中回复“天王盖地虎小鸡炖蘑菇”(无标点符号),即可收到下载链接回复。

  • 下载链接有效期:2020.10.11 - 2020.10.17


关于打赏:

  • 数据集的分发途径,我们没有选择百度盘这样的龟速免费平台,因此每次下载都会产生费用,所以我们希望(但不要求)成功获取数据集的同学可以打赏本文章,数额随意。