今天我们把 TIOBE 测试集中的 [新闻联播] 场景精标测试集免费分享给大家。
目的有以下几个:
SpeechIO TIOBE 项目发布至今已半年有余,回馈现有读者的关注。
如果有厂商的开发同学关注 TIOBE,对我们的测试调用有疑虑,可以获取该测试集,并在后台联系我们,我们可以提供该测试集最近一次滚动测试的原始log,配合厂商同学做端到端调用的一致性验证。
新闻联播场景可以说是一个“已经解决”的语音识别场景,行业的整体准确率基本上都已经接近或者达到人类水平,我们在每月的滚动测试中反复测试该数据集的参考意义不大,因此也更适合分享给大家。
测试集信息:
场景:新闻播报
领域:央视时政
时长:共5069句测试音频,累计约9小时
压缩包大小:约800M
随压缩包,用户可获取一份 CC BY-ND 4.0的 license 授权,该授权意味着:
你可以在任何场景(包括商业)使用该数据集
你可以在下游项目中对该数据集进行再分发
对该数据集的使用和再分发过程中,需声明对数据集制作方的acknowledgement
不许对数据集的内容及数据做出任何篡改
但需满足前提:
获取方式:
关注公众号,在后台聊天中回复“天王盖地虎小鸡炖蘑菇”(无标点符号),即可收到下载链接回复。
下载链接有效期:2020.10.11 - 2020.10.17
关于打赏:
数据集的分发途径,我们没有选择百度盘这样的龟速免费平台,因此每次下载都会产生费用,所以我们希望(但不要求)成功获取数据集的同学可以打赏本文章,数额随意。
