1、素材来源
YouYube爬取美联储、白宫发布会、政要座谈会等时政素材的中文同传现场,原始时长约两个半小时。
场景上,本期测试的特点为英文、中文声音交叠,同时进行。本类素材,源语言说话人的音量一般会被压制的非常低,可听见,但听不清内容从语音识别的角度来看更像是一种噪音。这种人声噪声对频谱造成的干扰比一般噪声要复杂得多,对语音系统的挑战也更大。内容上,本期测试内容很简单,主要是一些时政新闻中的常见词汇和话题。
2、场景特点
1)环境
- 同传室,制作棚,同传人员周边安静,无噪声。
2)拾音设备
- 专业麦克风,近场
3)说话人
- 同传翻译员
4)说话方式
- 语速中等偏快
- 吐字清晰
- 组织语言常见卡顿,重复
5)方言
- 标准化
6)内容领域
- 时政
3、测试结果
测试时间:2020.10
本场景会进行定期重测(每3个月),关注最新滚动测试报告查看最新结果

*讯飞目前被低估,目前为听写服务,转写服务接入调试中。详见(SOTA)
4、简评
本场景为英文到中文的同传现场,场景目标是识别中文内容,由标注员负责切分并标注中文同传声音的片段。虽然英文音量非常低,但与切分出的中文部分有少量交叠(同传卡顿间隔,反应延时等等)。讯飞和阿里的引擎对低音量灵敏且对英文比较灵敏,经常识别出零散的英文乱码词汇,错误率较高。
