SpeechIO TIOBE Benchmark

新增场景:听障语音,诗词,文言文,音乐歌词

SpeechIO语音识别评测新增三个测试场景,本篇文章只介绍新场景的基本信息,不包含测试结果(具体测试结果将在后续滚动测试中发布)。

另外需要说明,本期新增的几个场景都特别“偏门”,我们希望借此拓展测试范围,但并不希望过多的引入偏门场景主导整个Benchmark的结果。因此这几个新增场景的时长都较短,在SpeechIO整体测试集中的占比很小。

新增场景:听障语音


1、素材来源

邀请听障人士录音房朗读脚本。听障人士因接收到的语音输入与常人不同,所以这个群体说话的方式和发音也与正常人有极大区别,但一定程度上仍然可以被他人听懂。该场景我们选取了约40分钟的测试音频。


2、场景特点

  • 环境

    • 录音棚,环境安静

  • 拾音设备

    • 专业录音麦克风

  • 说话人

    • 听障患者

  • 说话方式

    • 朗诵

  • 方言

    • 无方言

  • 内容领域

    • 新闻文本


新增场景:诗词朗诵


1、素材来源

Youtube爬取上百首经典唐诗宋词朗诵,原始音频时长约 1.5 小时。


2、场景特点

  • 环境

    • 录音棚,环境安静,部分节目配有舒缓的背景音乐。

  • 拾音设备

    • 专业录音麦克风

  • 说话人

    • 专业播音员

  • 说话方式

    • 朗诵

  • 方言

    • 无方言

  • 内容领域

    • 唐诗

    • 宋词


新增场景:文言文朗诵


1、素材来源

Youtube爬取。文言文内容本身难度大,生僻字多,对语音识别引擎的挑战很大。原始音频约40分钟。

2、场景特点

  • 环境

    • 录音棚,环境安静,部分节目配有舒缓的背景音乐。

  • 拾音设备

    • 专业录音设备

  • 说话人

    • 专业播音员

  • 说话方式

    • 朗诵

  • 方言

    • 无方言

  • 内容领域

    • 论语,老子,诗经,孙子兵法


新增场景:音乐歌词识别


1、素材来源

爬取音视频网站上的音乐MV,原始音频约1.7小时。

歌词的识别一直是语音识别面临的挑战之一:一方面歌词是以演唱的方式唱出,与正常讲话截然不同;另一方面音乐中有大量的背景噪声,包括乐器、鼓、电子合成音效音轨等。


2、场景特点

  • 环境

    • 专业录音棚

  • 拾音设备

    • 专业录音麦克风

  • 说话人

    • 男女歌手

  • 说话方式

    • 唱歌

  • 方言

    • 无方言

  • 内容领域

    • 覆盖不同种类的音乐,包括说唱音乐,民谣,流行音乐,古典音乐,摇滚等。