随着人工智能和大数据技术发展,语音识别技术凭借成本与算法复杂程度低、算力强等优势,在车载系统、机器人、家庭服务、银行、医疗、工业控制等领域得到越来越广泛的应用。


语音唤醒词是触发交互设备唤醒功能的语音口令,语音唤醒是指用户通过说出预设唤醒词实现设备从待机状态恢复到正常工作状态的过程。用户发出准确语音唤醒词是交互过程中关键环节之一。


录制场地要求

1、录音面积5-10㎡

2、本地噪音<40dBA

3、隔声亮>35dBA

4、混响时间<0.5s

5、每个地域需要10个简易录音棚


采集设备需求

1、采集麦克风和采集声卡选择低失真、高采样率、高信噪比设备

2、重放设备选用监听音箱

3、录音时离采集麦克风10-20cm左右,需要录音师指导放喷麦


音频格式要求

1、采集麦克风和采集声卡选择低失真、高采样率、高信噪比设备

2、重放设备选用监听音箱

3、录音时离采集麦克风10-20cm左右,需要录音师指导喷放麦


音频格式要求

1、录音采样率使用44.1/48kHz

2、录音采样位使用32bit

3、录音声道mono/stereo均可


录制脚本及人员要求

分为 四川话\上海话\粤语\普通话 四个语种,每语种分为三种指令类型 ASR\主唤醒词\快捷词

1、人员年龄:20岁-45岁

2、人员性别:男女比例1:1


音频录制要求

1、语速:每个人的语速至少要分为 “正常语速” 和 “快速”

说明:由于每个人的说话速度不一, 所以对于“正常” 和 “快速”的理解也不一致。对“正常语速”和“快速”的基本要求是: 吐字清晰, 不漏音, 不故意快读。不能快到含糊不清, 也不能慢到一字一顿.

2、次数:对于重复的文本(例如快捷词和主唤醒词),每个人说每句话, 正常语速和快速各占总次数的1/2。


音频质量要求

1、录音人外其他人的声音不采用,如有其他人声音录制进来, 在人工判断时需要重点甄别, 保证对实际录音人的数据无影响才能采用

2、录音人的喘气声可以采用, 但是声音过大不采用, 在人工判断时需要重点甄别

3、发音清晰, 不能有中途咳嗽, 不能结巴

4、患感冒时鼻音很重、或因病嗓子沙哑时,不能录音

5、录音人严禁刻意变声, 严禁刻意模仿某种说话方式

6、禁止在没有朗读完毕前抢停

7、如果读错字、咳嗽、偶尔噪音等现象应暂停录制,做好准备后重新录制

8、录制人员使用最自然的音量

9、每条音频对应的文本,不能读错,准确率需要达到100%。

10、发音人读每句话的音频前后至少保留1秒的空白




音频文件命名要求

1、录音文件命名:语种+指令类型+音频编号

注意:录音文件名只能采用字母、数字、“.”和“_”, 不得使用中文和其它字符

2、各语种的缩写如下:

(1)四川话SC

(2)上海话SH

(3)粤语CA(cantonese)

(4)普通话PT

录音文本类型缩写如下

(1)ASR:ASR

(2)主唤醒词:WUW

(3)快捷词:SSW(static short word)


人员信息记录

提供完整的人员信息及其对应音频文件,制作成Excel表格

1、Speaker: 录音人的姓名

2、Gender: 录音人的性别

3、Province: 录音人的出生省份, 为了进行地域标识

4、Age: 录音人的年龄

5、Speed: 说话人的语速 (正常语速Normal? 还是快速Fast?)

6、CommandNumber:发音人的人员编号

7、Text: 录音人朗读的文本


数据交付和质检方案

1、交付周期:每日需各语种100人的交付数据量

2、接收侧质检:

找上海话/四川话/粤语专家,对分批返回数据抽样评估合格率。不符合以下标准的接收侧视为不合格:

(1)符合录音的要求。

(2)发音自然,上海话/四川话/粤语,风格有没有偏差

(3)语速正常:没有快到含糊不清和慢到一字一顿的发音。

(4)录音文件没有突出的背景噪音:比如撞击声、敲击声等。

(5)发音人的性别和年龄分布和需求一致


总结

语音唤醒技术中的唤醒训练词的采集对训练效果尤为重要,直接决定系统对唤醒词识别的精确度。但现有技术方案中至少存在以下缺陷:

一是对具有方言及带有方言口音的普通话识别精度不高;

二是由于我国方言众多,部分使用人群较少的方言目前仍无法识别;

三是语料采集若单纯依靠实验室采集进度将十分缓慢且词汇量有限;若开放权限允许给各自营语音平台进行采集,虽可广泛采集数据,但可能涉及用户隐私的侵犯;

四是通过与现有自营语音平台对接获取语料,其中免费资源的准确率有限,付费资源虽然效果较好但成本昂贵。


文章来源知乎,文章作者:阿玲