随着智能设备的日渐普及与其算力的逐渐提升,设备端的语音交互能力越来越受到重视。语音合成和语音转换近几年取得了很大的进展,作为以技术驱动的品质居住平台,贝壳一直致力于提供最好的服务品质,相关技术在贝壳内部也有很多业务场景得到应用。


2022年4月7日,由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、贝壳找房语音团队、语音之家、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙—语音技术在贝壳的应用成功举办,参会人数累计1800+,获赞2200+,突破了时间与地点的限制,将干货直接带给开发者与关注者。


下面让我们一起来回顾技术分享中的精彩细节。


邹伟

智能语音技术在新居住领域的应用

邹伟老师主要为我们分享了三部分的内容,第一部分是“智能语音技术应用现状”;第二部分是“新居住领域的语音应用”;第三部分是“贝壳找房语音技术简介”。


智能语音技术是我们人工智能技术的核心技术之一,在未来几年语音市场还是处于一个上升趋势。语音应用主要在2C和2B的两方面,2C主要立足于个人日常生活,主要包括智慧生活、智能家居、智能办公、智能驾驶等,2B则服务于特定场景,如智慧医疗、智慧教育、智慧电信/金融/电商等。


从全链路方面简单介绍了下语音技术在新居住领域方面的应用,如智能客服、智能家居、IOT设备、直播、装修等方面。基于贝壳服务平台需求,从智能IVR和智能机器人两方面着重介绍智能客服的应用技术,其核心目标为降本提效。其次就是贝壳在智能家居上的应用介绍,自有产品,即“小海智家”拥有全链路自研语音。最后通过音频事件检索实现瓷砖空鼓识别示例,介绍了语音技术在智能工地上的应用。


贝壳智能语音技术拥有语音识别、语音合成、语音唤醒、声纹识别、语音分析、语音信号处理等全链路的自研语音技术。各项技术都取得了一定的成功,如识别的场景字准可达96%以上,合成质量MOS4.2以上,声纹认证准确率99%等。贝壳语音技术在服务如智能客服、智能家居以及智能质检等自有产品之外,也积极参加学术界的一些交流,在ICASSP、Interspeech、NeurlPS等国际顶级学术会议上发表多篇论文,ICASSP ADD 2022挑战赛中生成任务、检测任务两个子赛道获得世界第一,ICASSP 2022 MISP挑战赛唤醒赛道获得世界前三,另外开源了一站式语音工具平台Athena。


文成

贝壳在语音生成任务的探索及应用

文成老师为我们分享了三部分的内容,第一部分是“语音合成技术在贝壳场景的应用”;第二部分是“技术背景概述”;第三部分是“ADD 2022生成任务方案分析”。


语音合成技术这些年发展很快,而贝壳业务主要以居住服务为主,合成技术主要赋能在AI讲房、智能家居和智能回访等方面。贝壳目前已经打造出了十多个音色,在未来的应用场景正在慢慢拓展。


技术背景可分为语音合成、语音转换,也可以统称为语音生成。语音合成经典系统包含文本分析、声学模型以及声码器三个模块,对三个模块的关键技术点以及该技术在工业上的要求做了简要介绍。而语音转换指的是将一个音频在不改变原始文本内容的情况下,对它里面的一些属性做出修改,如说话人转换和口音转换等。


语音生成技术如果被不法分子利用,尤其是用于电信网络诈骗,那会给我们带来非常多的危害,所以虚假音频检测技术则非常重要。在ADD 2022比赛中,贝壳语音在攻防两个子赛道均获得第一名。文成老师则针对贝壳在ADD 2022赛事中的生成任务部分做了详细介绍,包含生成任务详情、问题分析、系统描述、实验及结论等方面做了详细的介绍。


 周舒然

声纹技术在贝壳的探索和实践

周舒然老师的分享也分为三个部分,第一部分是“贝壳的业务场景”;第二部分是“声纹识别相关技术的应用”;第三部分是“ADD 2022比赛汇报”。


贝壳作为一个平台公司,有很多经纪人、门店、开发商会入驻,需要很多的智能化的手段来介入管理,目的是做到线上、线下一体化运营的品质类居住服务平台。语音相关技术在贝壳应用场景很广,线上想技术可以帮助线下,即经纪人去更好地服务客户。


声纹识别可以用来做身份认证,在贝壳声纹技术各场景中,教育主要是通过AI训练提升经纪人作业水平和服务质量;家居场景则主要是配合智能家居的说话人识别和唤醒;其次还有语音评测方面,可在服务过程中进行品质把控和客诉报警等。还可以用来做说话人日志,用来解决服务者之间服务方差大、问题难以追踪、服务场景还原等问题;另外还能用在空鼓声音事件检测上,做一个可量化和复制的工具。


在ADD 2022比赛中,生成任务是生成各种虚假的音频,用来骗过声纹检测系统,而检测任务,就是训练非常好的防攻击系统,来防止攻击。周舒然老师在检测任务部分,对主要攻击方式、成绩决定因素、数据层面、特征层面、模型层面、结果展示等部分做了详细的介绍。


韩阳

家居场景下语音唤醒技术的探索与实践

韩阳老师的分享可以分为四个部分,第一部分是“背景介绍”;第二部分是“流式语音唤醒——多尺度”;第三部分是“端到端语音唤醒——多模态”;第四部分是“未来展望”。


所谓语音唤醒,就是能够持续监听语音交流中的唤醒词。而评价语音唤醒技术的指标通常有两个,一个是唤醒率,另外一个是误唤醒。由于唤醒模型是部署在设备端,所以模型本身的功耗,还有空间的占用也是衡量唤醒性能好坏的重要的指标。语音唤醒应用最广泛的场景目前有两个,一个是车载场景,一个是家居场景。而家居场景下的语音唤醒主要有三方面的挑战,第一是家居远场的唤醒;第二是它的噪音和混响;第三是设备成本所带来的性能问题。业界对语音唤醒大体可以分为四种方案,第一是基于匹配的语音唤醒;第二是基于隐马尔科夫模型的语音唤醒;第三是基于深度神经网络的语音唤醒;最后是基于端到端模型的语音唤醒。


贝壳在工业落地上所用的方法是:在业界应用最广泛的流式语音唤醒基础上加入了多尺度的想法,通过各个尺度之间的优点相互弥补,以达到一个更好的整体性能。首先从数据采集层面,搭建了一套完整的数据录制和奖励发放的任务。然后在模型结构层面,采用了多尺度建模的方法,对神经网络模型进行建模。模型优化层面则是通过模型量化裁剪和聚类的方法,模型部署层面,除了支持常用的安卓和IOS系统等,还支持ESP也就是嵌入式设备。同时具备多样唤醒能力,如One-Shot、多唤醒词和命令词等。在实际场景中,整体唤醒率达到98%以上,平均误唤醒为0.014次/24小时。


唤醒技术在工业落地取得成果之外,在2021年多模态信息的语音处理国际挑战赛中也取得了第三的好成绩。韩阳老师对比赛的数据情况、数据处理、参赛方案(端到端多模态融合)、比赛结果都做了详细的介绍。


至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,期待与大家再次相见。