当打开音乐软件时,你会看到依据情绪分类的歌曲集;当你尝试在社交软件捣乱时,色情或暴力言论会立马消失踪迹。


数字化时代,大数据和人工智能(AI)引导着计算机学科的发展,也正在逐渐进入人们的生活,它们的陪伴与守护从四面八方涌来。AI能够感知人类的声音,并理解声音中的感情,彻底搞懂我们身边的世界,做好内容安全把控与品质保障。



语音AI技术,是人工智能重要的研究和应用方向,和无人驾驶和机器人一样,成为近年来炙手可热的落地场景。由网易易盾、网易云音乐与“语言之家”携手推出的AI产业沙龙主题分享,于12月8日晚间完美落幕。直播突破了时间与地点的限制,将干货直接带给开发者与关注者。

5位网易语音领域的资深AI算法工程师齐聚一堂,在主题演讲中,将网易内部最新成熟的“语音AI技术”汇聚在一起,“语音识别”、"音乐信息检索"等一系列技术研究层出不穷,重点介绍相关AI算法原理与不同需求场景下的实践案例。

还在为错过了精彩的在线分享而苦恼吗?本文将带你回顾几场技术分享中的精彩细节,一网打尽重磅内容。

主题演讲

第一讲

李雨珂
网易易盾资深算法专家
《新合规下的AI内容风控体系建设》

随着移动端与通讯技术的发展,互联网内容的生产方式发生了巨大的转变,大众接触的内容生产者,从少数的专业媒体机构转向自媒体UGC内容。后疫情时代,一方面,数字文娱内容保持高速增长,但数字内容的生态并不乐观,另一方面,国家提高了对互联网健康度的把控,各类政策法规逐渐完善,处罚治理行动常态化。在企业、政府的重视下,AI审核能力发展迅速,一些难以识别的内容在AI的助力下已经能够做到高程度的自动化识别。

易盾团队关注利用人工智能实现不良有害内容的自动监测,因此本次分享围绕数字内容智能风控能力建设展开。基于前沿的语音识别技术,以及在私信、动态、帖子、直播、游戏、长短视频中高频率的社交娱乐交互场景,易盾研发了一套稳定的数字内容风控系统,不仅广泛应用于网易内部业务,同时在政务、金融、电商、文娱、游戏、文旅等垂直产业方向也得到了快速的发展,为客户带来效率。

易盾在“声学模型定向调优”、“解码阶段热词定制”、“多语言模型引入”等方面投入了大量精力,把其中的技术方案应用到了多种语音场景中,并针对不同客户的数据特点完成算法优化,从而塑造了两大优势:一是,在带有背景音乐、混响的场景下,仍能够保证良好的内容识别效果,二是,在面向客户特殊场景时,能够进行敏捷适配,提供优于通用ASR服务的识别效果。

第二讲

杜彬彬
网易易盾AI实验室资深算法工程师
《BBS-KWS创新算法》

本次分享介绍了VKW赛事的大致情况,网易易盾在VKW(Video Keyword Wakeup Competition)中获奖的算法方案BBS-KWS,及KWS的一些回顾展望。

BBS-KWS算法是一套基于ASR的语音关键词检测算法系统,算法中包含了一个ASR模块和一个KWS模块,“BBS”是应用于ASR模块中提升关键词检测能力的三个组件。

第一个B代表大主干(big backbone),算法中引入了Conformer结构作为基础,在模型前期引入更多卷积层提升特征表达能力,在重点捕获语义的编码层拓宽了多头注意力层。模型主干的能力被大大提升;第二个B代表关键词偏移(keyword biasing),算法在ASR解码过程中引入了基于语言模型的自适应热词权重,引导解码过程更偏向关键词;第三个S代表混合音节建模(syllable modeling units),算法引入了更小的建模单元音节,以获得更好的泛化能力。

除此之外也分享了一些对BBS-KWS继续提升的思路,如代理词的生成方式,与其他系统的结合等。BBS-KWS算法的tech report也已经放置在arxiv上,欢迎大家共同探讨。(https://arxiv.org/abs/2112.01757)

第三讲

张潆心
网易易盾AI实验室高级语音算法工程师
《声学模型的结构与适应性探索》

本次分享介绍了易盾自研ASR系统在模型结构和领域自适应方向的探索工作。近年来,自注意力机制以其弱归纳偏置、弱领域相关和高并行性,在各个机器学习领域被广泛运用,因此我们结合语音特征在时间和空间上的双重性,在transformer的基础上中引入1D-Conv,2D-Conv,Ponitwise Conv等多种卷积形态,通过对卷积不同层面的运用,从不同的角度加强了transformer类结构在语音任务上的表征能力。

在领域自适应方面,我们从文本和语音两个角度分享优化经验。首先在文本上介绍了领域文本增强和领域热词偏移机制,引导语言模型从源域向目标域偏移,提升模型在领域内的识别能力;从语音角度使用有监督和无监督训练,建立一条从数据采集、数据筛选、数据增量到迁移学习的pipeline,提高声学模型在领域内的表现能力。

第四讲

杨玉婷
网易易盾AI实验室高级语音算法工程师
《语音识别中的建模单元技术研究》

随着深度学习技术的发展,端到端语音识别技术成为学术研究和工业落地的热点。对于语音识别来说,建模单元的选择影响着整个系统的性能,是搭建模型的重要一环。

本报告首先围绕语音识别和建模单元技术展开,介绍了近年来在建模单元技术上的相关探索工作,总结了一些流行的端到端模型特点和常用建模单元,最后针对如何选择合适的建模单元进行讨论。

第二部分介绍了易盾在端到端中文语音识别技术上的建模方案。易盾利用多级建模让模型融合学习多级信息,提升端到端中文语音识别的性能。除此之外,也分享了在具体的下游任务应用中,利用多级建模模型在推理的过程中生成多级信息,通过多级信息检索进一步提升下游任务的性能。

第五讲

黄安麒
网易云音乐音视频算法专家
《音乐内容智能挖掘技术》

在网易云音乐,音乐内容分析挖掘一直是非常重要的业务,音乐内容分析挖掘的质量关系着音乐内容的精准分发与消费。

报告首先回顾了音乐科技的发展历程,了解音乐科技的知识体系,和音乐智能挖掘在其中的位置,并通过和图像、NLP技术的横向比较,了解音乐智能挖掘的特性和共性。

接着,分享深入探讨了音乐情绪分析的技术实现。以此为例,网易云音乐讲述面对海量歌曲曲库,人工标注成本高、效率低、标注质量不稳定的情况下,通过利用深度学习、迁移学习、多模态、知识蒸馏等技术智能化识别音乐内容相关要素,提高算法效果。最后,网易云音乐展望了音乐内容挖掘,赋能音乐内容生产,并分享了一些尝试案例。

最后
3个小时转瞬即逝,分享者全神贯注地对着电脑屏幕输出知识,技术分享有条不紊地推进着,静悄悄的会议室只能听见分享者精神饱满的讲解。屏幕上直播间内不断浮现的评论与点赞,观看人数的持续上升,增添了一股热闹的气氛。会议直播间热度高达2000+,累计获赞5000+。至此,语音AI技术研讨会圆满结束,期待与大家再次相见。