直播回放


由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司共同主办的【语音之家】AI技术沙龙——语音合成,将于2021年7月24号 9:30在线上直播进行。



沙龙简介

语音合成(Speech Synthesis)技术已经被广泛应用在智能客服、新闻播报、有声阅读等业务场景。实现从文本到语音(Text To Speech)的转化,解决了人机语音交互的闭环,多语言多情感的实现赋能了机器的发声。所熟知的微软小冰、小爱同学、小度音箱等已经陪伴在我们生活当中,成为了人类的助手。但是在TTS的高拟真度、声音多样性、情绪控制等还存在一些问题需要解决,人类的对话不仅是一个发声而是有思想、有情感、有内容的更深入表达。TTS技术未来如何发展,值得我们思考与期待。



主持人


李 超
百度语音技术部经理



参会嘉宾

吴志勇
清华大学深圳国际研究生院副研究员、博士生导师

分享内容:面向智能语音交互的可控表现力语音建模与合成
摘要:随着人工智能技术的发展以及语音交互产品的广泛应用,智能语音交互在人们日常生活中获得广泛应用,人们对和谐语音交互的期望也在不断提高。语音信号中不仅包含了语言语义信息,同时也传达了说话人、风格、情感、重音、语气等多种丰富的副语言信息。这些副语言信息承载了语音的言外之意,是语音表现力的重要方面,在传递信息时扮演着非常重要的作用,是和谐语音交互不可或缺的因素。如何对语音中的副语言信息进行有效分析和建模、并进行可控的表现力语音生成,是构建和谐智能语音交互技术、提升用户满意度的关键,也是语音及自然语言处理领域的重要研究热点。

嘉宾简介:吴志勇,清华大学深圳国际研究生院副研究员,博士生导师。清华大学-香港中文大学媒体科学、技术与系统联合研究中心副主任。研究兴趣为面向人工智能的智能言语交互技术,包括:智能语音交互、情感计算、表现力可视语音合成、自然语言理解与生成、音视双模态联合建模,机器学习等。发表学术期刊及会议论文100余篇。中国计算机学会语音对话与听觉专业委员会委员,全国人机语音通讯学术会议常设机构委员。承担国家自然科学基金、香港特区政府研究资助局基金、国家社会科学基金等多项课题。获2009及2016年度教育部科学技术进步奖。指导的学生多人次获得优秀学位论文、国家奖学金、优秀毕业生。


栾 剑
小米技术委员会AI实验室语音生成团队负责人

分享内容:序列到序列语音合成网络中编码器结构的探索

摘要:近年来,序列到序列神经网络成为语音合成任务的主流框架,显著地提升了合成语音的效果。这个框架主要由编码器、解码器以及编解码器之间的对齐模块三部分组成。编码器主要功能是从输入文本中提取与发音、韵律相关的语义信息。 这些信息的准确与丰富程度直接决定了合成语音的自然度与表现力。本报告分析了目前主流的编码器方案,CBHG(Tacotron),CNN+BLSTM(Tacotron2),Self-Attention+CNN(FastSpeech)等等,并着重介绍小米提出的对编码器多层结果进行聚合的思路。同时报告还将简要介绍语音合成在小米产品上的主要应用。


嘉宾简介:栾剑,现任小米技术委员会AI实验室语音生成团队负责人。曾任东芝(中国)研究院研究员、微软(中国)工程院高级语音科学家、微软小冰首席语音科学家及语音团队负责人等职位。长期从事语音方向的技术研究和应用,在声纹识别、语音合成、歌唱合成、语音识别、语言副信息提取等多个领域都有深入研究并取得重要成果。主导开发的微软小冰语音合成系统和歌唱合成软件X-Studio,均处于世界领先水平,深受用户好评。在国际顶级学术会议和杂志发表论文10余篇,在中国、美国、日本等地获批专利50多项。





何 磊

The principal scientist manager in Speech China team of Microsoft


分享内容:

Neural Text-to-Speech @Microsoft-large scale production and ongoing exploration

摘要:Neural TTS has been dominating TTS research and product since 2016.  In this talk, Lei He will brief a few key challenges of Neural TTS in large scale production, and the progress in Microsoft with some demonstrations. Then, Lei He will introduce several ongoing explorations in TTS modeling, as higher expressive neural TTS, human parity TTS beyond sentence, and synergy of speech recognition and speech synthesis.

嘉宾简介:Lei He is the principal scientist manager in Speech China team of Microsoft. He has been driving the technology roadmap of Text-To-Speech and leading a scientist team to build the world class technology for Microsoft TTS products and services, which consist in more than 250 voices and 70 languages and variants now. 

Since 2016, Lei He focused on research of neural TTS and worked with engineering team to release high quality neural voices across 51 locales and enable custom neural voice creation in MS Azure TTS service. Recently, He continued pushing forward speech modeling, for wider and deeper TTS applications. 

Before MS, Lei He was senior researcher and research manager in TOSHIBA, with research interests in speech signal process, speech recognition and speech synthesis. 

Lei He is the senior member of IEEE, with 50+ publications and 20+ patents.


沙龙议程



参加方式

参会方式一:  


扫码进入直播间观看


参会方式二:

点击下方链接进入直播间

https://wx.vzan.com/live/tvchat-1581514982?v=1626771265354


沙龙联系人
闫亮
电话:18611344096    
邮箱:jack@speechhome.com