直播回放

(因直播时技术原因,前4:18没有声音)


由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司、腾讯天籁实验室共同主办的【语音之家】AI技术沙龙——语音增强,将于2021年8月14号 9:30在线上直播进行。


沙龙简介

语音增强是提高语音质量、消除背景噪音和提取干净原始语音的技术方法,主流算法包括Filtering Techniques、Spectral Restoration、Speech-Model-Based等算法。该技术广泛应用在会议系统、移动电话、助听器、VoIP等场景。在日常生活中语音通信的质量往往受到周围环境噪音的影响,使用语音增强技术可以降低噪声的干扰,但如何保证语音的可懂度是该技术在产业应用的难点。噪音围绕在生活的每个角落,更好的技术让我们更好的倾听。


主持人  


王颖
中国信息通信研究院 云大所

智能语音产业研究员


参会嘉宾  


张学良
内蒙古大学教授,博士生导师
大象声科联合创始人&CTO

分享内容:基于深度学习的语音增强
摘要:语音增强从复杂声场中分离出目标人声,是语音智能交互的入口,对移动通讯、助听器设计和自动语音识别有着巨大的价值。传统方法通过对噪声信号的统计特性做出假设、构建模型、估计参数。而在实际环境中,假设很难成立,且参数估计也十分困难,难以满足应用需求。近几年以深度学习为代表的人工智能方法在语音降噪研究中表现突出。本次报告将介绍我们在基于深度学习的单通道和多通道语音增强上的一些研究进展。

嘉宾简介:张学良,内蒙古大学教授,博士生导师。大象声科联合创始人、CTO。2010年于中国科学院自动化研究所,模式识别国家重点实验室获博士学位。2010年进入内蒙古大学计算机学院,从事教学科研工作。2015年-2016年,美国俄亥俄州立大学访问学者。研究方向包括:语音分离/增强,计算听觉场景分析,语音信号处理。主持两项国家自然基金。发表论文包括IEEE/ACM Transactions on Audio Speech and Language Processing、ICASSP、INTERSPEECH等60余篇。2017年创立大象声科,为工业界应用提供基于深度学习的前端降噪方案。目前在手机、TWS耳机、PC和车载场景被大量采用。服务的客户包括:华为、联想、小米、oppo等。



商世东
腾讯会议天籁实验室总经理

分享内容:云视频会议中的音频实时解决方案介绍和未来展望

嘉宾简介:商世东,腾讯天籁实验室负责人,通信学会人工智能专委会委员。2019年年初回国加入腾讯,担任腾讯天籁实验室负责人,带领团队负责腾讯会议,腾讯云TRTC等等产品中全链路,全场景的实时音频分析,处理和评估等业界领先技术的研究和产品化落地,拥有20余年音视频领域相关经验,先后工作过摩托罗拉和杜比实验室,负责创建杜比北京的工程研发团队。加入腾讯前,担任杜比中国和澳大利亚高级研发总监。

After graduating from Peking University with master degree, Shidong first joined Motorola and started to work in audio and speech domains for consumer entertainment products like AVR, Blueray player and high-end amplifiers. In year 2010, Shidong joined Dolby Chinas as the director of Licensing Engineering team to take charge of Dolby mobile audio licensing business. In year 2015, Shidong relocated to Dolby Australia. On top of the team and scope of work in China, he extended his responsbility to lead Dolby Sydney consumer entertainment engineering team and build up Dolby Android-based SmartTV licensing business from ground-up. 
In the beginning of year 2019, Shidong moved back to China and joined Tencent to lead Tencent Ethereal Audio Lab. His team focus on cutting-edge and forward-looking audio and speech technology research and development.  They are responsible for the end-to-end audio technology solutions in Tencent Meeting, TRTC and a number of other Tencent products. The full technology spectrum of his team runs the gamut of speech and audio capturing, scene analysis and classification, signal processing, encoding, decoding and quality assessment for various device types and user cases in RTC scenarios.
In recent 2021 BIG DATA EXPO, his team was awarded the outstanding new technology medal for their significant contribution in real-time communication domain.



谢磊

西北工业大学教授,博导

西工大音频语音与语言处理实验室

(ASLP@NPU)负责人


分享内容:基于深度复数网络的语音增强:西工大ASLP Lab的实践
摘要:基于深度学习的语音增强取得了迅猛的发展,特别是近年来深度复数网络的应用,进一步提升了语音增强的效果。本次报告将首先汇报西工大音频语音与语言处理研究组在基于深度复数网络语音增强方面的一些实践,而后探讨如何利用基于深度学习的前端语音增强技术来提升噪声场景下的语音识别性能。

嘉宾简介:谢磊,西北工业大学教授,博导,西工大音频语音与语言处理实验室(ASLP@NPU)负责人。曾在比利时布鲁塞尔自由大学、香港城市大学和香港中文大学从事研究工作。获得教育部"新世纪优秀人才支持计划",陕西省青年科技新星、西安市青年科技奖等荣誉。研究兴趣为智能语音处理,包括语音增强、分离、识别、合成、转换等。在包括IEEE Transactions on Audio, Speech and Language Processing、 IEEE Transactions on Multimedia, ACL, Interspeech, ICASSP、ACM Multimedia 在内的重要期刊和会议上发表论文200余篇,带领团队多次获得学术会议最佳论文奖和多项国际评测第一名。主持多项国家和省部级科研项目。与腾讯、搜狗、阿里、小米、华为、字节跳动、微软、美团、爱奇艺、出门问问等业界企业开展了广泛深入的技术合作,众多研究成果已在企业获得应用,获得美团科研合作实践奖、华为优秀技术合作成果奖等。担任第十届国际中文口语语言处理学术会议(ISCSLP2016)程序委员会主席、第十一届和第十五届全国人机语音通讯学术会议(NCMMSC)程序委员会主席、IEEE口语语言处理研讨会(SLT2020)大会主席、2019中国多媒体大会(ChinaMM2019)程序委员会主席等。谢磊教授是IEEE高级会员、中国中文信息学会理事、中国中文信息学会语音信息专业委员会副主任,中国计算机学会语音听觉与对话专委会常务委员等。谢磊教授也担任了语音旗舰期刊IEEE/ACM Transactions on Audio, Speech and Language Processing的编委(AE)。


沙龙议程  



参加方式  

参会方式一:    


扫码进入直播间观看


参会方式二:

点击下方链接进入直播间

https://wx.vzan.com/live/tvchat-1468509491?v=1628672546121


沙龙联系人
闫亮
电话:18611344096    
邮箱:jack@speechhome.com