由CCF语音对话与听觉专委会 、中国人工智能产业发展联盟(AIIA)评估组 、字节跳动科技有限公司-智能创作语音团队、语音之家、北京希尔贝壳科技有限公司共同主办的【语音之家】AI产业沙龙-语音&音乐技术在字节跳动平台的应用,将于2021年12月23日12:00-14:00通过语音之家微信视频号直播。

参会嘉宾

黄传增


嘉宾简介:毕业于中科院声学所, 毕业后在Dolby从事音频编解码, 音频处理算法和工程化落地工作; 加入字节后负责抖音音频业务支持, 主要负责音频特效算法系统, 音频录音前处理算法, 音频播放后处理算法的研发和技术落地, 也带领团队开展语音理解,音频副语言理解的研发, 致力于打造智能音频理解和处理方案, 促进音频创作和消费升级。


报告题目:音频处理和理解在短视频的使用
摘要:以项目的形式分享我们对于短视频场景的一些尝试。



王玉平

嘉宾简介:毕业于中国科学技术大学,并在科大讯飞语音实验室获得硕士学位,从研究生阶段起一直从事语音合成相关技术的研究和落地工作,从传统的 HMM based SPSS 到现如今基于神经网络的语音合成都有比较深入的研究和理解。加入字节跳动后一直致力于将语音合成相关技术应用在字节跳动的业务平台,研发的语音合成、声音转换相关系统落地在抖音、西瓜等业务平台上,并一直探索在少量数据情况下构建高质量语音合成的方案。


报告题目:语音合成在字节跳动平台的应用探索

摘要:近年来,随着深度学习和人工智能的发展,基于神经网络的 TTS 技术显著提高了合成语音的质量,为了解决实际产品中对语音合成的效果和效率的要求,我们研发了基于神经网络的语音合成系统,包括前端、声学模型和高性能声码器,能极大提升语音合成的效果,并且能保持非常高的效率;同时,为了探索语音合成在娱乐场景下的新玩法,我们也在研究说话人在只有少量数据的情况下,可以合成说话人音色的流利的其他语言的语音,也可以让说话人以说或者唱的形式来进行自由的表达。



孔秋强


嘉宾简介:孔秋强于2020在英国萨里大学获得博士学位,目前就职于字节跳动。他的研究方向包括一般音频和音乐信号处理。他的代表作包括大规模声音分类和检测模型PANNs、声音分离系统,及大规模音乐数据集GiantMIDI-Piano等。孔秋强是音频领域内多个顶级期刊和会议审稿人,并参与建设了多项字节跳动和海内外高校的学术合作。


报告题目:亿级曲库背后的AI音乐理解

摘要:音乐是人类生活不可或缺的一部分。本汇报将SAMI团队在亿级曲库背后的AI音乐信息检索技术和商业应用。本汇报将从业务场景、解决方案、核心能力出发,介绍SAMI团队的音乐科技能力。在商业应用方面,将介绍音乐创作、音乐分发和音乐消费上的价值。在音乐结构理解方面,将介绍音乐节拍检测和乐曲段落分析技术。在音频标签部分,将介绍多维度的大规模音乐标签技术。在多模态音乐理解和推荐方面,将介绍智能音乐编辑、智能卡点、多模态智能生成技术。让AI理解音乐,用技术推进音乐的商业化是SAMI团队的目标。



陈纪同


嘉宾简介:2017年获得Ohio State University计算机科学博士学位。博士期间研究方向是数据驱动语音降噪。毕业后加入百度硅谷人工智能实验室,从事端到端语音合成和识别系统的研发。2018加入字节跳动,先后参与音乐标签预测系统和互动音乐特效的建设。目前的工作重点是AI音乐系统和音乐创作工具的研发和落地。


报告题目:让音乐创作更简单的AI工具

摘要:音乐对内容创作非常重要,它促进内容的分发和消费,帮助用户表现自我。同时抖音正成为发现音乐的重要平台。为了满足用户对音乐创作的渴望,我们通过AI工具来降低音乐创作的门槛,让业余音乐人甚至小白也能体验到音乐创作的乐趣。本次分享介绍智能音乐创作工具的设计思路及其对内容生态的价值。


沙龙议程



参加方式

扫码进入视频号观看直播


讨论群


扫码进入讨论群



沙龙联系人
闫亮
电话:18611344096
邮箱:jack@speechhome.com