ICASSP 2022

近日,2022年IEEE音频、语音与信号处理国际会议(2022 IEEE International Conference on Acoustics, Speech, and Signal Processing,ICASSP 2022)发布录用通知,THUHCSI清华大学人机语音交互实验室有11篇论文被录用。ICASSP是由IEEE电气电子工程师学会主办的信号处理领域的顶级国际会议,在国际上享有盛誉并具有广泛的学术影响力。本年度会议的主题是“以人为本的信号处理”,论文录用率为45%。
清华大学人机语音交互实验室(THUHCSI)被录用的11篇论文涉及智能语音交互领域的诸多研究方向,包括语音合成、虚拟人生成、语音转换、语音增强、语音情感识别、错误发音检测与诊断、说话人识别攻击防御、自然语言理解等。论文工作将学术科研与产业应用紧密结合,合作伙伴包括:腾讯、虎牙、微软、字节跳动、标贝科技、好未来、香港中文大学、台湾大学等。
Paper 01
Enhancing Speaking Styles in Conversational Text-to-Speech Synthesis with Graph-based Multi-modal Context Modeling
作者:Jingbei Li, Yi Meng, Chenyi Li, Zhiyong Wu, Helen Meng, Chao Weng, Dan Su
合作单位:腾讯科技有限公司、香港中文大学


Paper 02
Towards Expressive Speaking Style Modelling with Hierarchical Context Information for Mandarin Speech Synthesis
作者:Shun Lei, Yixuan Zhou, Liyang Chen, Zhiyong Wu, Shiyin Kang, Helen Meng
合作伙伴:广州虎牙信息科技有限公司、香港中文大学


Paper 03
An End-to-End Chinese Text Normalization Model based on Rule-guided Flat-Lattice Transformer
作者:Wenlin Dai, Changhe Song, Xiang Li, Zhiyong Wu, Huashan Pan, Xiulin Li, Helen Meng
合作单位:标贝(北京)科技有限公司、香港中文大学


Paper 04
A Character-level Span-based Model for Mandarin Prosodic Structure Prediction
作者: Xueyuan Chen, Changhe Song, Yixuan Zhou, Zhiyong Wu, Changbin Chen, Zhongqin Wu, Helen Meng
合作单位:北京世纪好未来教育科技有限公司、香港中文大学


Paper 05
Transformer-S2A: Robust and Efficient Speech-to-Animation
作者:Liyang Chen, Zhiyong Wu, Jun Ling, Runnan Li, Xu Tan, Sheng Zhao
合作单位:微软亚洲工程院


Paper 06
Disentangling Content and Fine-Grained Prosody Information via Hybrid ASR Bottleneck Features for Voice Conversion
作者:Xintao Zhao, Feng Liu, Changhe Song, Zhiyong Wu, Shiyin Kang, Deyi Tuo, Helen Meng
合作单位:广州虎牙信息科技有限公司、香港中文大学


Paper 07
FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement
作者:Jun Chen, Zilin Wang, Deyi Tuo, Zhiyong Wu, Shiyin Kang, Helen Meng
合作单位:广州虎牙信息科技有限公司、香港中文大学


Paper 08
Neural Architecture Search for Speech Emotion Recognition
作者:Xixin Wu, Shoukang Hu, Zhiyong Wu, Xunying Liu, Helen Meng
合作单位:香港中文大学

Paper 09
An Approach to Mispronunciation Detection and Diagnosis with Acoustic, Phonetic and Linguistic (APL) Embeddings
作者:Wenxuan Ye, Shaoguang Mao, Frank Soong, Wenshan Wu, Yan Xia, Jonathan Tien, Zhiyong Wu
合作单位:微软亚洲研究院

Paper 10
NeuFA: Neural Network based End-to-End Forced Alignment with Bidirectional Attention Mechanism
作者:Jingbei Li, Yi Meng, Zhiyong Wu, Helen Meng, Qiao Tian, Yuping Wang, Yuxuan Wang
合作单位:北京字节跳动科技有限公司、香港中文大学
Paper 11
Adversarial Sample Detection for Speaker Verification by Neural Vocoders
作者:Haibin Wu, Po-chun Hsu, Ji Gao, Shanshan Zhang, Shen Huang, Jian Kang, Zhiyong Wu, Helen Meng, Hung-yi Lee
合作单位:腾讯科技有限公司、香港中文大学、台湾大学




从左到右自上而下依次为:吴锡欣、黎静北、宋长河、吴海滨、陈学源、戴文琳、李翔、叶文轩、李陈依、孟一、赵欣陶、周逸轩、陈礼扬、陈鋆、雷舜、王子林
