本文由香港中文大学、清华大学合作,研究面向语音情感识别的神经网络架构搜索,提出了一种均匀路径丢弃(uniform path dropout)的训练策略以改进神经架构的搜索速度,有效地提升了神经网络的情感识别准确率,也降低了模型的参数量。
声浪
本文由清华大学与广州虎牙信息科技有限公司、香港中文大学合作,提出了一种新型的基于通道注意力机制的复数谱单通道语音增强网络 FullSubNet+,在低信噪比(SNR) 的条件下于抑制噪声恢复语音信号任务上取得了良好的效果,超越了现有的最好的…
本文由清华大学与虎牙信息科技有限公司、香港中文大学合作。传统的表现力语音合成主要考虑当前语句内部的信息,而没有考虑当前语句所处上下文的影响,导致同一输入文本的合成语音,其说话风格相对固定、缺乏变化。为了建模更有表现力的说话风格,模型需要考虑…
个性化语音增强(personalized speech enhancement, PSE)也称为目标说话人提取(target speaker extraction,TSE),其主要目的是通过目标说话人的注册语音从复杂的受干扰的语音(如带噪、…
近日,在由全球语音技术顶尖会议INTERSPEECH 2022与微软联合举办的音频丢包隐藏挑战赛中,快手音视频技术团队在主办方评估的丢包隐藏平均主观意见分(PLCMOS),深度降噪平均主观意见分(DNSMOS),众包平均主观意见分(CMOS…
语音增强的目的是从噪声场景中提取有用的语音信号,抑制、降低噪声干扰。在实际场景中,影响语音质量的因素包括拾音距离和遮挡等引起的语音衰减、房间混响、声学回声、噪声和人声干扰等。语音增强的目的或者是给人听,提升主观听感,或是用于辅助后端语音识别…
本文由清华大学、香港中文大学和虎牙信息科技有限公司合作,提出了一种基于混合瓶颈特征解耦语音内容和细粒度韵律信息的语音转换算法,可以实现高韵律自然度和高音色相似度的语音转换。特别地,我们发现在基于识别-合成框架的语音转换(VC)工作中,因为语…
传音控股 传音控股致力于成为新兴市场消费者最喜爱的智能终端产品和移动互联服务提供商。自公司成立以来,传音一直着力为用户提供优质的以手机为核心的多品牌智能终端,并基于自主研发的智能终端操作系统和流量入口,为用户提供移动互联网服务。传音旗下拥有…
特斯联科技 特斯联科技是国内领先的城市级智能物联网平台公司,以“建筑生命体,城市进化论”为品牌宣言,物联网应用与人工智能技术为核心,以“未来建筑”、“未来城市”、“未来金融”三大业务板块为支撑,致力于为市民生活、办公和城市管理提供“未来系列…
本文由清华大学与香港中文大学、腾讯 AI Lab 合作,提出了一种基于图神经网络和多模态信息的对话交互建模方法(Graph-based multi-modal context modeling)以及基于该方法的对话风格语音合成(Conver…
