基本理论 隐马尔可夫模型是一个双重随机过程----具有一定状态数的隐马尔可夫链和显示随机函数集。自20世纪80年代以来,HMM被应用于语音识别,取得重大成功。到了90年代,HMM还被引入计算机文字识别和移动通信核心技术“多用户的检测”。HM…
声浪
声明:语音合成论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法。如有转载,请标注来源。 Improving multi-speaker TTS prosody variance with a re…
近期,实验室王雄、姚卓远、石宪同学的论文“CASCADE RNN-TRANSDUCER: SYLLABLE BASED STREAMING ON-DEVICE MANDARIN SPEECH RECOGNITION WITH A SYLLA…
语音识别(Auto Speech Recognition, ASR)技术是一种将连续的语音信号转化为文本的技术,近年来,随着深度学习的蓬勃发展,端到端(End-to-End,E2E)语音识别技术以其简单的体系结构和优异的性能广受青睐。RNN…
日前,中国科学院自动化所(简称“自动化所”)基于全场景AI计算框架MindSpore训练完成全球首个图文音(视觉-文本-语音)三模态预训练模型(OPT-Omni-Perception pre-Trainer),该模型同时具备跨模态理解与跨模…
语音转换(Voice Conversion)旨在保留语言内容的同时,将源说话人语音转换成目标说话人的语音。随着深度学习技术的引入,语音转换技术取得了巨大的飞跃。现有的语音转换方法可以成功地实现音色的转换,但是对源音频中的风格韵律缺乏有效的建…
由CCF语音对话与听觉专委会 、AIIA 中国人工智能产业发展联盟评估组 、北京希尔贝壳科技有限公司、语音之家(北京)科技有限公司共同主办的【语音之家】AI技术沙龙——说话人日志,将于2021年7月10号 9:30在线上直播进行。 沙龙简介…
由于高效,C++被广泛应用于智能语音领域系统开发,比如知名的语音识别工具Kaldi就是由C++编写的。大多数工程师都或多或少写过C++代码,但对于C++的理解依然不深入。 最近知乎上一个“什么是C++”的视频火了,短时间内播放量超过15万。…
引子 有没有厌烦了你的语音助手声音?语气太过生硬或者一成不变语音表达?是不是期待一个真正具有人性化的助手声音,就像是电影《HER》里的萨曼莎一样,拥有迷人的声线,温柔体贴而又幽默风趣,陪伴在你左右? 图1:电影《Her》:与语音助手谈一场恋…
近日,Facebook开源了数据增强包AugLy,其中包括文本、图像、音频和视频。音频类主要以librosa、torchaudio跟numpy作为后端,具体地址:https://github.com/facebookresearch/Aug…
