伴随着生成式深度学习模型的飞速发展,自然语言处理(NLP)和计算机视觉(CV)已经经历了根本性的转变,从有监督训练的专门模型,转变为只需有限的明确指令就能完成各种任务的通用模型。 在语音处理和文本到语音(TTS)领域,这样的转变也正在发生,…
声浪
语音生成的「智能涌现」:10万小时数据训练,亚马逊祭出10亿参数BASE TTS
61 0 0
WhisperFusion:具有超低延迟无缝对话功能的AI系统
WhisperFusion 基于 WhisperLive 和 WhisperSpeech 的功能而构建,在实时语音到文本管道之上集成了大型语言模型 Mistral (LLM)。 LLM 和 Whisper 都经过优化,可作为 TensorR…
36 0 0
ICASSP2024 | SponTTS: 面向自发风格的语音合成与风格迁移
自发语音合成(Spontaneous speech synthesis)就像ChatGPT的语音合成效果一样,旨在模仿人类自然说话的方式,包括讲话中出现的不自觉停顿、拖音等自发现象,以及更加多变的语气、语调、语速和节奏,甚至包括一些非语言内…
52 0 0
TTS它又来了!OpenVoice:一款借鉴于TTS实现的强大的AI语音克隆工具!
2023年被大家称为人工智能元年,在GPT技术不断爆火的背景下,人工智能技术也在不断的发展和演化。各种AI工具也层出不穷,其中 语音克隆技术 也是尤为引人瞩目的产品之一。 而OpenVoice作为一款强大的多语言即时语音克隆AI工具,可以为…
28 0 0
AI语音合成工具-Lalamu Studio
近期,Lalamu Studio开启了beta版本测试:Lalamu Studio。该工具整合了TTS和lip sync功能,可以让任意视频中的人物开口说话,并精确模拟口型。 例如,选择一段视频素材,添加由Ai合成的语音,即可完成实时播报和…
86 0 0
