来源丨RTE开发者社区、Data接化发 Cartesia 发布 Sonic-3.6 TTS 模型,重点提升 44 种语言下的语音自然度,并称这是其目前最逼真的 TTS 版本。 相比三个月前发布的 Sonic-3.5,新版本根据开发团队反馈进…
声浪
今日论文合集:CS.SD语音与音频 | 共 6 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. A Multiplication-…
小红书 FireRedTeam 开源多语言 TTS 模型 FireRedTTS3,基于语义增强的连续语音表示进行语音生成。模型包含 Base 和 Instruct 两个版本:Base 支持 24 种语言、21 种中文方言的 Zero-sho…
今日论文合集:CS.SD语音与音频 | 共 11 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Adding Voice Clo…
今天和大家聊聊Bilibili最新发布的 IndexTTS 2.5,支持中/英/日/西/阿五国语言零样本配音,推理速度翻倍升级,跨语言情绪还原更自然,同时也支持原声的语速控制能力,补齐上代模型短板。 这次新版 IndexTTS 2.5 并没…
投机解码(Speculative Decoding)可以在不改变模型输出的前提下加速自回归解码。本文介绍我们在 ASR 和 TTS 两类语音任务上的投机解码实践:ASR方向,Qwen2-Audio-7B和 Qwen3-Omni-30B 使用…
今日论文合集:CS.SD语音与音频 | 共 4 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. Alignment Drift i…
MOSS 开源 MOSS-Transcribe-Diarize-0.9B。这是一个专为真实复杂语音场景打造的端到端多说话人语音转录模型。它不需要像传统方案一样,将 ASR、Speaker Diarization、Alignment 拆成多个…
IndexSpeech 团队正式开源 IndexTTS-2.5,针对 IndexTTS-2 的多语言、情绪表现和推理效率进行优化。新版本支持中文、英语、日语、西班牙语和阿拉伯语,并保留跨语种与音色情感解耦能力,同时新增语速控制和更细粒度的发…
今日论文合集:CS.SD语音与音频 | 共 9 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 1. CookVoice: Unifie…
