小红书 FireRedTeam 开源多语言 TTS 模型 FireRedTTS3,基于语义增强的连续语音表示进行语音生成。模型包含 Base 和 Instruct 两个版本:Base 支持 24 种语言、21 种中文方言的 Zero-shot Voice Cloning;Instruct 则进一步加入自然语言 Voice Design,以及语音内容、语速、音高和音量编辑能力。
FireRedTTS3 架构
覆盖 24 种语言和 21 种中文方言: FireRedTTS3-Base 支持英语、中文、日语、韩语、法语、西班牙语等 24 种语言,并覆盖四川、上海、闽南、温州、吴语等 21 种中文方言的 Zero-shot Voice Cloning。
自然语言直接设计新声音: FireRedTTS3-Instruct 无需参考音频,可根据性别、年龄、音色、情绪、语速和口音等自然语言描述生成新声音;模型会先生成 Voice Attribute Plan,再合成对应语音。
统一支持语义与声学编辑: Semantic Edit 可执行语音内容的插入、删除和替换;Acoustic Edit 支持调整语速、音高与音量,其中语速范围为 0.5×–2.0×,音高支持 ±6 Steps。
Seed-TTS-Eval 平均 WER/CER 为 3.04%: FireRedTTS3-Base 在该评测三个子集上的平均 Speaker Similarity 为 78.8;其中英文 WER 为 1.64%,中文 CER 为 1.01%,中文困难集 CER 为 6.50%。
24 语种评测平均 Speaker Similarity 为 84.8: 官方公布的 MiniMax-MLS-Test 结果中,FireRedTTS3 平均 WER/CER 为 3.754%,平均说话人相似度为 84.8。
FireRedTTS3-Base 与 FireRedTTS3-Instruct 权重和 PyTorch 推理代码已开放,项目采用 Apache-2.0 License;技术报告目前尚未发布。
获取方式
GitHub 代码仓库:https://github.com/FireRedTeam/FireRedTTS3
HuggingFace 模型:https://huggingface.co/FireRedTeam/FireRedTTS3
