印度语音 AI 团队 Rumik 开源 Rumik-OSS 1,一款约 3B 参数的多语言 TTS 模型,支持 22 种语言、原生文字输入及语言混说,并可通过文字描述控制音色的情绪、口音和语速,同时在句子中插入笑声、轻笑和叹气等非语言声音。团队同时开放模型权重和基础版本,供研究者继续训练和后训练。

  • 不只「读文字」,而是把表达方式也写进 Prompt: 开发者可以用类似 happy, Hindi accent, steady pace 的描述控制说话方式,并在文本中加入 <laugh>、<chuckle>、<sigh> 等标签,让模型在指定位置生成对应的非语言声音。
  • 22 种语言共享同一组声音,并支持语言混说: 官方开放 Ira、Aisha、Siya、Zoya 四个声音,不再为每种语言分别绑定不同音色;模型可处理原生文字、罗马化文本以及印地语 + 英语、泰卢固语 + 英语等代码切换输入。
  • 从多语言文本模型继续预训练成语音生成模型: Rumik-OSS 1 基于 Tiny Aya Fire 的多语言文本能力,引入 Mimi 音频编解码器,将语音转换成离散 Token,再使用单一自回归 Transformer 按顺序预测文本后的音频 Token。训练先从约 4 万小时英语语音开始,再逐步加入 IndicVoices、RASA 等印度语言数据和高质量专有语音。
  • 团队称总训练数据约 6.6 万小时: 相比许多语音基础模型使用数十万甚至百万小时数据,Rumik 将重点放在多阶段训练与后训练;其后训练还使用 GRPO,根据 WER、CER、时长以及不同音频 Token 的语义/声学职责分配奖励。
  • 情感表现并非「全面超过闭源模型」,但在自建榜单中超过多款商业 TTS: 在 Rumik 自建的 IndicEmo 多语言情绪评测中,Rumik-OSS 1 得分 2.92/5,低于 Gemini 3.1 Flash TTS Preview 的 4.58,但高于 Cartesia Sonic Preview、Sonic 3.5 和 ElevenLabs v3;在笑声/叹气位置控制 NoVA 中得分 0.884,排名第三,仅次于 Grok TTS 和 Inworld TTS-2。


相关地址:

来源:RTE开发者社区