来源丨RTE开发者社区
近日,MOSI.AI 和 OpenMOSS 团队 开源了MOSS-TTS-Nano,一个0.1B参数 的多语言微型语音生成模型,直接把“实时语音克隆”门槛打到了地板价。
MOSS-TTS-Nano 专注于 TTS 部署中最重要的部分:小体积、低延迟、足够好的实时产品质量和简单的本地配置。它使用纯自回归Audio Tokenizer+ LLM 管道,并保持推理工作流对终端用户和网络演示用户都友好。

⏩主要特性

  • 超小模型尺寸:仅 0.1B 参数

  • 原生音频格式:48 kHz、2 声道输出

  • 多语言支持:支持 中文、英文等多种语言

  • 纯自回归架构:基于 Audio Tokenizer + LLM

  • 流式推理:低实时延迟和快速首字节音频

  • CPU 友好:流式生成可在 4 核 CPU 上运行

  • 长文本支持:支持长输入,具有自动分块语音克隆

  • 开源部署:支持直接python infer.py、python app.py和打包 CLI

  • MOSS-TTS-Nano 目前支持 20 种语言

⏩快速上手

  1. 打开终端,创建一个干净环境:

conda create -n moss-tts-nano python=3.12
conda activate moss-tts-nano

2. 克隆仓库并安装:

git clone https://github.com/OpenMOSS/MOSS-TTS-Nano.git
cd MOSS-TTS-Nano
pip install -r requirements.txt
pip install -e .
3. 最简单的一行命令生成语音:
moss-tts-nano generate \
  --prompt-speech assets/audio/zh_1.wav \
  --text "欢迎关注模思智能,AI正在重塑我们说话的方式。"

生成的文件自动保存到 generated_audio/ 文件夹,拿来就能用!

想玩Web界面?直接 python app.py 或 moss-tts-nano serve,浏览器打开 localhost:18083 就行。

这个项目完美解决了当前开源TTS的三大痛点:

  • 太大跑不动
    → Nano直接干到0.1B
  • 必须GPU
    → 纯CPU实时
  • 部署太复杂
    → CLI + Web + Python 一条龙

⏩相关链接