地址:https://tts.ampixa.com/sanoTTS/
尼泊尔语音 AI 实验室 Ampixa Labs 开源超小型神经 TTS 模型家族 sanoTTS,模型规模覆盖 29.4 万至 227 万参数,包含 11 个声音、6 种语言。其核心变化是把完整的神经语音合成链路压缩到通用微控制器上,无需云端、GPU 或 NPU,即可在约 3 美元的 ESP32-S3 上离线运行。
- 最小完整 TTS 模型只有 29.4 万参数:heart-nano 将时长预测、声学模型和解码器合计压缩到 294,279 个参数,int8 权重仅 337KB。从音素输入到最终波形都由本地神经网络完成,而不是只把声学模型放到端侧、再依赖外部云服务。
- 56.7 万参数版本已在 ESP32-S3 上跑到快于实时播放: 论文实际测试的 MCU 模型拥有 567,008 个参数,在 ESP32-S3 上生成 4.54 秒语音耗时 1.02 秒,RTF 为 0.22,无需神经网络加速器。这里的 0.22 RTF 表示整体生成吞吐速度,并非首段音频延迟。
- 从单个 Demo 扩展成 11 个声音、6 种语言的模型家族: sanoTTS 当前覆盖英语、尼泊尔语、印地语、越南语、印度尼西亚语和中文,模型规模从 294K 到 2.27M 参数;浏览器版本还可通过 WebAssembly 完全在客户端合成,不上传文本或音频到服务器。
- 训练路线采用大模型教师蒸馏,而不是从零训练微型 TTS: 团队从 Piper/VITS 教师模型蒸馏时长、声学表示和波形生成能力,再对小型解码器进行联合优化和 int8 量化,把原本需要更强算力的神经 TTS 压缩到 MCU 可承载的规模。
- 项目来自 Ampixa 对尼泊尔及低资源语言语音基础设施的长期投入:sano(सानो) 在尼泊尔语中意为「small」。除 TTS 外,Ampixa 还在开发尼泊尔语 ASR、语音数据处理、强制对齐、OCR 和低资源语言工具,目标是让语音能力不必首先经过英语或云端模型。
来源:RTE开发者社区
