分享一款开源 TTS 模型:NeuTTS Air,它是一款免费、开源、轻量级的超逼真语音合成模型。

仅 0.5B 参数,但实际体验几乎媲美市面上许多商用 TTS 引擎。更关键的是,它能在手机、笔记本甚至树莓派这样的低功耗设备上流畅运行,真正把 AI 语音合成从云端拉到了我们身边。

基于Qwen 0.5B LLM构建,自带数字水印,端侧TTS声音听起来没有生硬感,语气和节奏相对自然。生成的语音媲美真人,支持仅用3秒音频就能完成声音克隆。

项目地址:https://github.com/neuphonic/neutts-air


核心亮点

  • 超逼真语音合成:产生自然、超现实的声音,听起来像人类的声音。

  • 即时声音克隆:只需 3 秒音频参考,即可快速定制专属语音。

  • 完全本地运行:无需网络,保护隐私,支持手机/树莓派低功耗运行。

  • 轻量高效:0.5B参数,实时生成,中等设备流畅。

  • 内置安全:数字水印嵌入输出,责任追溯,降低滥用风险。

  • 实时性能:针对中端硬件优化,响应迅速的用户体验。

这几个特性结合起来,让它不仅仅是一款 TTS,更是一种可随身携带的语音引擎。

快速入手

NeuTTS Air 的上手难度很低,基本只需要几个步骤:1、克隆项目:

git clone https://github.com/neuphonic/neutts-air.git
cd neutts-air

2、安装依赖(需要 espeak):

# Mac OS
brew install espeak

# Ubuntu/Debian
sudo apt install espeak

其中 Mac 用户可能需要将以下几行放在 neutts.py 文件的顶部。

from phonemizer.backend.espeak.wrapper import EspeakWrapper
_ESPEAK_LIBRARY = '/opt/homebrew/Cellar/espeak/1.48.04_1/lib/libespeak.1.1.48.dylib'  #use the Path to the library.
EspeakWrapper.set_library(_ESPEAK_LIBRARY)

Windows 用户可能需要运行:

$env:PHONEMIZER_ESPEAK_LIBRARY = "c:\Program Files\eSpeak NG\libespeak-ng.dll"
$env:PHONEMIZER_ESPEAK_PATH = "c:\Program Files\eSpeak NG"
setx PHONEMIZER_ESPEAK_LIBRARY "c:\Program Files\eSpeak NG\libespeak-ng.dll"
setx PHONEMIZER_ESPEAK_PATH "c:\Program Files\eSpeak NG"

3、安装Python依赖

pip install -r requirements.txt

pip install llama-cpp-python #(可选)
pip install onnxruntime #(可选)

4、运行示例,合成语音

python -m examples.basic_example \
  --input_text "My name is Dave, and um, I'm from London" \
  --ref_audio samples/dave.wav \
  --ref_text samples/dave.txt

代码用法:

from neuttsair.neutts import NeuTTSAir
import soundfile as sf

tts = NeuTTSAir(
   backbone_repo="neuphonic/neutts-air", # or 'neutts-air-q4-gguf' with llama-cpp-python installed
   backbone_device="cpu",
   codec_repo="neuphonic/neucodec",
   codec_device="cpu"
)
input_text = "My name is Dave, and um, I'm from London."

ref_text = "samples/dave.txt"
ref_audio_path = "samples/dave.wav"

ref_text = open(ref_text, "r").read().strip()
ref_codes = tts.encode_reference(ref_audio_path)

wav = tts.infer(input_text, ref_codes, ref_text)
sf.write("test.wav", wav, 24000)

如果需要克隆需要两个参数:参考音频样本(.wav文件)及文本字符串。然后该模型会将文本合成为参考音频风格的语音。这便是 NeuTTS Air 即时语音克隆功能的原理。

应用场景

  • AI 语音助手:在手机或电脑上跑一个本地语音助手,完全用自然语音和你交互,不依赖任何云端服务。
  • 个性化配音工具:视频博主可以快速生成解说音频,还能克隆成自己的声音,保持统一的品牌风格。
  • 实时翻译配音:结合翻译模型,可以做到“边听边翻译边用真人声音说出来”,应用于跨语言交流。
  • 游戏与虚拟角色语音:在游戏中给 NPC 添加更自然的对话声音,甚至克隆玩家自己的声音用于角色扮演。
  • 无障碍应用:为视障人士提供即时的本地语音阅读,完全离线运行,更安全可靠。

写在最后

过去开源 TTS 常常停顿僵硬、韵律不顺畅。但 NeuTTS Air 的语音合成加入了更细腻的节奏处理,听上去就像一个人真正地在思考后开口。

而且它的完全本地运行和内置水印特性,不论对内对外都非常安全。

轻量化、本地化、个性化 —— 这是我认为的未来方向。

它不仅仅在技术上做到了轻量化,还在安全性(本地 + 水印)和易用性(简单部署)上给出了完整方案。

对个人开发者而言,它是一个低门槛进入 AI 语音的工具;对企业应用来说,它是一个可扩展、安全的语音引擎。

如果你和我一样,对语音交互、智能助手或者个性化配音感兴趣,那我强烈推荐你动手试试 NeuTTS Air。

GitHub 项目地址:https://github.com/neuphonic/neutts-air