来自 Hugging Face 的 Vaibhav Srivastav 最近在推特上发布了一条令人振奋的突破:Speech to Speech语音交互系统,可以极大地提升了人与机器之间的沟通效率与体验。

GitHub 链接:https://github.com/eustlb/speech-to-speech

该系统不仅在隐私保护方面做到100%保障,而且其延迟低至0.5秒,虽然这个响应速度目前仍然略逊于GPT-4o,但已接近于人与人之间自然对话的水平,值得注意的是,这仍然只是该技术的初始版本,未来的发展潜力不可小觑。
更令人兴奋的是,这个系统还是跨平台的,Mac和CUDA都能用!
Vaibhav提到其原理在于:
  1. 语音活动检测:使用Silero VAD v5
  2. 语音转文本:采用Whisper模型
  3. 语言模型:可以使用任何指令型模型
  4. 文本转语音:选择Parler-TTS
同时,他们还整合了AWQ、GPTQ、BnB等量化方案,让系统更省内存、推理更快!并且,这还是在设备上本地运行。

在交流时有朋友向Vaibhav问道:

"我能不能把语言模型换成翻译模型,做一个实时语音翻译器呢?"

Vaibhav的回答也是相当鼓舞人心:

"当然可以!只需要换一下LLM的骨干网络,再给一个自定义的翻译指令就行。几行代码就能搞定!"

系统的可扩展性很强!不过,Vaibhav也提醒我们,这只是第一个迭代版本。他们正在努力让它变得更好、更快!

参考链接

https://twitter.com/reach_vb/status/1824059903201173621