实时语音转文字(ASR)和说话人识别(Diarization)在多人会议、字幕生成和无障碍辅助中需求日益增长,但传统工具常需云端处理,存在隐私风险和延迟问题。

最近 GitHub 上出现了一款开源项目WhisperLiveKit,提供了完全本地化的实时语音识别解决方案,不仅速度快、延迟低,还支持说话人识别,非常适合会议实时字幕和语音转录场景。


本质上是一个全面的实时语音转录工具包,结合了多项前沿技术,提供即时、准确的转录结果。


GitHub:https://github.com/QuentinFuxa/WhisperLiveKit


主要功能

  • •完全本地化处理:无需上传语音数据,隐私安全有保障
  • •实时语音转文字:支持多种语言和模型大小,转录精准
  • •智能说话人识别:自动区分不同发言者身份,适合多人会议
  • •先进流式处理算法:延迟极低,保证实时体验
  • •多种使用方式:支持 Web 界面和 Python API,开发者与普通用户都能轻松上手

同时项目提供 Docker 快速部署,并支持 GPU 加速运行,开箱即用。


快速入手

前置条件:

  • 系统已安装 Python 3.9 或更高版本
  • 已安装 FFmpeg(音频处理必需)
  • 连接了麦克风(用于测试)
  • 约 1GB 的可用磁盘空间(用于模型下载)

只需要使用Python的 pip 包管理命令即可一键安装 WhisperLiveKit 使用。

pip install whisperlivekit

这将安装核心包及其基本依赖项,包括 FastAPI、faster-whisper 和 websockets。

音频处理需要安装 FFmpeg。可根据操作系统进行安装:

Ubuntu/Debian:

sudo apt update && sudo apt install ffmpeg

MacOS:

brew install ffmpeg

Windows:

从https://ffmpeg.org/download.html下载 FFmpeg,然后解压文件并将 bin 目录添加到系统 PATH 中。

最后可验证该工具是否安装成功:

whisperlivekit-server --help

启动转录服务器(下载基础模型):

whisperlivekit-server --model base --language en

服务器运行后,打开网页浏览器并访问http://localhost:8000。

还有相关更高级的用法可查看项目文档使用。

总 结

WhisperLiveKit是一款强大的实时语音转文本解决方案,可直接在浏览器中提供即时转录功能。

它基于最先进的语音识别技术,支持完全本地化或内部部署,提供转录和说话人分离功能,确保隐私保护和低延迟。

如果你正在寻找一款无需依赖云端的实时语音识别工具,并且需要在会议、协作或应用中区分不同发言人,那么 WhisperLiveKit 会是一个非常值得尝试的开源项目。