来源丨新智元、开源星探
Meta发布了Omnilingual ASR系统,一个可自动识别转录1600多种语言语音的AI模型族,让几乎所有人类语言都能被机器「听懂」。

语音识别(ASR)一直是 AI 语音领域的“硬骨头”。在世界上7000多种活跃语言中,只有几百种享受过现代语音技术的「宠爱」。绝大多数人类语言的使用者——从非洲部落的土著、亚马逊雨林的族群,到乡野小镇仍讲着古老方言的老人—— 一直生活在数字时代的旁白之外。全球语言多样、数据不平衡,想让模型听懂世界上绝大多数人说的话,难度可想而知。


而 Meta 研究团队这次开源的Omnilingual ASR,让几乎所有人类语言都能被机器「听懂」。


论文地址:https://ai.meta.com/research/publications/omnilingual-asr-open-source-multilingual-speech-recognition-for-1600-languages/
项目地址:https://github.com/facebookresearch/omnilingual-asr?tab=readme-ov-file

Meta此次推出的Omnilingual ASR创造了语音识别覆盖语言数量的新纪录,支持超过1600种语言,其中包括500种此前从未被任何AI系统转录过的语言。并且只需几条语音-文本配对样本就能实现零样本扩展新语种——也就是说,哪怕模型没见过这种语言,只要你给几条例子,它也能开始“听懂”!

相比之下,OpenAI开源的Whisper模型只支持99种语言,而Omnilingual ASR几乎将这一数字提升了一个数量级。


它提供了三种架构——SSL、CTC和LLM,每种架构从300M到7B参数不等,满足不同需求。CTC架构速度快,最高96倍实时,适合批量转写;LLM可零样本识别,准确率高,有78%的语种其识别错误率(CER)低于10%;SSL用于预训练或特征提取。

核心特性

零样本语种扩展:通过跨语言共享表示机制,模型能够从已学语言中迁移到相似语音模式的新语言。
多模态对齐训练:使用语音、文本、音素和语言标识联合建模,实现语音-语义-语言间的三维对齐。
自监督学习增强:模型使用上亿小时的未标注语音进行预训练,再通过有限标注语料进行微调。

模型架构概览

Meta 在项目中提供了三种架构版本,从轻量级到高精度全覆盖不同应用场景:

模型类型
特点
参数规模
适用场景
CTC 模型
快速、稳定,最高可达96×实时转写速度
300M–2B
批量语音转写、实时字幕
SSL 模型
用于特征提取或预训练,可迁移到其他任务
300M–7B
语音表征学习、低资源语种研究
LLM 模型
结合语言建模能力,零样本识别、上下文理解强
1B–7B
高精度识别、多语种语义理解

这种设计非常灵活:

想要快→用CTC;想要懂语义→用 LLM;想要做自训练或特征迁移→用 SSL。


性能表现

Meta 官方数据显示:

  • • 在 1600 种语言 上平均错误率显著低于现有多语种模型
  • • 78% 的语言 错误率(WER)低于 10%
  • • 对于低资源语言,准确率提升可达 3–5 倍
  • • CTC 模型最高实现 96× 实时速度(即 1 分钟音频仅需 0.6 秒转写)

应用场景

多语种语音识别:视频字幕生成、跨语种会议转写
跨语言搜索:音频内容检索、多语音助手
实时翻译:多语言会议、直播翻译
语音数据标注:低资源语种语音标注自动化
学术研究:自监督语音建模、语种迁移学习

写在最后

正如研究论文所指出的,「没有任何模型能预先涵盖世界上所有语言,但Omnilingual ASR让社区能够用自己的数据持续拓展这份清单」。

这标志着语音AI从此具备了自我生长的生命力,能够与人类语言的丰富多样性共同进化。当技术放下傲慢,以开源姿态拥抱多元,当每一种语言的声音都有机会被聆听和记录,当没有任何一种语言被数字世界遗忘,我们离真正消弭语言鸿沟又近了一大步,人类的连接才能真正开始消除边界。