以下文章来源于433的3号同学,作者贾彦

一、结论先行

过去四年,音频智能的核心范式发生了五次迁移:

  1. 先形成可复用的两类听觉前端。Whisper 提供稳健的语音语义表征,解决“说了什么”;CLAP 提供通用声音—文本对齐,解决“这是什么声音、与哪段文字匹配”。它们共同成为后续 Audio-LLM 最常复用的两类“耳朵”。
  2. 从单任务模型转向“音频编码器 + 连接模块 + LLM”。2023 年的 Pengi、LTU、LTU-AS、SALMONN、Qwen-Audio 将分类、描述、问答、识别和推理统一为文本生成任务,模型开始处理语音、环境声和音乐,而非只做 ASR。
  3. 从能听懂转向能交互、能推理、能处理长音频。2024 年后,研究重点转向开放式指令跟随、复杂音频推理、长上下文和实时全双工对话;2025—2026 年进一步采用思维链数据、推理强化学习、流式音频 token 和任务定制 RLHF。
  4. 从“文本模型帮忙猜”转向“听觉证据约束的推理”。2025 年后,音频问答开始系统采用结构化 CoT、可验证奖励与推理后训练;Audio-Reasoner、Step-Audio-R1 等代表工作把推理训练引入音频,而 AHA 和 audio-contribution-aware training 则用反事实样本或音频贡献筛选,检验并约束回答是否真的依赖听觉证据。
  5. 从十亿级适配器模型转向原生超大规模 Omni 预训练。MiMo-Audio 把音频预训练扩展到超过 1 亿小时;Qwen3-Omni 采用 Thinker–Talker MoE;Qwen3.5-Omni 进一步达到数千亿参数、256K 上下文和超过 1 亿小时音视频数据。这说明 2026 年前沿已不是单一的“音频编码器接 LLM”,而是原生多模态 MoE、超长上下文、统一理解—生成和专门后训练的组合。

二、“音频理解”到底包含什么

音频比图像更难统一,原因是同一波形同时携带多层信息:


层次
典型问题
常见任务
语言内容
说了什么、是哪种语言
ASR、语音翻译、口语问答
副语言
谁在说、情绪/语气如何
说话人识别、情感、年龄、口音
非语音事件
发生了什么声音
声音事件检测、场景分类、音频描述
音乐
乐器、风格、节拍、结构
音乐标注、检索、问答
时序与关系
谁先发生、声音是否重叠、因果是什么
时间定位、多事件关系、联合理解
高层推理
根据声音应采取什么行动
开放问答、常识/专业推理、对话决策


因此,本文所称“大模型”不只指参数量大,也指在大规模、多任务音频—文本数据上训练,能以自然语言接口完成多种听觉任务的基础模型。

三、技术路线的演化:只看高影响代表作

阶段
范式变化
代表论文
做了什么
2022:前端奠基
分别建立稳健语音表征与通用声音—文本对齐
Whisper、CLAP
Whisper 成为大量 Audio-LLM 的语音编码器;CLAP 支撑 Pengi、Audio Flamingo、Audio Flamingo 2 的声音语义对齐
2023:Audio-LLM 成形
音频编码器通过 prefix、投影器或 Q-Former 接入文本 LLM
Pengi、LTU、SALMONN、Qwen-Audio
分别代表生成式统一接口、通用音频问答、双编码器通用听觉和工业化多任务预训练
2024:能力扩展
从短音频问答扩展到少样本、长上下文、双模式交互和全双工
Audio Flamingo、Gemini 1.5 Pro、Qwen2-Audio、Moshi
分别代表 ICL/RAG、超长上下文、Audio Analysis/Voice Chat 和原生全双工语音
2025:推理与 Omni 汇流
音频理解、推理、生成、实时对话开始共享统一骨干
Audio Flamingo 2、Qwen2.5-Omni、Kimi-Audio、Audio Flamingo 3、Qwen3-Omni、MiMo-Audio
覆盖长音频、Thinker–Talker、千万/亿小时预训练、开放配方和 MoE Omni 等主要方向
2026:规模化与可信听觉
超大 Omni、小模型专业化和 grounded reasoning 同时推进
Eureka-Audio、ALARM、Audio-Cogito、Qwen3.5-Omni、StepAudio 2.5
这些工作分别代表紧凑 MoE、冻结推理骨干、开放推理数据、超大原生 Omni 和统一实时语音系统

3.1 2022:先建立可复用的语音与声音前端

2022 年最重要的不是“已经出现 Audio-LLM”,而是后续模型获得了两类成熟、可直接复用的听觉前端:

  • Whisper 用 68 万小时多语言、多任务弱监督语音训练获得稳健的连续语音表征。它后来被 LTU-AS、SALMONN、Qwen-Audio/Qwen2-Audio、Kimi-Audio、Audio Flamingo 3、Eureka-Audio 等直接采用或改造,是 Audio-LLM 中影响最广的语音编码器之一。
  • CLAP 将 CLIP 式对比学习迁移到音频和自然语言,把固定标签分类扩展为开放词汇检索与零样本识别。Pengi 自行训练 CLAP 式编码器,Audio Flamingo 使用 CLAP 系滑窗前端,Audio Flamingo 2 又进一步训练 AF-CLAP。

两者分工不同:Whisper 更擅长回答“说了什么”,CLAP 更擅长判断“这是什么声音、它与哪段文字最匹配”。Whisper 虽然本身是 ASR/翻译模型,但在本文中作为Audio-LLM 基础设施保留,不参与后面的通用音频理解或 ASR 排名。

3.2 2023:音频编码器接入 LLM

这一年的核心结构收敛为:

波形/频谱 → 预训练音频编码器 → prefix/projector/Q-Former → 文本 LLM → 自然语言答案

四篇代表作构成一条清晰链路:

  • Pengi 把分类、描述、检索和问答统一成文本生成,证明“一套生成接口处理多种音频任务”可行。
  • LTU 用 OpenAQA-5M 和感知→理解课程,将非语音音频问答与解释作为核心任务。
  • SALMONN 组合 Whisper 与 BEATs,通过 window Q-Former 接入 Vicuna,形成“语音内容 + 通用声音”的双前端范式。
  • Qwen-Audio 将 30 多种 speech/sound/music/song 任务纳入大规模多任务预训练,再用指令微调形成聊天模型。

因此,2023 年真正完成的不是某个单项指标突破,而是把音频任务的输出空间统一成语言。

3.3 2024:从短音频回答走向长上下文和实时交互

2024 年有四个影响后续路线的变化:

  1. Audio Flamingo 引入音频少样本上下文学习、检索增强和可量化的多轮对话。
  2. Gemini 1.5 Pro 将音频纳入百万 token 多模态上下文,推动长音频检索与跨片段推理。
  3. Qwen2-Audio 用自然语言提示替代复杂任务标签,并区分 Audio Analysis 与 Voice Chat 两种交互模式。
  4. Moshi 用双音频流和低帧率 codec 实现约 200ms 的全双工 speech-to-speech,对后续实时 Omni 模型影响显著。

这一阶段的主线可概括为:模型不仅要回答音频问题,还要处理更长输入、适应未见任务,并以自然语音实时交互。

3.4 2025:推理、长音频与原生 Omni 汇流

2025 年的代表工作可以归纳为三条主线,但每条只保留最有影响的模型:

  • 开放通用听觉。Audio Flamingo 2 以 AF-CLAP、AudioSkills 和 LongAudio 将理解扩展到 5 分钟;Audio Flamingo 3 改用统一 AF-Whisper,覆盖 speech/sound/music、最长 10 分钟音频和按需思考,并开放权重、代码与主要数据。
  • 原生 Omni。Qwen2.5-Omni 奠定流式 Thinker–Talker;Kimi-Audio 将预训练扩展到 1,300 万小时;Qwen3-Omni 进一步采用 30B-A3B MoE,并统一 Instruct、Thinking、Captioner 与实时生成。
  • 规模化少样本学习。MiMo-Audio 将预训练推至超过 1 亿小时,在未专门训练的任务上观察到少样本能力,说明 Audio-LLM 开始出现类似文本 LLM 的规模效应。

3.5 2026:大模型、小模型与可信推理并行

  • Qwen3.5-Omni:数千亿参数、256K 上下文、超过 1 亿小时音视频数据,代表超大原生 Omni。
  • Eureka-Audio:1.7B 语言骨干配合稀疏 MoE adapter,代表紧凑通用听觉。
  • ALARM:冻结 4B 推理 LLM,仅训练多编码器压缩和对齐模块,代表低成本推理迁移。
  • Audio-Cogito:开放 54.5 万条推理样本并进行自蒸馏,代表开放 grounded reasoning。
  • StepAudio 2.5:ASR、TTS、实时对话共享骨干,通过任务约束和 RLHF 切换工作模式,代表产品化统一语音系统。

这五个阶段串成一条主线:对齐声音与语言 → 把音频接入 LLM → 扩展长上下文和实时交互 → 统一理解、推理与生成 → 同时追求规模、效率和听觉可信度。

四、统一评测与排名

4.1 音频理解:基准解释与总排名

音频理解榜只保留三项交集高、覆盖互补的主流基准:


基准
规模与音频范围
主要任务
更侧重检验什么
MMAU
1 万段音频及人工问答;覆盖 speech、环境声和 music,共 27 类技能
语音/事件信息提取、声源与场景识别、计数、属性比较、时序关系、音乐理解,以及需要领域知识的音频推理
广度
:模型是否能在语音、声音和音乐之间保持较均衡的通用理解能力
MMAR
1,000 条真实互联网音频问答;包含 speech、sound、music 及其混合,每题附 CoT 理由
Signal 层的声学属性分析,Perception 层的事件/声源/时序感知,Semantic 层的内容与关系理解,Cultural 层的音乐、文化和专业知识推理
深度
:是否能在复杂真实音频上进行多步推理,而非只识别显著声源或复述转录
MMSU
5,000 条音频问答、47 个任务;主要是真实自然语音
音系与语音现象、重音/语调/节奏等韵律,修辞、句法、语义,以及情绪、语速、音高等副语言理解与推理
语音细粒度
:是否理解“怎么说、为什么这样说”,而不只是把语音转成文字


三项均为百分制准确率,越高越好。


排名
模型
MMAU ↑
MMAR ↑
MMSU ↑
理解综合分 ↑
数字来源
1Gemini 3.1 Pro(标杆)
81.10
83.70
81.30
82.03
Qwen3.5-Omni Table 5(同协议外部对照)
2Qwen3.5-Omni-Plus82.20
80.00
82.8081.67
Qwen3.5-Omni Table 5
3Qwen3.5-Omni-Flash
80.40
74.00
72.20
75.53
Qwen3.5-Omni Table 5
4Qwen3-Omni-Instruct
74.57
67.10
77.00
72.89
Eureka-Audio Table 4
5Audio contribution-aware(Mixed-to-Strong)
75.10
67.00
71.70
71.27
模型论文 Table 5(同一训练策略/checkpoint)
6MiMo-Audio-7B-Instruct
74.90
63.60
61.70
66.73
MiMo-Audio Table 8
7Kimi-Audio-7B-Instruct
72.86
57.40
61.26
63.84
Eureka-Audio Table 4
8Step-Audio-2-mini
71.96
61.57
55.14
62.89
Eureka-Audio Table 4
9Eureka-Audio-Instruct
74.67
56.20
55.63
62.17
Eureka-Audio Table 4
10Audio Flamingo 3
74.77
61.00
47.07
60.95
Eureka-Audio Table 4
11DIFFA-2
67.00
50.80
60.45
59.42
DIFFA-2 Tables 1—3
12Qwen2.5-Omni-7B
66.23
49.60
61.22
59.02
Eureka-Audio Table 4
13ALARM-E
62.40
48.70
61.30
57.47
ALARM Tables 3、5
14Qwen2.5-Omni-3B
62.91
43.40
53.41
53.24
Eureka-Audio Table 4
15Qwen2-Audio-Instruct
57.40
30.00
53.30
46.90
ALARM Tables 3、5
16SALMONN
36.20
33.20
30.10
33.17
ALARM Tables 3、5
17LTU
17.20
19.20
22.60
19.67
ALARM Tables 3、5
补充(2/3)
Gemini 2.5 Flash(标杆)
71.80
65.60
未报告
68.70†
MiMo-Audio Table 8(同协议外部对照)
补充(2/3)
Audio-Reasoner
63.80
36.80
未报告
50.30†
ALARM Table 5
补充(2/3)
Audio Flamingo 2
61.10
21.90
未报告
41.50†
ALARM Table 5
补充(2/3)
GAMA
21.70
26.50
未报告
24.10†
ALARM Table 5
补充(1/3)
Baichuan-Omni-1.5
未报告
未报告
50.60
50.60†
ALARM Table 3


前 17 行为第五节已调研且三项齐全的主榜,按同一模型或同一训练策略的三项算术平均值排序;其后“补充”行仍是已调研模型,但缺少部分交集基准。†是按已报项目均值,不能与三项齐全的主榜进行严格排名。需特别注意:数字来自不同论文的集中评测表,虽使用同名基准,但提示词、解码设置、数据版本和模型版本未必一致;因此本表用于观察能力层级与分项短板,不等同于统一复现的严格官方排行榜。Gemini 3.1 Pro 的数值来自 Qwen3.5-Omni 的同协议外部对照,Qwen3.5-Omni-Plus/Flash 则为该论文自报;二者均应结合这一来源边界解读。Audio contribution-aware 论文的 MMAU 单项最高值 75.60 来自 Weak-to-Strong,但该策略的 MMAR/MMSU 是 65.30/69.30;正式排名采用三项均由同一 Mixed-to-Strong 策略产生的 75.10/67.00/71.70,避免把两个 checkpoint 的最佳分数拼接成不存在的模型。

4.2 ASR:基准解释与总排名

ASR 单独衡量“是否听清并准确转写”,不并入理解综合分。榜单只保留两个稳定且被近年 Omni/Audio-LLM 论文反复采用的公开集合,共四个目标子集:LibriSpeech test-clean/test-other(英文 WER)和 WenetSpeech test-net/test-meeting(中文 CER)。为便于展示,WER/CER 统称为字词错误率。

榜单范围也收紧为:第五节已逐一调研、具有通用音频理解或 Omni 能力,且其原论文/技术报告实际报告了上述四项中至少一项的模型。不再把未调研的外部基线或专用单任务 ASR 模型塞进排名;因此 Qwen3-ASR 系列不参与本表。StepAudio 2.5 保留,因为其报告的是 ASR/TTS/实时对话共享骨干的统一模型,而非单任务 ASR。平均值按实际报告的目标子集计算:ASR 平均错误率 = 已报告目标子集错误率之和 / 覆盖子集数,越低越好。覆盖 4/4 的模型构成正式排名;覆盖不足的模型放在同一表底部,仅作补充对照。


排名
模型
LibriSpeech clean / other ↓
WenetSpeech net / meeting ↓
覆盖
ASR 平均错误率 ↓
原论文中的结果出处
1Step-Audio 2
1.17 / 2.42
4.67 / 4.75
4/4
3.25
Step-Audio 2 Table 1
2Qwen3.5-Omni-Plus
1.11 / 2.23
4.30 / 5.84
4/4
3.37
Qwen3.5-Omni Table 5
3Qwen3.5-Omni-Flash
1.30 / 2.43
4.41 / 5.51
4/4
3.41
Qwen3.5-Omni Table 5
4StepAudio 2.5
1.38 / 3.16
4.54 / 4.70
4/4
3.45
StepAudio 2.5 Table 1
5Qwen3-Omni-Flash-Instruct
1.27 / 2.44
4.62 / 5.75
4/4
3.52
Qwen3-Omni Table 6
6Qwen3-Omni-30B-A3B-Instruct
1.22 / 2.48
4.69 / 5.89
4/4
3.57
Qwen3-Omni Table 6
7Kimi-Audio
1.28 / 2.42
5.37 / 6.28
4/4
3.84
Kimi-Audio Table 4
8Qwen2.5-Omni-7B
1.80 / 3.40
5.90 / 7.70
4/4
4.70
Qwen2.5-Omni 原文 ASR 表
9Eureka-Audio-Instruct
1.46 / 3.24
7.55 / 9.14
4/4
5.35
Eureka-Audio Table 3
10Gemini 3.1 Pro(标杆)
3.36 / 4.41
11.53 / 14.21
4/4
8.38
Qwen3.5-Omni Table 5(同协议外部对照)
补充*
Audio Flamingo 3
1.57 / 3.13
未报告
2/4
2.35
AF3 原文 ASR 表
补充*
Qwen2-Audio
1.60 / 3.60
未报告
2/4
2.60
Qwen2-Audio 原文 ASR 表
补充*
MiMo-Audio-7B-Instruct
3.50 / 未报告
未报告
1/4
3.50
MiMo-Audio 原文 ASR 表


严格可比的 4/4 行里,Step-Audio 2 居首;Qwen3.5-Omni-Plus/Flash、StepAudio 2.5 紧随其后。Qwen3.5-Omni-Plus 的 LibriSpeech clean/other 均为已列模型最低;虽然它的 WenetSpeech meeting 错误率高于 Flash,但四项平均仍略低于 Flash。WenetSpeech 的错误率普遍高于干净朗读集,是更能区分真实场景鲁棒性的部分。

五、模型全景、结构与训练细节

模型(年份)
机构(主导/作者团队)
结构与参数
数据与训练
支持的语音/音频功能
代表结果(任务或基准)
优势
缺点与复现风险
CLAP(2022)
Microsoft 等作者团队
音频/文本双塔 Transformer,对比学习共享嵌入空间
约 12.8 万 audio-text 对;对比预训练
音频-文本检索、零样本声音分类;不做生成
论文在 16 项下游任务、8 个领域上评测,并报告多项零样本结果
简洁、可迁移,适合作为检索器或教师
只输出相似度,不具备生成、对话和多步推理
Whisper(2022,基础前端)
OpenAI
log-Mel + encoder-decoder Transformer;tiny 至 large 多种规模
68 万小时多语言、多任务网页弱监督;联合 ASR、翻译、语言识别和时间戳预测
多语 ASR、语音翻译、语言识别与时间戳;不做通用声音问答或语音生成
在大量域外语音上表现出强零样本鲁棒性;后续被多种 Audio-LLM 直接作为连续语音编码器
数据规模大、跨语言稳健、生态成熟,是最常用的语音前端之一
以语音内容为核心,对环境声、音乐和复杂听觉推理能力有限;本身不是 Audio-LLM,不参与第四节排名
AudioGPT(2023)
浙江大学等
GPT-3.5 作为规划器,调用 ASR、TTS、声音/音乐生成与理解工具
继承各外部模型数据;通过格式转换和任务编排工作
ASR、TTS、声音/音乐理解与生成、工具编排
展示自然语言统一调用多类音频工具
模块可替换、功能覆盖广,是早期 audio agent 代表
不是单一端到端模型;误差会在规划与工具间级联,难与 LALM 直接排名
Pengi(2023)
Microsoft / Carnegie Mellon University
HTSAT/CLAP + 两个 8 层映射 Transformer + 冻结 GPT-2-base(124M)
340 万 audio-text 对;统一成文本生成任务
声音分类、描述、音频问答;文本生成式输出
论文评测 21 个下游任务,并在若干分类、描述和 AQA 指标上报告当时领先结果
较早证明开放式与封闭式音频任务可共享生成接口
GPT-2 推理弱;训练时音频随机截为 7 秒;分类依赖文本后匹配
LTU(2023)
MIT 等
AST→32 audio tokens→LLaMA/Vicuna-7B;投影与 LoRA
OpenAQA-5M,实际 568.2 万 QA;四阶段感知→理解课程
声音分类、音频描述、音频问答与基础推理;文本输出
8 个分类任务相对 CLAP 平均 +23.6%;CLAP 仅为比较基线,并非 LTU 编码器
数据与消融透明;明确研究模型是否依赖音频
仅约 10 秒;大量 QA 由只看标签的 GPT-3.5 合成
SpeechGPT(2023)
复旦大学等
HuBERT 离散 speech units 扩入 LLaMA-7B 词表;HiFi-GAN 解码
SpeechInstruct 约 900 万指令;三阶段模态/指令训练
ASR、语音问答、TTS、语音到语音翻译
早期统一 speech/text 输入输出
为 codec/token 式端到端语音模型奠基
偏语音;离散单元牺牲副语言和自然度;通用声音能力弱
AudioPaLM(2023)
Google Research
w2v-BERT/USM 离散 token 并入 PaLM/PaLM-2 8B 词表
CoVoST2、VoxPopuli、Common Voice、YouTube ASR及大量合成翻译/TTS
ASR、语音翻译、TTS、保音色 S2ST
AudioPaLM-2 在 CoVoST2 AST 报告 BLEU 37.8
文本翻译知识可零样本迁移到语音,支持 S2ST 和音色保持
核心模型闭源;偏 speech;离散 token 序列长、推理成本高
BLSP(2023)
多机构作者团队
Whisper-small + 卷积降采样 adapter + 冻结 LLaMA-2-7B
880 万“语音→文本续写”对;行为一致性对齐
ASR、语音问答、语音翻译;文本回复
通用语音 QA 可接受率约 88.5%,接近级联基线
证明模态对齐不应等同于教模型转录;训练参数少
ASR/ST 仍落后强专用系统;依赖冻结骨干已有语言能力
LTU-AS(2023)
MIT CSAIL / MIT-IBM Watson AI Lab
Whisper-large 的转录与多层特征经 TLTR 汇聚,再接 LLaMA/Vicuna-7B
Open-ASQA 约 960 万 QA,其中约 690 万为 GPT 生成开放式 QA;融合 13 个音频/语音数据集
ASR、副语言、环境声、混合音频问答
论文展示对语音内容、副语言和非语音事件的联合问答能力
同时保留显式转录与连续声学特征,适合混合声景
Whisper、TLTR 与 LLM 链路较长;音频 token 截到约 10 秒,长音频能力有限
SALMONN(2023)
清华大学 / ByteDance Research 等
Whisper-large-v2 + BEATs;window Q-Former 接 Vicuna-13B
指令阶段约 4400h/230 万样本;LoRA;12 个故事样本 activation tuning
ASR、语音翻译、声音/音乐问答;文本输出
ASR、翻译、声音/音乐问答统一
双编码器兼顾“说了什么”和“还有什么声音”
13B 成本高;activation tuning 样本极少;长音频线性增长
LauraGPT(2023)
上海人工智能实验室等
连续音频输入 + 离散音频输出 token 的统一 GPT 模型
多任务语音识别、理解和生成;数据分阶段披露
ASR、SLU、TTS、语音对话
在一个序列接口中支持 ASR、SLU、TTS 等任务
较早统一连续理解输入与离散生成输出
通用环境声和复杂推理评测不足;训练配方开放程度有限
Qwen-Audio(2023)
阿里巴巴 / Qwen 团队
Whisper-large-v2 + Qwen-7B;层级任务标签
30+ 任务;按 Table 1 各任务小时相加约 14.55 万“任务小时”,同一音频可因多任务被重复计数
ASR、翻译、声音/音乐理解、语音指令
论文报告在 Aishell1、CochlScene、ClothoAQA、VocalSound 上取得当时领先结果
speech/sound/music/song 覆盖广
“任务小时”并非去重语料时长;层级标签复杂;数据复现有限
Audio Flamingo(2024)
NVIDIA
CLAP 滑窗 + 3 层 audio Transformer + gated cross-attention;1.3B LLM
590 万对/1.81 万小时;检索、ICL、多轮训练
长音频理解、声音问答、检索、多轮音频对话;文本输出
少样本、检索和多轮音频对话能力突出
小模型成本低;适合上下文学习
编码窗口与语言骨干较旧;复杂推理和长上下文有限
WavLLM(2024)
香港中文大学 / Microsoft
Whisper-large-v2 + WavLM 双编码器;双 adapter、prompt-aware LoRA
两阶段语音指令训练;高级多任务阶段合计约 2900 小时
鲁棒 ASR、副语言、语音指令与问答
论文在同规模比较中报告多项语音任务结果,并展示高考英语听力零样本问答
显式兼顾语义内容与说话人/声学特征
偏 speech;双编码器增加延迟;sound/music 覆盖有限
SpeechVerse(2024)
Amazon AWS AI Labs
WavLM/Best-RQ 等连续表征 + 小桥接模块 + 冻结 Flan-T5
大规模多任务语音数据,分项披露
SLU、语音分类、语音问答;文本输出
论文报告多任务模型在 11 项任务中的 9 项超过相应传统任务基线
参数高效、适合低成本适配
能力受冻结文本骨干限制;非语音声音和自由生成较弱
GAMA(2024)
马里兰大学等作者团队
AST 多层特征 + Audio Q-Former + LLaMA-2-7B;LLaMA-2-13B 用于生成改写示例,不是 GAMA 骨干
ReCLAP 约 220 万 audio-caption 对;Audio Q-Former 阶段论文主体称 250 万+ 对;CompA-R 约 20 万复杂推理指令
声音理解、音频问答、复杂推理;文本输出
论文在 16 个数据集、4 类任务的自有协议比较中报告相对既有 LALM 的提升
多层声学特征和专门 reasoning data 有效
合成推理数据偏差;结构组件较多,贡献不易拆分
Qwen2-Audio(2024)
阿里云 / Qwen 团队
Whisper-large-v3 + pooling + Qwen-7B/8.2B
大规模 SFT + DPO;总语料未完整公开
ASR、声音/音乐理解、语音指令、Voice Chat
奠定 Audio Analysis/Voice Chat 双模式;MMAU 早期强基线
交互自然、任务统一、产品化程度高
数据不透明;文本前缀先验可能压过听觉证据
Moshi(2024)
Kyutai
Mimi 12.5Hz codec + Helium-7B;双音频流、RQ-Transformer、Inner Monologue
700 万小时单流预训练;2000 小时 Fisher 双流对话用于 Moshi 微调;另有 170 小时监督对话用于训练 TTS、微调 Helium,而非直接训练 Moshi
低延迟双工语音对话、插话/重叠、流式 ASR/TTS
论文报告理论延迟 160ms、实际约 200ms,并支持重叠与插话
以全双工为原生目标
语言/知识/环境声理解弱于通用 Audio-LLM;训练成本高
Baichuan-Omni(2024)
百川智能
7B 图像/视频/音频/文本统一 MLLM,专用音频编码器
两阶段多模态对齐和多任务微调,内部数据占比较高
语音/图像/视频/文本理解、语音交互
在多模态理解和若干医疗/音频任务上具竞争力
全模态和垂直领域覆盖较完整
数据口径粗、音频消融有限;难判断全模态训练对听觉的净贡献
Freeze-Omni(2024)
多机构作者团队
冻结文本 LLM,仅训练语音输入/输出模块
ASR/TTS 对 + 约 6 万多轮文本 QA;三阶段训练
ASR、TTS、speech-to-speech、语音对话
低成本实现 speech-to-speech
可复用任意文本 LLM,训练成本低
语音能力受冻结骨干和接口上限约束;通用声音推理有限
GLM-4-Voice(2024)
智谱 AI(Z.ai)
12.5Hz、175bps 单码本 tokenizer + GLM-4-9B
约 1T token 持续预训练,再做语音指令对齐
中英语音聊天、TTS、情绪/语速控制
中英实时语音聊天、情绪/语速控制
单码本序列效率高;中文交互体验突出
通用 sound/music 理解榜较弱;数据和训练成本复现困难
Gemini 1.5 Pro(2024)
Google DeepMind
原生多模态 Transformer;参数/细节未公开,1M 级上下文
内部多模态数据;具体规模未公开
音频/视频/文本长上下文理解、多模态问答、工具调用
技术报告展示百万 token 长上下文下的跨音视频检索与推理;未报告本文三项交集基准
长上下文与跨模态原生融合的标杆
闭源;数据、训练配方及可复现音频评测不足
Baichuan-Omni-1.5(2025)
百川智能
Omni MLLM + 兼顾语义/声学的 Baichuan Audio Tokenizer
约 500B 多模态数据单元;多阶段对齐与生成训练
音频理解、语音生成、全模态对话
同时支持音频理解和生成
覆盖理解、生成及垂域任务
“数据单元”口径难与小时/token 比较;内部数据多
Gemini 2.5 Pro(2025)
Google DeepMind
闭源原生多模态模型;架构/参数未公开,长上下文
内部多模态预训练与后训练;规模未公开
音频/视频/文本理解、长上下文推理、语音输入与工具调用
同协议外部对照:Libri 2.89/3.56、Wenet 14.43/13.47(Qwen3-Omni Table 6)
通用推理、长上下文和多模态覆盖是重要闭源标杆
非自报 ASR 数字仅作外部对照;训练与数据完全不透明
Gemini 2.5 Flash(2025)
Google DeepMind
闭源高吞吐原生多模态模型;参数未公开
内部多模态数据;规模未公开
音频/视频/文本理解、低延迟交互、语音输入与工具调用
同协议外部对照:MMAU 71.80、MMAR 65.60(MiMo-Audio Table 8;MMSU 未报)
闭源标杆中兼顾速度、成本和多模态能力
三项交集结果不全;音频结构与训练配方未披露
Audio Flamingo 2(2025)
NVIDIA
AF-CLAP 203M + gated cross-attention + Qwen2.5-3B;最长 5 分钟
AF-CLAP 超过 800 万对;AudioSkills 420 万 QA;LongAudio 262,928 条 QA
5 分钟音频理解、专家问答、声音/音乐推理;文本输出
论文报告其 3B 系统在多项自有协议比较中优于若干更大基线
小 LLM + 强编码器 + 课程学习的高性价比路线
大量合成数据;长音频由 10 秒窗口特征拼接;训练使用 128×A100 80GB
Audio-Reasoner(2025)
论文作者团队(基于 Qwen2-Audio)
Qwen2-Audio 基座;Planning→Captioning→Reasoning→Summary 的结构化 CoT
CoTA 约 120 万;用商用模型做二次标注、QA 与结构化 CoT 生成
音频问答、语音/声音/音乐推理与长 CoT;文本输出
论文报告相对 Qwen2-Audio:MMAU-mini +25.4%、AIR-Bench chat +14.6% 等
系统把结构化 CoT 与 inference scaling 引入音频
教师闭源;长 CoT 未必忠实且增加延迟
Qwen2.5-Omni(2025)
阿里云 / Qwen 团队
流式音/视频编码器 + TMRoPE + Thinker–Talker 3B/7B
多模态预训练 + SFT/DPO;总量未披露
流式音视频理解、ASR、TTS、实时语音对话
统一榜综合分 59.02;可流式输出文本与语音
音视频时间同步和端到端产品形态完整
训练数据不透明;理解、Talker、codec 错误难归因
VITA-Audio(2025)
腾讯优图实验室 / 南京大学 / 厦门大学
7B 级 LLM + Multiple Cross-modal Token Prediction(MCTP)
仅使用开源数据,按 ASR/TTS/对话任务分项训练
ASR、TTS、语音对话、speech-to-speech
论文报告 7B 模型约 3–5 倍推理加速;其 Table 5 中 Boost/Balance 为 2.64 倍、Turbo 为 4.72 倍(不含编码器/解码器成本)
首包低、生成效率高、数据开放性较好
加速数字不含音频编码/解码开销;重点偏语音生成效率,复杂声景推理证据不足
Kimi-Audio(2025)
Moonshot AI
Whisper 连续特征 + 12.5Hz 离散 token;Qwen2.5-7B;双 head + flow detokenizer
超过 1300 万小时 speech/sound/music;理解、交错生成、对话 SFT
ASR、声音/音乐理解、TTS、交错生成、对话
统一理解榜综合分 63.84;本文四个 ASR 子集平均错误率 3.84
数据处理、模型、evalkit 和 checkpoint 披露较完整
内部数据占比大;双路输入计算重;并非任意重叠全双工
Step-Audio 2(2025)
阶跃星辰(StepFun)
latent encoder→12.5Hz adapter;文本/音频交错生成;RAG/工具调用
800 万小时、680B 文本 token;约 1.356T 持续预训练;PPO+GRPO
ASR、推理、S2S、RAG、搜索与工具调用
本文四个 ASR 子集平均错误率 3.25;理解榜综合分 62.89
ASR、推理、S2S、搜索和工具高度统一
内部数据和工程组件多;综合增益难归因;复现成本高
Audio Flamingo 3(2025)
NVIDIA
AF-Whisper 统一 speech/sound/music,50→25Hz;Qwen2.5-7B
AudioSkills-XL 约 800 万、LongAudio-XL 125 万、AF-Think 25 万+;五阶段课程
speech/sound/music 理解、10 分钟长音频、多音频聊天
统一榜综合分 60.95;MMAU 74.77;Libri 1.57/3.13
权重、数据、代码较完整开放;10 分钟、多音频、按需思考
reasoning 依赖闭源教师;voice-to-voice 外接 TTS;MMSU 较弱
Qwen3-Omni(2025)
阿里云 / Qwen 团队
Thinker–Talker MoE 30B-A3B;AuT;多码本 codec + 因果 ConvNet
AuT 约 2000 万小时监督音频;多模态大规模训练,完整组成有限
音视频理解、思考/描述、实时生成、ASR、TTS
本文理解榜综合 72.89;论文报告其在 36 个音频/AV 基准中 32 个开源模型比较项居首
权重开放;理解、Thinking、Captioner、实时生成统一
总语料与训练成本难复现;理论 234ms 不等于实际服务延迟
Audio contribution-aware(2025)
论文作者团队(后训练 Qwen2.5-Omni)
Qwen2.5-Omni 基座 + 音频贡献打分/过滤 + SFT→GRPO
AudioMCQ 57.1 万,含两类 CoT;Weak/Mixed-to-Strong 课程
音频多选问答、音频证据敏感后训练与推理;文本输出
Weak-to-Strong:MMAU 75.6;Mixed-to-Strong:MMAR 67.0、MMSU 71.7
直接处理“没听也能答”的文本捷径
三个最佳分数来自两种不同训练策略,不能视为同一 checkpoint 的完整三项成绩;仍以选择题 reward 为主
Step-Audio-R1(2025)
阶跃星辰(StepFun)
Step-Audio 32B 级 + MGRD grounded reasoning distillation
约 1.356T token 口径;音频有根推理轨迹 + RL
有根音频推理、语音理解与工具/对话
MMAU 77.7;报告综合超过 Gemini 2.5 Pro、接近 Gemini 3 Pro
强调推理轨迹必须落在声学证据上
教师链、内部数据和跨论文对比难复现
MiMo-Audio(2025)
小米(Xiaomi)
32 层双向 tokenizer + 20 层 RVQ;MiMo-7B;理解/生成统一
超过 1 亿小时;100B token 后训练;MiMo-TTS 超过 700 万小时
ASR、声音/音乐理解、TTS、交错生成与对话
MMAU 74.90、MMAR 63.60;多个未训练任务出现 few-shot
音频规模化 next-token 预训练与少样本能力突出
数据来源/去重不完全透明;以语音为主;thinking 会伤害 sound/music
AHA(2025)
论文作者团队(后训练 Qwen2.5-Omni)
Qwen2.5-Omni 基座 + 反事实 hard negatives 的偏好对齐
四类音频幻觉 taxonomy;反事实 hard negative 挖掘与偏好数据
音频证据对齐、反事实推理与幻觉诊断;文本输出
相对基座:AHA-Eval +13.7%,MMAU-Test +1.3%,MMAR +1.6%
直接检验答案是否随音频证据改变
通用榜增益有限;覆盖已定义错误类型,泛化待验证
DIFFA-2(2026)
南开大学 / 美团 LongCat 团队
Whisper-large-v3 + 语义 adapter + 64-query 声学 Q-Former + LLaDA-8B diffusion LLM
约 1.1 万小时 ASR、3767 小时 SFT、约 3000 个偏好对;四阶段训练;约 1.1% 参数可训练
语音/声音/音乐理解与推理;文本输出
MMAU 67.00、MMAR 50.80、MMSU 60.45,三项均值 59.42
训练语料与流程开放;探索非自回归 diffusion 音频理解路线
解码生态和大规模扩展仍不如自回归路线成熟;加速版 FPD 的三项分数均略低
Eureka-Audio(2026)
多机构作者团队
Whisper + 稀疏 MoE adapter + Qwen3-1.7B
对齐约 100B token、联合预训练约 1T、SFT 30B;DataFlux 合成验证闭环
speech/sound/music 理解、ASR、文本问答
本文理解榜综合 62.17;论文以 1.7B 语言骨干报告多基准结果
参数小、吞吐高;专家分流缓解模态冲突
自报 ASR/理解配置与他文不同;合成验证器可能引入偏差
ALARM(2026)
多机构作者团队
多编码器融合压缩 + 冻结 4B reasoning LLM
600 万实例、250 万提示、1.9 万小时;self-rephrasing
多域音频理解与推理;文本输出
MMAU full 62.4、MMAR 48.7;speech 子集突出
冻结 LLM、训练成本低;避免把 transcript 直接暴露给 CoT
多编码器增加系统复杂度;sound/music 弱于 speech;上限受冻结骨干限制
Audio-Cogito(2026)
多机构作者团队
基于 Qwen3-Omni-Thinking + Cogito-Pipe + 自蒸馏
54.5 万 reasoning samples
开放音频推理、问答;文本输出
论文报告开源模型中的 MMAR SOTA,并在 Interspeech 2026 Audio Reasoning Challenge 取得 top-tier 表现
模型与数据开放,便于研究复核
论文仅以 MMAR 作为主要基准;仍依赖自动生成轨迹,挑战赛分布代表性有限
Gemini 3.1 Pro(2026)
Google DeepMind
基于 Gemini 3 Pro 家族的稀疏 MoE Transformer,原生支持文本/图像/音频/视频;最长 1M token;参数未公开
公开网页、授权数据、用户数据与合成数据等混合;后训练含指令、RL 与人类偏好数据,规模未公开
音频/视频/文本理解、长上下文推理、语音输入与工具调用
Qwen3.5-Omni Table 5 的外部对照:MMAU 81.10、MMAR 83.70、MMSU 81.30,综合 82.03
在本文所列三项外部对照中综合分最高,MMAR 分项突出
闭源;数字并非 Google 自报,评测实现和具体模型版本不可独立复核,难拆分音频感知与语言推理收益
Gemini 3.1 Flash Audio(2026)
Google DeepMind
基于 Gemini 3 Pro;Flash Live 支持最长 128K 输入并输出音频/文本,Flash TTS 接收最长 16K 文本;参数未公开
沿用 Gemini 3 Pro 数据体系,具体语音后训练规模未公开
实时音视频/语音对话、文本与语音输出、TTS、多轮交互
官方模型卡确认 Flash Live 与 Flash TTS 两种形态并链接各自评测页;未报告本文三项交集基准
低延迟实时语音/视频交互与可控 TTS
闭源;与离线理解基准并非同一任务设置,不能直接排入主榜
Qwen3.5-Omni(2026)
阿里云 / Qwen 团队
数千亿参数 Hybrid Attention MoE Thinker–Talker;AuT 6.25Hz;ARIA;RVQ+MTP
AuT 4000 万小时;全模型超过 1 亿小时音视频;核心阶段约 4T token
长音视频理解、ASR、实时 TTS、全模态对话
Plus:MMAU 82.2、MMAR 80.0、MMSU 82.8;支持 10 小时以上音频
规模、长上下文、多语、实时生成和 AV grounding 均处于论文所列前沿
Plus/Flash 非开放权重;数据/算力不可复现;论文声称的 215 个 SOTA 子任务不能视为单一总分
Step-Audio-R1.5(2026)
阶跃星辰(StepFun)
Step-Audio-R1 基础上的冷启动 SFT + rubric/preference reward model + RLHF
从 RLVR 的可验证答案奖励转向自然度、连贯性、语气与长对话整体偏好
语音推理、情绪/韵律感知、长对话与 S2S
论文报告在保持推理竞争力的同时改善多轮语音交互体验
论文自称首个系统引入 RLHF 的音频推理模型;这一“首次”结论依赖作者检索范围
主观偏好难复现;奖励模型和完整训练数据未公开
StepAudio 2.5(2026)
阶跃星辰(StepFun)
ASR/TTS/Realtime 共享骨干;任务解码约束;ASR MTP
ASR 分支使用约 10 万小时短语音和 5 万小时长语音;可验证 ASR reward、TTS/Realtime RLHF
ASR、TTS、Realtime 对话;共享骨干
本文四个 ASR 子集平均错误率 3.45;论文报告 RTF 0.0053
统一基础模型可切换专业工作模式;ASR 极低延迟
新报告、内部数据多;不同模式干扰和第三方复测仍不足

六、四年间最关键的技术变化

6.1 音频表示:连续特征与离散 token 并行发展

  • 连续特征路线常使用 Whisper、BEATs、CLAP 等编码器,保留细粒度信息,再由线性投影、Q-Former 或 resampler 压缩后送入 LLM。优点是理解任务成熟、训练稳定;缺点是难以直接生成音频。
  • 离散 token 路线用神经音频 codec/tokenizer 把波形离散化,使 LLM 同时建模文字与声音。优点是天然支持 speech-to-speech;缺点是序列很长,语义与声学细节存在码率冲突。
  • 新一代系统常采用混合方案:连续特征负责输入理解,离散 token 负责输出生成,Kimi-Audio 是典型例子。

6.2 连接模块:从简单前缀到跨层聚合与稀疏专家

早期 Pengi 式prefix projector成本低,但可能丢失音频时序细节;随后 Q-Former、音频适配器和多层特征聚合成为主流。2026 年 Eureka-Audio 又把 adapter 做成稀疏 MoE,让 speech、sound、music 的冲突由不同专家分担。连接模块的目标本质上是解决两个压缩问题:把高帧率长音频压到 LLM 可承受的长度,同时不丢事件顺序、说话人和韵律。

6.3 数据:从人工标签转向合成指令、反事实与规模化预训练

OpenAQA-5M、CompA-R、CoTA、AF-Think、AudioMCQ 等数据表明,Audio-LLM 的跃升高度依赖 LLM 自动生成问答、解释或思维链;MiMo-Audio/Qwen3.5-Omni 又把原始音频规模推到 1 亿小时级。这显著提升覆盖,却带来四类风险:

  1. 文本教师可能根据标签“编答案”,而不是忠实于原音频;
  2. 模型学会语言先验,听觉证据不足时仍能猜中;
  3. 训练数据、公开音频集和评测题之间可能发生污染。
  4. “小时数”和“token 数”跨论文口径不一致:原始去重音频、增强后样本、混合重采样和音视频联合 token 不能直接比较。

6.4 后训练:SFT → DPO → RLVR → grounded / multi-objective RLHF

2023 年重点是音频指令微调;2024 年 Qwen2-Audio 等将偏好优化引入音频交互;2025 年后,多篇工作将可验证奖励、结构化 CoT 或强化学习用于音频问答。audio-contribution-aware、AHA、Step-Audio-R1 分别从听觉贡献、反事实一致性和有根推理角度收紧“答对即可”的目标。Step-Audio-R1.5 的结论尤其重要:只奖励答案正确可能损害韵律、情绪和对话连续性,真实助手需要多目标后训练,而不是一味延长 CoT。

6.5 交互:级联系统向全双工端到端系统迁移

传统语音助手依赖 ASR→文本 LLM→TTS,容易丢失语气、情绪、环境声及重叠说话。Moshi、Qwen2.5-Omni、Kimi-Audio、Step-Audio 系列尝试直接建模音频输入输出。但级联系统依然具备模块可替换、结果可审计和工程稳定的优势,短期内两条路线会并存。

七、仍未解决的核心问题

  1. 真正的音频 grounding。模型可能依赖问题文本和数据集先验;需要音频扰动、反事实样本和“无声/错配音频”对照实验确认答案确实来自听觉证据。
  2. 复杂声景与时间定位。多说话人、音乐加语音、弱事件被强声源遮蔽、长时间跨度上的先后与因果,仍是明显薄弱项。
  3. 长音频不是简单扩大上下文。分钟到小时级音频需要分层记忆、事件索引、时间戳引用和检索机制,否则计算量随帧数迅速增长。
  4. 推理的可信度。思维链可以改善分数,也可能只是更流畅的事后解释;需要可验证中间变量,如事件时间、声源、频率/节奏证据。
  5. 评测不可比。不同论文使用不同提示、音频预处理、闭源裁判和数据版本;开放生成指标对措辞敏感,LLM-as-a-judge 还可能偏好某些回答风格。
  6. 语言与领域覆盖不均。多数通用音频数据偏英语和公开视频;低资源语言、方言、医疗听诊、生物声学、工业异常声仍缺少高质量音频—语言配对。
  7. 隐私与安全。音频天然包含身份、位置、健康、背景对话等敏感信息;实时模型还需处理录音同意、说话人冒充、提示注入和深度伪造风险。

八、值得继续跟踪的研究方向

  • 可验证音频推理:输出答案时同步给出事件、说话人和时间区间证据。
  • 反事实与音频贡献评测:替换、静音、打乱或移动关键声源,检查答案是否真的随听觉证据变化。
  • 多尺度音频记忆:局部声学细节、句子级语义、长程事件摘要分层建模。
  • 联合声景理解:同时处理语音内容、副语言、音乐与环境事件,而非只选择最强声源。
  • 空间与物理听觉:从单声道标签扩展到方向、距离、混响、遮挡、频带、事件次数与连续运动。
  • 小模型与边缘部署:蒸馏、帧率压缩、流式编码和动态计算,在隐私场景本地运行。
  • 交互式主动听觉:模型能请求重放、放大某段、分离声源或调用音频检索工具,而非一次性猜答案。
  • 独立第三方评测:固定提示、预处理、裁判和版本,加入反事实、噪声、口音及真实对话压力测试。

九、总体判断

音频理解大模型已经完成了从“音频分类器”到“可对话、可推理、可生成的听觉基础模型”的范式切换。Qwen3.5-Omni、MiMo-Audio 说明 1 亿小时级数据、MoE 和长上下文正在形成新的规模前沿;AF3、Eureka-Audio、ALARM 则说明开放数据与专门结构仍能让较小模型有竞争力。但现有系统尚未达到稳定、可信的类人听觉,真正困难的部分仍是:混合声景、长程时序、弱声源、多说话人、副语言、空间/物理属性、专业知识以及可验证推理。

未来两三年的胜负手不是“规模”或“数据”二选一,而是五件事的组合:原生多模态规模化预训练、更高保真的多尺度/空间音频表示、更可信且可追溯的音频—语言数据、面向听觉证据与感知体验的多目标后训练,以及能揭示“模型到底有没有听”的反事实评测。2026 年最值得警惕的误区,是把更长 CoT、更自然的语音或更大的输入窗口直接当成更强的音频理解。