大家好,欢迎来到「AudioCC交我学」专栏!
在文本大模型中,思维链(Chain-of-Thought,CoT)通常意味着模型先写出若干推理步骤,再给出答案。一旦输入变成图像、环境声或连续语音,关键问题就从“是否逐步推理”进一步转向“用什么承载和更新中间思考状态”。
模型可以只在文字空间里推理,也可以重新裁剪图像、调用音频处理工具;还可以直接生成图像、音频或动作 token,或者在连续隐状态中完成内部推演。思考载体的选择,决定了模型在推理时还能接触哪些证据、会损失哪些信息,以及系统在可解释性、计算成本和实时性之间如何权衡。
本文的核心判断
多模态 CoT 的真正分水岭,是推理过程能否持续接触模态证据,以及中间状态由文字、工具操作、模态 token 还是连续向量承载。
一、多模态 CoT 的四层框架
文本 CoT 的中间步骤天然可被语言模型读取并继续生成,因此“思考载体”常被忽略。多模态模型则不同:图像和音频通常先经过编码器压缩,再投影到语言模型的嵌入空间。如果关键细节在编码阶段已经消失,后续再长的文本推理也无法重新获取这些原始证据。

二、视觉:从主动感知到视觉与动作推演
1. 固定视觉编码限制了文本 CoT 的上限
LLaVA-CoT [1] 代表最直接的路线:把视觉问答拆成问题摘要、相关视觉描述、逻辑推理和结论四个阶段,并提出测试时阶段式回溯搜索(Stage-Wise Retracing Search,SWIRES)扩展推理时计算。使用约 10 万条结构化训练样本并结合测试时扩展后,LLaVA-CoT 在一系列多模态推理基准上的得分,相较基础模型平均提升 9.4%。
这一结果说明,视觉语言模型(Vision-Language Model,VLM)的确会受益于更有组织的推理过程。但它仍面对一个硬限制:模型后续推理只能基于视觉编码器保留下来的表示。如果远处招牌文字、表格小数点或图中细线在编码后被抹平,文本 CoT 仍可以借助先验进行推断,但已丢失的原始视觉证据无法被重新获取。
2. 主动感知:让模型再看一眼
Visual CoT [2] 把人类的主动注视机制工程化:模型先预测关键区域的边界框(bounding box),系统从原始高分辨率图像中裁剪该区域,再把原图、局部图和问题共同送入第二轮回答。其 43.8 万条数据中,约 9.8 万条还带有详细推理步骤。
这套方法的价值还体现在可解释性上。预测框把“模型看错了地方”和“模型看对了但推理错了”分离开,提供了一个少见的可解释接口。对文档、图表、GUI 和高分辨率街景这类信息密度极不均匀的图像,主动聚焦往往比增加文本 CoT 更有效。

图1 Visual CoT 的主动视觉聚焦流程
Visual Sketchpad [3] 进一步把“看”扩展成“画”。模型按照思考—动作—观察(Thought–Action–Observation)循环,调用程序画线、标点、标框,或借助目标检测和分割模型生成辅助视觉标记。它采用确定性的绘图原语,绕开不可控的图像生成过程,因此特别适合几何、空间和图论任务。论文报告的平均准确率增益为:数学任务 12.7 个百分点,视觉任务 8.6 个百分点。

图2 Visual Sketchpad 的“思考—动作—观察”视觉草图流程
视觉中间层的本质
文本负责决定“下一步应该看哪里、画什么、调用什么工具”;新的视觉证据再回到模型中。该机制通过动态改变模型可访问的视觉证据来扩展推理过程,并减少对单次图像编码的依赖。
3. 模态原生:生成未来图像与动作意图
CoT-VLA [4] 把视觉 CoT 带入机器人控制。传统视觉—语言—动作(Vision-Language-Action,VLA)模型从“当前观察 + 指令”直接映射到动作;CoT-VLA 则先自回归生成一张短期未来的子目标图像,再预测实现该画面的动作序列。子目标帧作为一种中间状态直接输入策略模型,主要承担规划功能,并同时服务后续动作预测。
这一设计还让没有动作标注的普通操作视频能够参与预训练:视频可以教模型“下一刻应该出现什么”,机器人示范再教它“怎样让场景变成那样”。因此,视觉推理第一次与可执行控制形成了可验证闭环。

图3 CoT-VLA 通过未来子目标图像连接视觉推理与动作预测
ACoT-VLA [5] 则继续把推理重心下沉到动作空间。它显式生成“接近—下降—夹取—抬起”一类粗粒度动作意图,同时从隐藏状态提取隐式动作先验,再共同约束最终动作头。这项设计让中间状态直接携带运动学信息,把 CoT 从文本表达推进到动作层面的规划。
4. 隐空间视觉推理
Latent Visual Reasoning(LVR)[6] 尝试直接在视觉嵌入空间中自回归生成隐状态,并让这些状态重建与问题相关的关键视觉 token。文本生成与视觉隐空间状态可以交错出现,强化学习进一步学习两种推理方式的切换策略。
隐空间视觉推理的首要困难是监督。显式 CoT 至少可以把人工或教师生成的文本作为目标,而连续状态不存在天然的“正确思考 token”。LVR 因而借助查询相关视觉 token 的重建、伪轨迹监督和强化学习约束中间状态;同类方法也常用自蒸馏生成并筛选替代目标。这些步骤会引入教师采样、轨迹过滤和额外后训练,因此较低的推理 token 开销仍可能伴随较高的总训练成本。近期机制分析进一步提示,在部分隐空间视觉推理设置中,性能增益可能来自其他机制;仅凭最终准确率不足以证明这些状态真正承担了可解释的视觉推理功能 [18]。
三、通用音频:推理必须基于正确证据
环境声、音乐和混合音频比图像更容易暴露固定编码的缺陷。音频编码器往往以较低帧率把波形压缩为连续特征;频谱细节、瞬态、混响结构、能量变化和多个声源之间的关系都可能被弱化。模型随后写出的 CoT 看似合理,实际依据可能主要来自转录文本或高层语义,声学细节对推理的直接贡献仍然有限。
1. 结构化与按需思考
Audio-Reasoner [7] 用 120 万条结构化音频推理样本训练模型依次完成规划、音频描述、推理和总结。其价值在于证明:对音频模型而言,单靠提示词要求“逐步思考”通常不够,模型需要在训练中见过高质量、结构化的推理轨迹。
Audio Flamingo 3 [8] 则强调“按需思考”。简单识别任务不必生成长推理链,复杂音频问题才触发思考前缀(thought prefix)。它同时统一处理语音、环境声和音乐,并支持最长约 10 分钟的音频输入。工程上,这比默认开启冗长 CoT 更符合音频应用的延迟需求。
2. 工具调用:重访原始波形
Thinking with Sound(TwS) [9] 是音频领域最典型的中间版本。模型在文本推理过程中可以调用降噪、源分离、响度归一化、频谱分析和时间对齐等工具;处理后的波形和分析结果重新编码,作为下一轮证据。
在 MELD-Hard1k 中,研究者通过噪声、混响、音高偏移和速度扰动等方式构造更困难的声学条件,主流音频语言模型的准确率相较干净音频可能下降 50% 以上。TwS 的工具链无需重新训练基础模型,却能为不同规模模型带来约 24.73 至 36.61 个百分点的绝对提升。这里最关键的结论是:当问题源于感知证据受损时,重新处理声音往往比继续增加语言推理长度更有效。


图4 Thinking with Sound(TwS)的音频工具调用与证据回访流程
3. 模态原生:用音频草稿推理
UALM-Reason [10] 把音频理解、文本到音频生成和文本推理放进同一个自回归框架,并让文本与音频都能出现在中间推理过程中。它首先把用户意图扩展成结构化的 rich caption 作为生成蓝图;在自反思流程中,模型生成音频后再“听”自己的输出,重新描述实际结果,并用文本比较计划与结果的差异,最后据此生成改进版本。因此,这里的跨模态推理形成了“生成—理解—批评—修订”的闭环,音频会作为中间结果再次进入后续理解与修订。
从本文的四层框架看,这属于较强的模态原生推理:音频既是生成对象,也会被重新作为证据进入后续推理。代价同样明显——音频 token 的密度远高于文本,较长的中间音频会迅速增加上下文和计算开销,因此模型需要专门的并行预测、训练配方和推理策略来控制成本。
4. 接地、自蒸馏与跨模态对齐
2025—2026 年音频推理的一个明显变化,是研究者开始正面处理“文本替代推理”问题。Step-Audio-R1 [11] 通过模态接地推理蒸馏(Modality-Grounded Reasoning Distillation,MGRD)筛选真正引用音高、节奏、音色、能量和时序证据的推理链,再结合监督微调和强化学习,使更长的测试时推理建立在声学证据上,并减少仅生成表面合理文字解释的情况。
Audio-Cogito [12] 用同一模型生成并学习 54.5 万条显式音频 CoT,重点是降低外部教师与学生之间的推理风格错配;CORD [13] 则把模型在文本条件下的推理作为内部教师,通过 token 级反向 Kullback–Leibler(KL)散度和序列级奖励,把音频条件下的推理拉近到文本条件下的能力水平。这里的自蒸馏仍作用于可读的文本轨迹;到了真正的隐空间 CoT,自蒸馏还可能承担构造不可观测中间目标的职责,因而更依赖大规模采样、筛选与多阶段训练。
这三类方法都非常重要。严格来看,它们主要解决“如何训练出更接地、更一致的推理”。Audio-Cogito 的中间步骤仍是显式文本,CORD 也是跨模态蒸馏框架,因此直接将它们归入“隐空间 CoT”会混淆技术问题。音频路线的核心矛盾
音频模型需要同时保留语言模型的抽象推理能力和足够完整的声学证据。当前较有效的方向,是在文本推理之外保留可回访可操作的声音表征。
四、语音:在实时对话中推理
语音与通用音频共享声学建模问题,但又有两个特殊条件。第一,语音拥有一条高信息密度的符号桥梁——转录文本,尽管其中仍会丢失韵律、情绪等非词汇信息;第二,实时对话对额外等待高度敏感。因此,语音 CoT 的核心约束,是尽可能让推理与听、说并行,把原本发生在用户说完之后的文本思考前移到输入过程中。
1. 交错建模只是基础
SpiRit-LM [14] 证明文本 token 与语音 token 可以在同一序列中细粒度交错,表达性版本还加入音高与风格 token,以保留情感和韵律。它为“边说边想”提供了统一词表和序列建模基础,但这种交错生成能力本身尚不足以证明这些语音 token 已经承担推理步骤。
VITA-Audio [15] 同样更准确地说是一项实时生成基础设施。其多跨模态 token 预测(Multiple Cross-modal Token Prediction,MCTP)模块可在一次前向传播中预测多个音频 token,把首段语音生成提前到第一次前向,并获得约 3—5 倍的推理加速。它解决了 CoT 系统“想完以后来不及说”的工程瓶颈,角色更接近实时生成基础设施。
2. 从说前思考到听时思考
Can Speech LLMs Think while Listening? [16] 把显式文本 CoT 移到用户说话期间。系统通过“问题完整度”判断当前信息是否已经足以开始推理,让流式自动语音识别(Automatic Speech Recognition,ASR)与 CoT 并行进行;再用偏好优化压缩推理长度。论文报告,在一组口语推理任务上,文本空间推理使准确率平均达到基础设置的 2.4 倍;进一步的听时思考与偏好优化,在不损失准确率的情况下将推理延迟降低约 70%。
这条路线仍会把未完成输入转换成显式文字推理,因此存在提前承诺和错误猜测的风险。用户后半句可能推翻前半句,模型此前写出的推理链却已经形成。
3. FLAIR:听话时的隐空间推理
FLAIR(The Silent Thought)[17] 把“听时思考”推进到隐空间。用户说话期间,模型保持静默,将上一时刻的隐空间状态递归反馈到下一步,并与当前语音输入共同更新内部状态。用户结束后,模型再切换到显式文本或语音生成;若用户插话,则重新回到内部推理状态。
由于隐空间推理与用户说话同步进行,响应前无需再追加一段独立的文本 CoT 推理,同时也减少了在问题尚未完整时过早写出自相矛盾文字的风险。训练上,FLAIR 把听话期间的隐空间状态序列视为隐变量,通过证据下界(Evidence Lower Bound,ELBO)目标优化最终回复。这里同样不存在可直接标注的正确“思考 token”;FLAIR 采用隐变量目标提供替代监督,并需要处理 KL 权重、状态塌缩和训练稳定性。它省去了人工 CoT 标注,训练阶段仍然存在额外开销。


图5 FLAIR 的全双工对话流程与隐空间结构
但它也把最难的问题推到了台前。隐空间状态不可读时,研究者很难判断内部表征究竟在组织有效证据,还是仅与最终答案相关且缺乏因果作用。对需要审计的应用场景,低延迟和中间状态有效性验证需要同时满足。
五、三模态的共同趋势
趋势一:主动感知取代静态编码
视觉中的裁剪与绘图、音频中的降噪与频谱分析,本质上都在修正“一次编码决定一切”的被动感知模式。模型开始像一个智能体那样主动选择证据,并在推理过程中持续更新可用信息。
趋势二:推理接地于模态信息
视觉推理要绑定空间位置和对象关系;音频推理要绑定音高、音色、时序与频谱;机器人推理要绑定动作轨迹和运动学约束。“看起来像推理”和“确实使用了正确证据”需要分开评估。
趋势三:能力与成本同步上升
子目标图像、音频草稿和动作意图能承载比文字更丰富的状态,但会带来更高的 token 密度、训练数据需求和错误传播风险。强版本与工具型中间版本可能长期并存:后者往往更便宜、更可解释,也更容易插入已有系统。
趋势四:隐空间推理的效率与代价
LVR 和 FLAIR 表明,连续状态可以绕过离散 token 的带宽限制,并把部分推理压缩进输入阶段或内部循环。但隐空间 CoT 没有天然正确的“思考 token”监督,通常需要自蒸馏、重建约束或 ELBO 一类替代目标,并付出数据生成、筛选和额外后训练成本。状态塌缩、不可解释和不可验证也随之成为核心问题。从近期工作来看,研究关注点正在继续推进:除了实现隐空间推理,还需要证明这些隐状态确实承载并推动了有效推理。
六、当前局限与开放问题
1. 模态接地与过程评估
最终答案正确,可能来自猜测;答案错误,也可能是感知、规划或执行某一步出了问题。多模态 CoT 需要把评测从“答案是否正确”推进到“模型是否使用了正确证据”,并建立分阶段的过程评估。
2. 隐空间监督与审计
隐空间状态不像文本或边界框那样可以直接检查,而且“能够预测最终答案”和“对最终决策具有因果作用”属于两个不同层次的证据。需要结合因果干预、探针、中间目标或混合显式的检查,验证这些状态到底承载了什么。
3. 工具链扩展
Visual Sketchpad 和 TwS 都依赖预设工具。面对未知任务,模型怎样发现、组合或学习新的视觉与声学操作,并判断何时值得调用它们,仍是多模态智能体的重要问题。
4. 中间状态的误差放大
错误的裁剪框、虚假的子目标图像、偏离声学证据的文本 CoT,都会把早期误差传递到后续步骤。系统需要回溯、证据一致性检查和可恢复的中间状态,减少对单向链式推理的依赖。
5. CoT 攻击面
一旦中间推理直接控制机器人动作或语音助手,攻击者可以通过扰动内部目标、工具调用或动作意图改变系统行为,甚至无需直接篡改最终答案。如何对中间状态和工具调用建立安全约束,是强版本多模态 CoT 必须面对的问题。
七、结语
多模态 CoT 的关键在于证据、状态与计算时机
从 LLaVA-CoT 到 Visual Sketchpad,从 TwS 到 UALM-Reason,再到 FLAIR,可以看到一条清晰的技术演进线索:多模态推理正在从“写解释”,逐步走向“主动获取证据、生成可操作中间状态、逐渐把推理压缩进连续空间”。
这条路线也提醒我们,CoT 更应该视为一种可变的设计选择。对于文档问答,最好的“思考”可能是再裁剪一次;对于嘈杂音频,可能是先做源分离;对于机器人,可能是一段动作意图;对于实时语音,则可能是用户听不见、但模型持续更新的隐空间状态。
因此,判断一个系统是否真正具备多模态 CoT,需要同时考察输出形式和内部推理过程。具体包括:推理阶段仍能接触哪些证据,中间状态由哪个模块生成和消费,受到什么目标监督,以及这些状态能否推动正确决策。
八、参考文献
[1] G. Xu et al., “LLaVA-CoT: Let Vision Language Models Reason Step-by-Step,” in Proc. IEEE/CVF Int. Conf. Comput. Vis. (ICCV), 2025, pp. 2087–2098.
[2] H. Shao et al., “Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning,” in Advances in Neural Information Processing Systems, vol. 37, 2024.
[3] Y. Hu et al., “Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models,” in Advances in Neural Information Processing Systems, vol. 37, 2024.
[4] Q. Zhao et al., “CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models,” in Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2025, pp. 1702–1713.
[5] L. Zhong, Y. Liu, Y. Wei, Z. Xiong, S. Liu, and G. Ren, “ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models,” in Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2026, pp. 8152–8162.
[6] B. Li et al., “Latent Visual Reasoning,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2026.
[7] Z. Xie, M. Lin, Z. Liu, P. Wu, S. Yan, and C. Miao, “Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models,” in Proc. 2025 Conf. Empirical Methods Natural Language Processing (EMNLP), 2025, pp. 23829–23851, doi: 10.18653/v1/2025.emnlp-main.1216.
[8] S. Ghosh et al., “Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models,” in Advances in Neural Information Processing Systems, vol. 38, 2025, doi: 10.52202/085713-1396.
[9] Z. Xiong, Y. Cai, Z. Li, J. Yuan, and Y. Wang, “Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models,” arXiv:2509.21749, 2025.
[10] J. Tian et al., “UALM: Unified Audio Language Model for Understanding, Generation and Reasoning,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2026.
[11] F. Tian et al., “Step-Audio-R1 Technical Report,” arXiv:2511.15848, 2025.
[12] L. Li et al., “Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models,” arXiv:2604.12527, 2026.
[13] J. Hu et al., “CORD: Bridging the Audio–Text Reasoning Gap via Weighted On-policy Cross-modal Distillation,” in Findings of the Association for Computational Linguistics: ACL 2026, 2026, pp. 31602–31612.
[14] T. A. Nguyen et al., “SpiRit-LM: Interleaved Spoken and Written Language Model,” Trans. Assoc. Comput. Linguistics, vol. 13, pp. 30–52, 2025, doi: 10.1162/tacl_a_00728.
[15] Z. Long et al., “VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model,” in Advances in Neural Information Processing Systems, vol. 38, 2025.
[16] Y.-J. Shih et al., “Can Speech LLMs Think while Listening?” in Proc. Int. Conf. Learn. Represent. (ICLR), 2026.
[17] D. Wu et al., “The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning,” in Proc. Int. Conf. Mach. Learn. (ICML), 2026.
[18] G. Guo et al., “Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning,” arXiv:2606.01287, 2026.
供稿 | 于海彬
编辑 | 刘怡涵
审核 | 张王优
