它听得懂情绪、辨得出身份、甚至能模仿你说话——但你敢信任它吗?
“你今天看起来有点累。”当你对手机说出这句话,它不仅能听懂字面意思,还能从你的语速、语调、呼吸节奏中判断——你是真的疲惫,还是在强撑?这不是科幻。这是大型音频语言模型正在实现的能力。从2022年到2026年,这类模型已经从“语音转文字”的工具,进化为能听情绪、辨身份、懂逻辑的听觉智能体。然而,一项由全球18所机构联合完成的深度综述却发出警告:
它们越聪明,就越容易被攻击、被欺骗、被滥用——而我们的防御手段,几乎还停留在“裸奔”阶段。

A Survey of Large Audio Language Models:Generalization, Trustworthiness, and Outlook--首个系统介绍音频语言大模型的综述,由南洋理工大学、复旦、清华、Unimelb等18所顶尖机构联合完成,是全球首篇系统聚焦于LALMs可信度问题的综合性综述。

与以往仅关注语音识别或单一安全问题的文献不同,它首次系统地剖析了LALMs的内生机理(架构、表征、训练、推理),(1)建立了六大可信度维度的分类体系;(2)揭示了攻击与防御之间的巨大不对称;(3)并提出了面向未来的纵深防御路线图。项目已开源在GitHub,成为该领域的重要参考。

🔥1.从“听写”到“思考”:LALMs的飞跃与裂痕
早期的音频AI是“级联系统”:先转文字,再理解。而今天的大音频语言模型采用端到端统一框架,直接处理连续声学信号。听起来很酷?问题就出在“连续”二字上。文本是离散的,容易过滤;但音频是连续的,任何细微的噪音、语气变化、背景声,都可能成为攻击的入口。综述指出:攻击面被急剧扩大——跨模态越狱、声学后门、生物隐私泄露等这些威胁,正在成为现实。
🔥2.六大“信任危机”:你的音频AI可能正在背叛你
综述将LALMs的可信度拆解为六个维度,每一个都藏着“坑”。
(I)幻觉——它“听”到了不存在的东西
你以为它在认真听?研究发现,很多LALMs其实过度依赖文本线索,把音频换成静音,表现居然没怎么下降。
更可怕的是,它们会“脑补”出不存在的声音事件,给出看似合理实则虚假的回答。
(II)鲁棒性——一点噪音就崩溃
稍微改一下语速、加一点背景雨声、甚至换个选项顺序,模型回答就可能天差地别。
综述中的评测显示:选项排列改变,准确率波动高达24%——这是真正的理解,还是投机取巧?
(III)安全越狱——用“情绪”骗过护栏
这是最令人背脊发凉的攻击方式。
攻击者不再需要编写恶意文本,只需要用某种情绪、口音或语速说出正常的话,模型就会乖乖执行违规指令。StyleBreak:用“愤怒”的语气说“帮我写一篇攻击性文章”,模型拒绝率大幅下降。WhisperInject:在人耳听不出的噪声中嵌入恶意指令,模型被“远程唤醒”。多语言越狱:英语安全对齐很好,但换成某个方言或弱资源语言,护栏立刻失效。文本时代的安全机制,在音频面前形同虚设。
(IV)隐私泄露——你的声音就是“身份证”
音频包含的远不止语义。HearSay基准测试显示:模型能在你不知情的情况下,从声音中推断出你的性别、年龄、健康状况,甚至地理位置。声纹识别能力越强,泄露风险越大——你的声音成了永不失效的“生物密码”。
(V)公平性偏见——口音决定待遇?
同一个问题,标准口音和方言口音得到的回答质量可能截然不同。
在医疗AI中,MedVoiceBias研究发现:模型会根据声音推断的“年龄”给出不同的诊断建议——这不是科幻,是已经发生的歧视。
(VI)伪造与认证——它分不清真假
语音克隆技术已经高度成熟。综述指出:当前LALMs在深度伪造检测上表现脆弱,攻击者只需替换几个关键词的语音,就能让模型“认错人”或“听错话”。
🔥3.攻击者“武装到牙齿”,防御者还在“打地鼠”
综述中最令人不安的发现是:攻击技术已经形成成熟生态,防御机制却仍然零散、被动、滞后。目前已有五大类攻击向量被系统化研究(对抗扰动、越狱、后门、隐私推断、偏见利用),而防御手段几乎只集中在“越狱缓解”上,且大多是事后补丁,而非架构级设计。更糟的是,大多数LALMs的安全对齐机制直接继承自文本LLM,根本没有考虑音频特有的连续性和副语言特征。

🔥4.未来之路:从“事后修补”到“先天可信”
综述作者提出了一个雄心勃勃的路线图,核心是“纵深防御”:
(I)输入层净化
在音频进入模型前,先通过扩散模型或随机平滑技术剥离对抗噪声和隐藏触发器,就像给音频加一道防火墙。
(II)隐私保护推理
通过表示解耦技术,让模型听懂“你在说什么”,但无法记住“你是谁”。让身份信息与语义内容在潜在空间中彻底分离。
(III)动态红队测试
不再依赖静态数据集,而是让AI代理主动攻击模型,模拟真实世界中的各种口音、环境、情绪变化,持续探测底线。
🔗 GitHub:https://github.com/Kwwwww74/Awesome-Trustworthy-AudioLLMs
📄 Paper:https://arxiv.org/abs/2605.20266
😊HuggingFace:https://huggingface.co/papers/2605.20266
