当视觉信息丢失、模糊或被遮挡,模型 还能否精准地从嘈杂人声中提取出目标说话人的声音?本文提出的MeMo 框架,借鉴人类大脑的「注意力动量」机制,让模型像人一样——只要看一眼,就能持续聚焦。 在视觉受损场景下,MeMo 取得了约27% 的相对性能提升,且满足实时流式处理要求。

论文标题与作者:MeMo 发表于 IEEE TASLP 2026

📄 发表:IEEE Transactions on Audio, Speech and Language Processing (TASLP), 2026

🎧 演示 & 代码:https://mrjunjieli.github.io/demo_page/MeMo/index.html

1. 一个真实的问题:当 模型「看不见」时

想象你正在参加一场鸡尾酒会,想听清楚朋友在说什么,但他的脸被人群挡住了,或者光线太暗看不清嘴唇——这时,你依然能靠记忆和上下文努力跟上对话。

然而,现有的音视频目标说话人提取(AV-TSE)系统做不到这一点。这类系统的核心思路是:盯着目标说话人的嘴唇,从嘈杂的混合语音中分离出他/她的声音。可一旦视觉信息出问题——

  • 🔴视觉丢失:人脸完全检测不到;
  • 🔴嘴唇遮挡:说话人用手或话筒挡住了嘴;
  • 🔴低分辨率:画面模糊、噪声严重。

——系统性能就会急剧下降,这严重限制了 AV-TSE 在真实场景中的落地。

图 1:传统 AV-TSE 仅依赖视觉线索,线索不可靠时性能骤降;MeMo 通过自注册(Self-enrollment)补充说话人与上下文信息,实现更鲁棒的提取。

2. 灵感来源:人类大脑的「注意力动量」

神经科学研究发现,人类在持续关注某个声源时,选择性听觉注意力会随时间逐渐增强。这依赖于工作记忆(Working Memory)——大脑会不断存储、更新当前注意力的焦点。

一个典型现象是「Look Once to Hear」(看一眼就能听):哪怕只瞥了一眼说话人,大脑也能在之后维持稳定的听觉聚焦。

🎯 核心洞察:能不能让 模型 也拥有这种能力?即使当前视觉不可靠,也能从「历史记忆」中提取注意力信号,维持对目标说话人的聚焦?这正是 MeMo(Attentional Momentum,注意力动量) 的由来。

3. MeMo 框架:双记忆库驱动的注意力动量

MeMo 的核心思想非常优雅:让模型从自己之前提取出的语音中,学习「该关注谁」和「在说什么」,并用这些历史信息来补偿当前不可靠的视觉线索。

它不是某个特定模型的结构,而是一个通用框架,可嵌入各种 AV-TSE 架构。其核心是两个自适应记忆库(Adaptive Memory Banks):

记忆库
存储内容
作用
说话人记忆库Speaker Bank
说话人身份嵌入
记住「谁在说话」
上下文记忆库Contextual Bank
历史上下文语音嵌入
记住「在说什么」

工作流程上,第 0 步(冷启动)仅用视觉线索完成首次提取,并把结果「自我注册」(Self-Enrollment)存入两个记忆库;之后每一步都从记忆库中检索最相关的历史信息,与当前视觉、当前混合语音一起融合,得到更鲁棒的提取结果,再用 FIFO 或注意力分数(ABS)策略更新记忆库。

图 2:MeMo 框架总览。两个自适应记忆库(说话人记忆库 / 上下文记忆库)通过检索与更新,把模型自己历史输出的语音转化为持续的注意力信号。

4. 实验:视觉受损下约 27% 的相对提升

作者在VoxCeleb2上模拟了三类视觉损伤——视觉丢失、嘴唇遮挡、低分辨率,并以 TDSE 为基线、在在线流式模式下评测。

图 6:三类视觉损伤示例——视觉丢失(全黑)、嘴唇遮挡、以及低分辨率(高斯噪声 / 模糊 / 下采样)。

4.1 上下文记忆库——真正的杀手级特性

下表中,对比「仅视觉(Visual Only)」与加入记忆库后的「Visual+SelfEnro」:在线模式(Online)受损视觉下,SI-SNR 从8.13 dB 提升到 10.34 dB,提升超过 2 dB;而且自注册(SelfEnro)已逼近使用真实目标语音(TgtEnro)的理论上限。

表 V:上下文记忆库在不同评测设置下的表现。SelfEnro(自注册)几乎追平 TgtEnro(真实目标语音)的理论上限。

4.2 对不同视觉损伤类型的鲁棒性

无论哪种损伤类型,配备上下文记忆库的 MeMo(System 4)都保持着惊人一致的高性能——这说明上下文信息能有效补偿任何形式的视觉退化。

表 VIII:不同视觉损伤类型下的对比(在线模式,SI-SNR/dB)。System 4(MeMo + 上下文记忆库)在三类损伤下均稳定在 10 dB 量级。

🎉 惊人的一致性:基线在「视觉完全丢失」时只剩 6.35 dB,而 MeMo 仍有 10.18 dB;嘴唇遮挡、低分辨率两类损伤也分别提升到 10.31 / 10.52 dB。

4.3 长时语音:基线衰减,MeMo 依旧稳定

随着语音变长,基线模型会持续掉点(40s 时仅剩 5.70 dB),而 MeMo 凭借不断累积的记忆,始终稳定在 10 dB 左右。

表 XII:长时语音上的分段 SI-SNR。System 1(基线)随时长快速衰减,System 4(MeMo)几乎不掉点。

4.4 通用性:换骨干网络一样能涨

作为通用框架,MeMo 在 TDSE、USEV、BSRNN 三种不同骨干上均取得显著提升,且新增参数量与计算量都很小;与多个 SOTA 方法相比也全面占优。

表 XIII:与 SOTA 方法的对比(受损视觉,在线模式)。MeMo 在 TDSE / USEV / BSRNN 三种骨干上均带来一致提升,参数与算力开销极小。

6. 一些有趣的发现

  • 上下文 > 说话人:
    说话人记忆库有帮助但有限,上下文记忆库才是真正的大杀器——上下文信息高度时间敏感,最新的嵌入最有用。
  • 两者合用反而不好:
    同时启用两个记忆库并不互补,可能因信息冗余或冲突导致性能下降。
  • Transformer 不太行:
    CNN/RNN 骨干在该框架下表现稳定,而 Transformer 对「视觉 → 视觉+语音」的模态切换分布偏移很敏感。
  • 说话人切换不需手动清库:
    在对话中目标突然切换时,MeMo 能自适应追踪新目标,切换点附近仅轻微下降。

7. 总结

MeMo 提出了注意力动量(Attentional Momentum)这一新颖概念,灵感源自人类认知机制。通过说话人与上下文两个自适应记忆库,它让 AV-TSE 系统在视觉不可靠时,依然能维持对目标说话人的精准聚焦。

  • ✅通用框架:可集成到多种 AV-TSE 架构;
  • ✅显著提升:受损视觉下约 27% 的相对改善;
  • ✅实时处理:RTF≈0.11,满足在线流式延迟要求;
  • ✅强鲁棒性:对各种视觉损伤类型与比例保持稳定;
  • ✅自适应切换:能应对目标说话人动态变化的场景。

💬 一句话总结:MeMo 赋予了 AI「看一眼就够了」的能力——即使视觉受损,也能像人类一样,靠「注意力动量」持续追踪目标说话人的声音。


论文:MeMo: Attentional Momentum for Real-time Audio-visual Target Speaker Extraction under Impaired Visual Conditions

作者:Junjie Li*, Wenxuan Wu*, Shuai Wang†, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li