AI与人的长期关系,需要在一次次交流中建立起来。

昨天聊过的内容,可以帮助AI理解今天的对话;今天的对话,也会成为它下一次回应的依据。

AGI Being所指向的,正是一种能够在长期相处中逐渐了解一个人的智能存在。

而在实时语音中,AI怎样才能快速找到相关记忆,又自然地接上话?

2026年3月,Salesforce AI Research在VoiceAgentRAG论文中,将检索称为语音链路中的“关键延迟瓶颈”。研究者指出,在生产环境中,一次向量数据库查询,单是网络往返通常就需要50—300毫秒,再加上其他处理环节,很容易超出自然对话的时延预算。

长期记忆也会遇到类似的问题。

VoiceMem论文指出,常规记忆检索与处理往往需要2—3秒,而实时对话能够接受的额外时延约为100—200毫秒。

AI需要结合之前的对话,才能更好地理解用户。但如果每次查找记忆都要花上几秒,对话就很难保持流畅。

记得住,还必须及时起来。

围绕这个矛盾,VoiceMem给出了一套可行的解法。

来自南洋理工大学、新加坡国立大学、清华大学、香港中文大学和Open Interaction Lab的研究者,共同提出了这套面向语音交互的无延迟“流式双脑”记忆框架。

这项工作也延续了论文第一作者谢之非的研究主线:他是目前大音频语言模型、实时语音交互与多模态AI领域内非常活跃的研究者之一。

它将人物、事件和事实交给信息左脑组织,将相对稳定的人格,以及对不同对象的态度和情绪交给情感右脑维护。两套记忆协同调用,让过去发生的事情和用户当时的感受,都能够成为理解当前对话的依据。

为了让记忆及时参与回应,VoiceMem在用户仍在说话时就提前启动处理,把记忆访问叠进系统判断用户是否结束发言的等待窗口。论文指出,双脑记忆检索耗时134毫秒,结合流式调度实现了近乎零延迟——几乎不再为对话增加额外等待。

速度之外,它也提高了有限检索预算下的准确率。

在LoCoMo上,VoiceMem仅取回5条记忆便取得91.2分,比Mem0取回200条高出29.52分;人格记忆平均得分达到74.16分,比论文对比中此前最强的基线MemOS高1.89分。

这让事实回忆、人格理解和实时回应,能够在同一套系统中协同工作。

目前,VoiceMem已经开源,提供可安装的 voicemem 包、流式调用示例、交互式Demo、模型、数据集和评测入口。Qwen Audio Agent也已提供VoiceMem接入方案,支持将其作为可选记忆系统,在新的语音会话中继续召回用户偏好与长期事实。

对于AGI Being,长期相处的意义,也正在这里。

一个人的选择会变化,情绪会变化,对同一件事的看法也会变化。能够长期陪伴的AI,需要在这些变化中不断更新认识,并让积累下来的理解影响之后的回应。

VoiceMem向前推进的一步,就是让共同经历能够在自然的对话节奏中被重新调用。

当AI能够带着过去的理解参与今天的交流,再从今天的交流中继续认识你,人与AI之间才有了可以持续积累的关系。AGI Being所指向的长期共生,也就有了更加具体的起点。


⏩ ⼀句话看懂VoiceMem

两个脑,⼀套流式检索:

  1. 信息左脑:通过Schema和Entity组织事实记忆,回答“过去发⽣过什么”;
  2. 情感右脑:通过⼈格节点管理⻓期特征、情感和态度,回答“⽤⼾是⼀个怎样的⼈”;
  3. 流式检索:⽤⼾说话时持续完成ASR,根据已经听到的内容提前圈定记忆范围,再利⽤⽤⼾说完后的⾃然停顿完成搜索。

两个脑在存储时各⾃分⼯,在检索时彼此协作。右脑可以利⽤左脑已经激活的⼈物、事件或概念,缩⼩⼈格与情感记忆的搜索范围。这样,系统找回的不只是“⽤⼾曾经提到过某个项⽬”,还可以找到⽤⼾对这个项⽬⻓期表现出的态度。

⏩ 为什么⽂本Agent的记忆不能直接搬过来?

Mem0、Zep、MemOS等系统已经可以为⽂本Agent提供⻓期记忆,为什么不能直接接到语⾳模型后⾯?

问题⾸先出在速度。

传统记忆流程通常需要2―3秒,⽽⾃然的实时对话只能容许约100―200毫秒的额外时延。⼀次明显的停顿,就⾜以破坏语⾳交互的节奏。

第⼆个问题是检索数量。

⽂本Agent可以⼀次取回Top-100甚⾄更多记忆,再交给模型筛选。但语⾳模型的上下⽂容量和响应预算更加有限,⼤量记忆会带来额外的token成本。

如果直接把Top-100缩减到Top-5,真正有⽤的信息⼜可能被⼏条“看起来相关”的结果挤出去。因此,问题并不是简单地“少返回⼏条”,⽽是:

如何在只保留五个位置的情况下,让每⼀条记忆都更有⽤?

除此之外,现有记忆系统主要保存“⽤⼾说过什么”,却很少进⼀步区分:

  • ⽤⼾⾃⾝相对稳定的性格和⾏为模式;
  • ⽤⼾对具体⼈物、事件或概念的情感;
  • ⼀次短暂情绪与⻓期⼈格之间的差别。

VoiceMem正是围绕准确率、情感建模和实时性,对记忆的组织与检索流程进⾏了重新设计。


⏩ 技术要点⼀:信息左脑,先路由再排序

⽇常记忆检索最容易出现的问题,是“搜得到,但搜不对”。

例如⽤⼾问:“上次体检结果怎么样?”

仅按照⽂本相似度检索,系统可能找回多条包含“体检”的记忆,却漏掉真正记录检查结果的那⼀条。问题不只发⽣在排序阶段,也发⽣在排序之前划定的搜索范围。

VoiceMem的信息左脑使⽤两级Schema―Entity索引组织事实记忆:

  • Schema负责粗粒度语义路由;
  • Entity负责定位具体的⼈物、事件和概念;
  • 底层记忆项则连接在相应的Entity之下。

查询到来后,系统先匹配相关Schema和Entity,再沿强、弱⼀跳关系进⾏扩展。底层记忆引擎不会搜索完整记忆库,⽽是只在已经缩⼩的候选池中寻找Top-K。

⼀句话概括:

先找到正确的记忆区域,再在⼩范围内完成排序。

记忆还会⾃动更新

每轮对话结束后,异步更新器会提取新的事实,并结合附近的已有记忆执⾏:

  • ADD
  • UPDATE
  • DELETE
  • KEEP

对应的Schema、Entity和关系也会在对话主流程之外更新,不占⽤⽤⼾等待回复的时间。

分类不是提前全部写死的

记忆不断增加后,⼀个类别可能越⻓越⼤,内部信息密度随之下降;但如果频繁按照固定规则拆分,⼜可能割裂原本相关的记忆。

VoiceMem因此引⼊了Cluster Emergence,簇涌现机制。

系统观察哪些Entity会在实际查询中反复被共同激活,再根据共同检索模式形成候选⼦图。随后,LLM从相关性、重要性和完整性三个⽅⾯进⾏判断,只有满⾜条件的⼦结构才会被提升为新的记忆簇。

在论⽂对运⾏后记忆结构的分析中,左脑存储包含510条记忆和6个预设类别。系统运⾏后,⼜有两个⾮预设类别从语义图中涌现,共覆盖254条记忆,占整个存储的49.8%。

新的组织⽅式不是提前规定出来的,⽽是从⻓期使⽤和检索模式中逐渐形成的。

⏩ 技术要点⼆:情感右脑,区分“此刻的情绪”和“⻓期的你”

“⽤⼾不喜欢每周例会”和“⽤⼾容易焦虑”,属于两种不同的记忆。前者与⼀个具体对象有关,后者描述相对稳定的⽤⼾特征。如果把两者混在⼀起,系统可能记住“焦虑”这个标签,却不知道这种情绪因谁⽽起、在什么情境下出现。

VoiceMem因此设置了两类⼈格节点:

1. Independent persona nodes

记录⽤⼾⾃⾝相对稳定的特征,包括⻓期性格、⾏为规律和情感倾向。

2. Cross-entity persona nodes

记录⽤⼾对具体⼈物、事件或概念的情感,并连接到左脑中的相应Entity。前者回答“这个⼈通常怎样反应”,后者保留“这种情绪与谁、与什么事情有关”。在此基础上,右脑同时进⾏短期和⻓期情感归因。

短期归因

处理“此刻发⽣了什么”,保存当前情绪、情绪针对的对象以及产⽣的原因。

⻓期归因

处理“这种反应是否反复出现”。⼀段会话结束后,系统联合分析多轮情绪证据,将持续出现的情感与⾏为模式沉淀为稳定的⼈格记忆。

它不会因为⽤⼾今天有点不耐烦,就永久写下“这是⼀个暴躁的⼈”。

论⽂强调,⻓期归因并不是累积每⼀个瞬时状态,⽽是识别反复出现、能够解释⽤⼾⻓期⾏为的模式。实验也说明,看⻅全部对话历史,并不等于真正理解⽤⼾。

在ES-MemEval中,Full-Context基线已经能够读取完整历史,但在冲突检测和⽤⼾建模任务上分别只有12.10分和21.70分;VoiceMem对应达到69.10分和74.00分。

关键不只是模型有没有看⻅这些信息,⽽是有没有把分散在⻓期对话中的证据组织成对⼀个⼈的认识。

⏩ 技术要点三:流式记忆架构,把134毫秒检索藏进VAD等待时间

真正的“零耗时”并不存在。

VoiceMem的做法,是让记忆检索更早开始。

整个流式检索过程被拆成四个阶段:

1. Listening

⽤⼾仍在说话时,系统已经在流式完成ASR、说话⼈识别,以及左右脑中的Schema、Entity和⼈格节点匹配。

2. Speech Tail:0―200毫秒

系统检测到静⾳,但暂不判断⽤⼾已经结束表达。此前的流式识别和节点匹配结果继续积累。

3. Anticipation:200―400毫秒

当静⾳达到200毫秒,系统假设回复即将开始,提前计算查询Embedding,并展开左右脑的上层图。

4. Searching:400―500毫秒

此时只剩下底层记忆搜索,以及左右脑结果的合并与输出。

常⽤VAD阈值约为500毫秒。论⽂指出,这可以在回复开始前留下约400毫秒的处理窗⼝,⽽VoiceMem的密集双脑检索只需要134毫秒。

等VAD正式确认⽤⼾说完时,相关记忆已经基本准备好。

所以,VoiceMem所说的near-zero added latency并不是物理耗时为零,⽽是记忆检索⼏乎不再增加额外、可感知的对话等待。

⏩ 效果怎么样?

论⽂在7个主要Benchmark上,与10种记忆系统或基线进⾏⽐较。除特殊实验外,VoiceMem默认只检索K=5条记忆。

信息记忆

VoiceMem在11类信息任务中的7类取得领先,平均得分为76.39。

相⽐之下:

  • ⽐作为底层存储后端的Mem0⾼24.12分;
  • ⽐直接读取完整历史的Full-Context⾼15.90分;
  • 在需要同时找回多条记忆的时间推理任务上,优势尤其明显。

在LoCoMo上,VoiceMem仅检索5条记忆就达到91.2分;论⽂指出,Mem0即使检索到Top-200,成绩仍⽐VoiceMem低接近30分。

⼈格记忆

VoiceMem在⼈格记忆评测中的平均得分为74.16,⽐此前最强基线MemOS⾼1.89分。

移除右脑后,LoCoMo、ES-MemEval、ChatMem-Bench和Memora分别下降6.3、4.3、5.4和4.4分。

这说明⼈格与情感并不只是给回答增加⼀点“情绪价值”,其中确实包含事实记忆⽆法提供的信息。

⻓期真实语⾳评测

为了进⼀步验证记忆系统在真实、⻓期语⾳环境中的表现,研究团队构建了ChatMem-Bench。

它包含:

  • 316个问题;
  • 15314轮对话;
  • 约53⼩时⾳频;
  • 4个能⼒维度;
  • 14类细分任务。

四个维度分别是信息记忆、⼈格理解、情感归因,以及副语⾔与环境声⾳。

VoiceMem在14类能⼒中的11类取得领先。

差距最⼤的,是⽂字转写⽆法直接提供答案的声学任务。在三个声学类别中,⽂本系统的得分为3.23―26.92,VoiceMem达到45.16―53.84。

准确率、token和时延

在LoCoMo上:

  • VoiceMem在K=5时取得91.2分;
  • 只使⽤430个记忆token;
  • 检索耗时134毫秒。

对⽐中最强的基线EverMemOS需要检索Top-10,使⽤1899个token,得分为83.13。

也就是说,VoiceMem的记忆token⽤量仅为EverMemOS的约23%,同时得分⾼出约8.1分。

⏩ 给谁⽤?

  • 做语⾳Agent、数字⼈或陪伴机器⼈的团队:希望系统能够在⻓期交互中持续认识⽤⼾;
  • 做全双⼯语⾳交互的开发者:需要在严格时延预算下接⼊记忆能⼒;
  • 做智能硬件或多说话⼈系统的团队:需要保存声纹、环境声⾳和副语⾔信息;
  • 做Agent Memory研究的开发者:希望在Mem0、LangMem或Zep等后端之上增加更精确的组织与路由机制。

VoiceMem把记忆层与底层搜索引擎解耦,开发者可以替换记忆后端,也可以把记忆结果接⼊⾃⼰的语⾳模型。

⏩ 写在最后

VoiceMem并不试图直接回答“AI何时会成为Being”。

它做的是更具体的⼀步:把“记忆必须跟上实时交互”从⼀个抽象设想,推进成可以实现、评测和持续优化的⼯程问题。

如果说实时交互让Digital Being能够出现在⼈⾯前,那么记忆决定了它下⼀次出现时,还是不是“同⼀个它”。

⏩ 作者介绍

论文第一作者为谢之非,尾作及通讯作者为颜水成。

谢之非现为南洋理工大学LV-Lab博士生,研究聚焦实时音视频交互。第一作者研究成果获超600次引用,其相关开源项目已累计获得8.5K+ GitHub Stars,曾主导首个端到端语音对话模型 Mini-Omni 系列,FFASR leaderboard rank-1 的Mega-ASR全场景语音识别等项目。

颜水成现任新加坡国立大学计算机学院杰出教授,曾任Sea集团首席科学家,是新加坡工程院院士及AAAI、ACM、IEEE和IAPR会士,连续十年入选全球高被引科学家。其Google Scholar总引用超过13.6万次,曾提出Network In Network(NIN)架构,并采用全局平均池化替代传统全连接层。

从Mini-Omni解决端到端实时语音对话,到Audio-Reasoner和Audio Interaction Model推进音频推理与主动交互,再到VoiceMem补上长期记忆,这项工作延续了他围绕实时语音Agent,逐步完善感知、推理、交互与记忆能力的研究路线。