零、写在前面
多次刷到这个作者宣传自己 ICML 2026 的这个工作,个人认为写作上比较一般,读第一遍读的云里雾里的,而且他这个行文结构以及配图总给我一种 ai 的感觉。
特别是配图,synth 打成了 sguth,这显然是ai吧。。。
本文这个方法套了个重整化群的壳,然后扯了一堆理论,但其实只是基于经典的层级化memory,然后又把用户表示拆成了长期稳定趋势和近期事实,那么低层次的细粒度memory向上合并需要达到阈值才能触发。这相比很多memory工作直接让 llm 做 abstract 要合理的多。
其实方法本身是比较合理的,效果也能想象到应该不错,但是这个写作确实让人看着有点难受。
一、标题

受重整化群启发的 language Agent 记忆演化
Q:什么是重整化群?
A:
考虑一张像素画:
- 微观视角(Scale 0): 靠近看的时候,看到的只是红、蓝、绿的色块,很乱
- 粗粒化(Scale 1): 退后一步,视野里的每 4 个小色块(2x2)合并成 1 个稍大的色块,颜色取这 4 个点的“平均值”。然后噪点看起来就少了一点
- 宏观视角(Scale N): 距离不断拉远,小色块不断合并成大色块。最后,那些局部的、随机的噪点全部被“平均”掉了,而画面的核心特征变得无比清晰和稳定。
在物理学中,微观的原子都在随机乱动(充满噪音),但通过这种一层层合并、平均、放大的“重整化”过程,物理学家就能忽略微观的混乱,提取出物体在宏观下的稳定性质。
那么我们把物理学里的 “原子” 替换成 “用户和 Agent 的每一句聊天记录”。
在长期交互中,Agent 每天都在收集大量的微观数据(对话记录)。现有的 Agent 记忆(比如普通的 RAG 检索)通常是把所有聊天记录塞进一个大数据库里。这会遇到致命问题:一个偶然性的事实直接改变了用户偏好。
作者通过 重整化群 来做类比:
- 微观事实(原子): 你今天对 Agent 说“我今天好累,想吃炸鸡”,明天说“我被老板骂了”,后天说“我想学 Python”。这些是非常具体、易变、甚至互相矛盾的“微观噪音”。
- 粗粒化(记忆重整): 如果 Agent 把你的所有聊天记录平等对待,它会精神分裂。所以它需要“重整化”——当关于“学习”的微观对话积累到一定程度时,它把这些对话合并,提取出一个中观的“近期目标:提升技能”。
- 宏观画像(宏观物理量): 随着时间推移,中观的目标再次被合并、提炼。最后,Agent 的记忆顶层会形成一个极其稳定的宏观特征:“该用户是一个有进取心、抗压能力弱、偏爱高热量食物的程序员”。
这个工作关注 stability-plasticity dilemma(稳定性-可塑性困境):
- 稳定性:用户偶尔一句“今天不想运动”,Agent 不能马上忘记其长期运动习惯。
- 可塑性:若用户明确说“我背部受伤,未来一段时间只能做康复训练”,Agent 又不能机械地继续推荐高强度训练。
普通 RAG 往往偏向“最近、最像 query 的文本”;普通递归总结又可能把大量历史平均掉。RGMem 的目标是同时保留:长期主趋势、近期明确变化与支持两者的具体事件。
二、摘要
2.1 省流
作者认为,长期个性化 Agent 的关键问题不是单纯上下文不够长,而是:历史对话会无限增长,用户状态又会变化,系统必须区分快变的局部信号与慢变的长期特质。

为此,RGMem 将对话依次转成:
原始对话
-> L0:事件级事实与用户结论
-> L1:关系级规律、概念级 trait
-> L2:按问题从不同尺度取回证据
其关键动作是 hierarchical coarse-graining(分层粗粒化):丢掉对当前问题不重要的细枝末节,但不把真正的冲突硬平均掉。
摘要里面也总结了这篇工作的三个贡献:
-
用多尺度记忆描述长期用户画像:事件、关系、抽象 trait 分层存在。
-
用阈值触发更新:证据未积累到一定程度,不轻易重写长期画像。
-
用
(Σ, Δ)同时保留主趋势与张力,避免递归总结把近期重要变化“磨平”。Sigma (
Σ):主趋势、长期稳定模式Delta (
Δ):重要例外、冲突、限制
三、引言
3.1 现有工作的不足
论文把现有长期记忆的常见问题归为三类:
| 常见方式 | 它擅长什么 | 长期个性化中的问题 |
|---|---|---|
| Full Context | 信息都在 prompt 中 | 成本高,且长上下文仍可能出现 Lost in the Middle |
| Flat RAG / 向量检索 | 快速找相似片段 | 容易受关键词、语义相似度和 recency bias(近因偏差)支配 |
| 定期摘要 | 压缩历史 | 容易把“长期规律”和“近期例外”混成一句模糊总结 |
例如用户过去经常去健身房,但近期说自己受伤、需要康复。一个只看最近文本的系统可能忘了用户长期目标;一个只看长期摘要的系统又可能无视康复限制。作者认为,问题来自不同时间尺度的信息被放进同一层记忆里竞争。
3.2 记忆的多尺度视角
作者将对话记忆分为三种尺度:
- 微观(micro):具体事件,如“周三去跑了 5 公里”。
- 中观(meso):反复出现的关系或模式,如“跑步常被用户当作减压手段”。
- 宏观(macro):长期用户特质,如“重视健康与自我管理”。
重要的不是简单“分三层存储”,而是规定信息如何向上流动:低层发生的单次波动,不应自动改动高层 trait;只有同类证据足够密集,才应该触发更高层更新。
3.3 论文的四个设计直觉

作者在引言中把自己的论点总结为:
- 通过分层抽象提高有效信息密度,而非不断塞更多 context。
- 用户画像更新不是线性、每轮都发生的,而应由证据阈值触发。
- 把慢变量 trait 与快变量事件分开,可以缓解稳定性-可塑性冲突。
- 真正稳定的不是每一条事实,而是跨多个场景反复出现的宏观行为规律。
四、相关工作
4.1 Parametric Memory
**Parametric Memory(参数记忆)**指通过继续训练、LoRA 或 adapter,把新知识写入模型权重。
- 优点:知识像“练熟的技能”一样内化,推理时不一定需要外部检索。
- 缺点:更新成本高,可能发生 catastrophic forgetting(灾难性遗忘),对闭源模型和多用户画像也不方便。
RGMem 不改 LLM 参数,属于外部、显式的 token-level memory。
4.2 Explicit Memory / RAG
**Explicit Memory(显式记忆)**是将用户事实、摘要或历史片段写到数据库,查询时再取回。Mem0、LangMem、Zep 等系统大多属于这一方向。
作者的批评是:若只靠 flat retrieval(平铺检索),系统常能回答“上次去了哪里”,却难以形成“这个人长期偏好什么、现在是否真的变了”的跨会话判断。
4.3 Hierarchical Memory
MemoryOS、NEMORI 等工作已经有分层或 episodic-semantic 结构。RGMem 的差异在于,它特别强调:
- 高层抽象不应按固定时间间隔重写;
- 需要显式的证据密度阈值;
- 高层不仅要存一个平均结论,还要保留与主结论不一致但重要的残差。
因此它更像是对“记忆如何演化”提出机制,而不只是增加一种存储层级。
五、方法

这篇工作把记忆组织成层次化的图结构,然后更新的话不是线性的更新,而是:
- 证据稀少或噪声状态:高层画像基本不动;
- 一致/冲突证据积累过阈值:关系与 trait 发生较快的结构性重组。
5.1 L0:微观证据不是原始聊天记录
原始对话先由规则 $f_{seg}$ 切成 episode,再用 LLM 的 $f_{synth}$ 生成一个微观记忆单元:
$$ D = (\lambda_{fact}, \Lambda_{conc}) $$- $\lambda_{fact}$:objective fact(客观事件事实),如“用户预订了夏季去伦敦的机票”。
- $\Lambda_{conc}$:user-centric conclusions(面向用户的结论),如“用户正在规划伦敦文化旅行”。
后者又分为普通基础结论与高相关结论,后者可成为上层抽象的种子。
值得注意的是,这一步已经混入 LLM 推断,因此不是无误的“事实数据库”。论文的防线是后续必须有重复证据才能向上升级,而不是单次抽取就写成 trait。
5.2 L1:建立带固定坐标的三层知识图
作者从 L0 中抽实体和关系,构建动态图 G=(V,E):
- $V_{inst}$:instance events(实例事件),如“周三跑步 5 公里”。
- $V_{gen}$:general events(一般事件),如“跑步是一种常见减压活动”。
- $V_{abs}$:abstract concepts(抽象概念),如“健康与 wellness”。
- $E_{evt}$:动态事件关系,会随对话新增。
- $E_{cls}$:静态分类关系,规定概念的父子层级。
实现里抽象层不是完全自由生长的:用户实体需要连到 11 个预定义基础概念之一,例如 Health and Wellness、Goals and Plans、Values and Beliefs、Work and Study。这相当于给用户画像一个“固定坐标系”。
好处:减少长期聚类后概念漂移。
代价:开放世界的新型身份、亚文化偏好或领域概念可能被硬塞进不合适的格子。
5.3 RK1:关系归纳,先等证据重复
Relation Inference Operator(关系归纳算子)RK1 将同一关系的多条微观证据整合为关系级总结。直觉是:
旧的关系总结 + 新的同类证据 -> 更新后的关系总结
论文中只有当某关系的提及/证据累计达到 theta_inf = 3 时,RK1 才触发。比如用户一次提到瑜伽,不足以写成长期偏好;如果不同会话中反复提及瑜伽用于放松,才形成较稳定的关系级描述。
这是 RGMem 对抗“每轮更新一次”的第一道门。
5.4 RK2:概念抽象,拆成主趋势 Sigma 与张力 Delta


Node-level Abstraction Operator(节点级抽象算子)RK2 负责把一个抽象概念下的关系总结和新事件,压缩为:
(Sigma, Delta) = RK2(相关关系总结, 新事件, 旧画像)
假设主题节点是:
Health and Wellness
这个主题下已经有一些 RK1 形成的关系级总结:
关系 1:用户长期规律进行力量训练。
关系 2:用户常用运动缓解压力。
关系 3:用户持续记录体重和睡眠。
同时,刚来了新的微观事件:
新事件:用户背部受伤,医生建议近期进行康复训练。
这些一起就是 RK2 的输入。
第一步:P,Projection-Selection
Projection-Selection(投影选择),即 从一堆证据里挑出最能代表这个主题的内容。
它会更偏向已经被 RK1 验证过的关系级总结,因为它们有重复证据支持;但不会完全忽略新的高重要性事件。
在上面的例子中,RK2 会保留:
长期力量训练
运动用于减压
持续健康追踪
近期背伤康复
而不把“某天买了一双跑鞋”这种弱细节放到高层画像里。
第二步:S,Synthesis-Rescaling
Synthesis-Rescaling(综合重标度),即 让 LLM 把选出来的证据重新写成一个更高层、更短、更稳定的用户画像。
但它要求输出不是一个普通摘要,而是两个部分:
(Sigma, Delta)
Sigma:长期主趋势
Sigma:
用户长期重视健康管理,保持规律运动,
并将运动视为压力调节方式。
它只吸收反复出现、跨场景稳定成立的信息。
Delta:重要张力或例外
Delta:
用户当前处于背伤康复阶段;
近期运动建议应避免高强度力量训练。
它保存的是:
- 与长期主趋势不完全一致的信息;
- 近期限制;
- 正在发生但尚不能写成长期 trait 的变化;
- 可能改变未来画像的信号。
RK2的操作也需要当抽象节点累计分数达到某个阈值(论文中theta_sum = 6)才执行。
5.5 RK3:把局部变化逐级上传

Hierarchical Flow Operator(层级流算子)RK3 将子概念的 (Sigma, Delta) 汇总给父概念,继续寻找共同主趋势和保留关键残差。
RK3 使用 dirty flag(脏标记):只有下层节点真的变化,才通知父节点更新。
5.6 L2:多尺度检索不是只搜一个向量库
面对 query,系统先让 LLM 拆成面向实体的子查询,并判断要找什么层级:
history:具体发生过什么,回到事件/事实层。conclusions:用户当时表达了什么结论,找 L0 用户结论。inference:为什么或有什么关系,找中层关系。summary:总体倾向是什么,找高层概念 trait。
实现的固定检索预算为:
-
BM25 检索 Top-5 事实
lambda_fact; -
BM25 检索 Top-30 用户结论
Lambda_conc; -
余弦相似度阈值 0.5 下,选最多 3 个抽象实体的 summary;
-
将多尺度结果直接拼成统一 context,不再做一次额外摘要。
如果刚检出的 Delta 又被一个通用总结器压平,前面的冲突保留就白做了。
六、实验
6.1 测试集
论文在两个互补任务上测试:
-
LoCoMo:10 段超长对话,每段约 600 轮、26K token,考单跳、多跳、开放域与时间推理;用 gpt-4.1 作为 LLM judge。
是否能找对历史
-
PersonaMem(128K 设置):最多 60 个会话,侧重动态 persona、偏好变化与新旧信息冲突;采用多选题 accuracy。
是否能在变化中维护人物模型
6.2 主结果
在 PersonaMem 上:

GPT-4o-minibackbone:RGMem 平均 63.87%,较第二名高 7.08 点;Latest Preference为 75.47%。GPT-4.1backbone:RGMem 平均 74.01%,较第二名高 8.98 点;Latest Preference为 85.07%。
在 LoCoMo 上:

gpt-4.1-minibackbone:RGMem 总分 86.17%,高于 Zep 的 79.09%,也接近 Full Context 的 87.52%。- 其时间推理为 88.91%,多跳推理为 78.03%,显示中层关系抽象对跨片段整合有帮助。
这些结果支持了论文最重要的 claim:在用户偏好演化和时间冲突任务中,分层、阈值化更新确实优于纯平铺检索。
6.3 消融:每一层是否真的有用?
LoCoMo 的 gpt-4.1-mini 消融结果:
| 变体 | 去掉什么 | 总分 | 平均检索 token |
|---|---|---|---|
w/o L0 |
事件级事实层 | 56.29 | 1,885 |
w/o L1 |
关系级抽象层 | 79.88 | 2,068 |
w/o RG |
阈值化、多尺度演化,改为单尺度更新 | 82.17 | 4,354 |
| 完整 RGMem | 全部机制 | 86.17 | 3,788 |
- 少了 L0,抽象没有可靠证据地基,所有题型都明显掉;
- 少了 L1,尤其多跳与时间推理受损,说明事实不能直接跳到人格 trait;
- 少了 RG,虽然塞入更多 token,效果仍不如完整系统,说明提升并非只来自“看得更多”。
6.4 消融:为什么一定要有 Delta?
在 PersonaMem 的 20% 子集上,作者比较:
| 聚合机制 | Latest Preference |
|---|---|
| 单一总结,去掉 Delta | 52.58% |
保留 (Sigma, Delta) |
74.11% |
如果只输出一个“平均画像”,突发但重要的状态变化会被历史多数投票淹没;显式保留张力项能显著改善“最新偏好”判断。
不过也要注意:该结果只在 20% 子集上报告,且 Delta 由 LLM 文本抽取。它证明“不要只存单一摘要”很有说服力,但尚不足以证明 Delta 是最优或严格可靠的冲突表示。
6.5 阈值与成本
作者报告 theta_inf = 3 时性能最好。对 PersonaMem 20% 子集:
| 更新策略 | 输入 token(k) | 输出 token(k) | 准确率 |
|---|---|---|---|
| 每次观察都更新 | 384.23 | 63.09 | 53.72% |
| 固定周期全局重写 | 237.76 | 39.87 | 48.95% |
| RGMem 阈值触发 | 295.17 | 52.62 | 65.32% |

完整 PersonaMem 成本表中,RGMem 总输入约 1,421.79k token、输出约 240.33k token、约 978.54 次 API 调用,并不便宜;只是与 Mem0 的同设置总量接近,且低于 A-Mem、MemoryOS 的部分开销。
分层演化没有额外造成灾难性成本,并以相近成本换来更高准确率。低成本不是这个工作的卖点。
七、结论
RGMem 提出一套有明确立场的长期画像更新原则:
事实应快速写入;关系应在重复证据下归纳;人格 trait 应缓慢更新;重要例外不能被多数历史压平。
它用 L0-L2、RK1-RK3、阈值和 (Sigma, Delta) 将这套原则落成了一个可运行的外部记忆框架,在 LoCoMo 与 PersonaMem 上取得了有竞争力的结果。
但其实原文一直在强调重整化群那个故事,然后方法部分也各种符号描述,显得很复杂,个人感觉没什么必要,ai的嫌疑比较大。

说些什么吧!