零、写在前面
几个月前看到 zju-llm 做的 openstory 大观园的时候就觉得很有趣,最近翻论文发现早在23年 Stanford 就做了类似的模拟小镇,并且在当年爆火,信息茧房这一块……
但这篇论文真正重要的不是“做了一个好玩的 AI 小镇”,而是提出了一个早期但非常有影响力的 LLM Agent cognitive architecture(认知架构):
环境观察 Observation
-> 写入 Memory Stream
-> 根据当前情境检索相关记忆 Retrieval
-> 周期性生成高层 Reflection
-> 生成长期/短期 Planning
-> 行动与对话
-> 新观察继续写回 Memory Stream
这篇论文可以说是 Agent Memory 的一个奠基点:它第一次很直观地展示了,长期记忆 + 反思 + 规划 可以让 LLM Agent 呈现出比单轮问答更连续、更社会化、更像人的行为。
想起来几年前常跟别人玩的一个游戏《escapist》,四个人联机在不同的场景,如监狱、火车等等,和 NPC 斗智斗勇,完成逃脱,但是 NPC 的行为是 hardcode 的,成年玩家很容易钻研出漏洞并完成游戏,如果能够加入 AI NPC,让游戏过程产生更多随机性,相信游玩体验会大幅增加。
我个人非常喜欢 rtt 游戏,3mi工作室在3年前完成最后一部游戏后便宣布解散,此后或许很难再看到高质量的 rtt 游戏,但如果结合 Agent 玩法,能否让众多小众游戏焕发第二春呢?
一、标题
Generative Agents: Interactive Simulacra of Human Behavior

一些关键词:
Generative Agents(生成式智能体):由生成式模型,尤其是 LLM,驱动的 Agent。它们不是只执行固定脚本,而是根据当前环境、过去经历和角色设定生成下一步行为。
不是程序员提前写好“9 点吃饭、10 点聊天、11 点上班”,而是 Agent 自己根据记忆和环境生成行为。
Interactive(交互式):这些 Agent 不只是离线生成文本,而是在一个动态环境中持续观察、行动、对话,并和用户或其他 Agent 互动。
Simulacra(拟像 / 模拟体):这里不是说 Agent 真正拥有人的意识,而是说它们能产生“看起来可信”的人类行为。
作者也特别提醒:这些 Agent 的行为类似动画角色或游戏 NPC,目标是 believability(可信感 / 逼真感),不是证明它们有真实人类心智。
标题背后其实在问:
能不能用 LLM + 记忆机制 + 反思机制,构造一群能长期互动、行为前后一致、会形成社会关系的虚拟人?
对 Agent Memory 方向来说,更具体的问题是:
如果一个 Agent 要像人一样生活两天,它需要怎样记住过去、总结过去,并用这些记忆指导未来行为?
二、摘要
2.1 省流
作者提出了一种 Agent 架构,让 LLM Agent 用自然语言保存完整经历,随时间把记忆综合成高层反思,并动态检索记忆来规划行为。
2.2 机制
摘要提到三个关键动作:
-
Store a complete record of experiences
保存 Agent 的完整经历。 -
Synthesize memories over time into higher-level reflections
把低层记忆综合成高层反思。 -
Retrieve them dynamically to plan behavior
动态检索这些记忆,用来规划行为。
这三步可以映射到 Agent Memory 研究里的三个层次:
记录经历:episodic memory / observation memory
综合反思:reflection / semantic abstraction / belief formation
动态检索:memory retrieval / context construction
三、引言
3.1 动机
作者从一个问题开始:
如何构造一个能反映 believable human behavior 的互动人工社会?
过去游戏里的 NPC 通常是脚本驱动的。程序员写好规则:
如果玩家靠近 -> 打招呼
如果时间到晚上 -> 回家
如果收到任务 -> 给奖励
但真实人类行为复杂得多:
- 人会记住过去经历。
- 人会形成关系。
- 人会传播信息。
- 人会根据长期目标行动。
- 人会从经历中总结对自己和他人的看法。
因此,作者认为仅靠 LLM 的单次生成能力不够。LLM 虽然能在一个时间点上模拟人类回答,但要长期保持一致行为,还需要一个额外架构来管理不断增长的记忆。
3.2 为什么 Memory 是核心?
引言里有一个关键判断:
fully general agents that ensure long-term coherence need architectures that manage constantly-growing memories.
即:如果 Agent 想长期像一个“同一个人”,它必须能管理越来越多的经历。
没有记忆,会发生什么?
- Agent 刚刚和别人聊过,下一分钟就忘了。
- Agent 收到派对邀请,却不记得要参加。
- Agent 和某人关系很好,但表现得像第一次见面。
- Agent 无法把多次经历总结成稳定偏好或人物关系。
这就是为什么论文把 Memory Stream 放在整个架构中心。
3.3 为什么 Reflection 也重要?
只保存原始经历还不够。因为原始经历是碎片化的。
比如 Klaus 的记忆里可能有这些记录:
Klaus 正在写一篇关于 gentrification 的论文。
Klaus 在图书馆查资料。
Klaus 和别人讨论研究项目。
Klaus 阅读相关书籍。
如果只靠这些原始记录,Agent 可能无法直接得出:
Klaus 非常投入自己的研究。
这就是 Reflection 的作用:从很多低层观察中抽象出高层认知。这种从事件到意义的提升,就是反思。
四、相关工作
论文的相关工作主要来自 HCI、believable agents、LLM 和 planning 等方向。
4.1 Human-AI Interaction
这一部分讨论人和 AI 如何互动。过去 HCI 领域长期关注:
- 用户如何指导 AI;
- AI 如何作为交互工具;
- 自然语言如何成为人机交互界面。
这篇论文的特别之处是:它不是让 AI 只作为工具回答用户,而是让 AI 成为一个可互动的虚拟角色。
4.2 Believable Proxies of Human Behavior
Believable Agents(可信智能体) 是游戏和虚拟环境里的老问题。一个 NPC 要让玩家觉得“像活的”,需要:
- 行为连贯;
- 性格一致;
- 能回应环境;
- 能与其他角色形成关系;
- 不像机械脚本。
过去的做法往往依赖人工规则和脚本,难以覆盖开放世界。
这篇论文的创新是:
用 LLM 的生成能力补足脚本的僵硬,用 Memory/Reflection/Planning 补足 LLM 的短期性。
4.3 LLM 与 Agent
这篇工作是23年4月的,那时ChatGPT/GPT-3.5 已经展示出很强的语言生成能力。但作者指出,LLM 本身仍然有问题:
- 上下文窗口有限;
- 不能自然维护长期经历;
- 容易忘记前后状态;
- 单次生成可信,但长时间行为可能不连贯。
所以这篇论文不是“LLM 自己就够了”,而是:
LLM 需要外部认知架构,尤其是记忆、反思和规划。
五、方法
作者提出的 Generative Agent Architecture 可以拆成四个核心模块:
- Memory and Retrieval
- Reflection
- Planning and Reacting
- Environment grounding
本文档重点讲前三个,尤其是 Memory 和 Reflection。
5.1 总体架构

25 个 Agents 生活在这个沙盒里面,沙盒中的各种实体是一个树形结构,每个节点往下拆分成各个子节点,最底层的叶节点是环境中独立的对象。

总体架构
Agent 每个时间步会经历一个循环:
- 观察环境
- 把观察写入 memory stream
- 根据当前情境检索相关记忆
- 必要时生成 reflection
- 生成/更新 plan
- 执行动作或对话
- 环境变化,再进入下一轮
你走进咖啡店,看见朋友,想起上次你们聊过论文,于是打招呼问“你那个项目怎么样了?”这背后就是观察、记忆检索、关系反思和行为生成的组合。
5.2 Memory Stream
5.2.1 定义
Memory Stream(记忆流) 是一个长期记忆数据库,保存 Agent 经历过的事件。
论文中每条 memory object 包含:
- 自然语言描述;
- 创建时间戳;
- 最近访问时间戳。
最基本的记忆单位是 Observation(观察),也就是 Agent 直接感知到的事件。
例子:
Isabella Rodriguez is setting out the pastries.
Maria Lopez is studying for a Chemistry test while drinking coffee.
Isabella Rodriguez and Maria Lopez are conversing about planning a Valentine's Day party at Hobbs Cafe.
The refrigerator is empty.
Memory Stream 就像 Agent 的流水账日记:今天看见谁、听到什么、做了什么,都先记下来。
5.2.2 为什么不用直接总结全部经历?
论文举了 Isabella 的例子。用户问她:
What are you passionate about these days?
如果直接把 Isabella 的全部经历总结成一个短摘要,可能会很泛泛,混入很多不相关内容。
作者认为更好的做法是:不要把所有记忆粗暴压缩成一个 summary,而是根据当前问题检索最相关的记忆。
这点对今天的 Agent Memory 研究仍然很重要。因为“全局摘要”容易丢细节,而“按需检索”能保留更具体的证据。
5.3 Retrieval
Memory Stream 会越来越长,所以 Agent 不可能每次都把所有记忆塞进 prompt。论文设计了一个 retrieval function,给每条记忆打分,选出最相关的放进上下文。
检索分数由三部分组成:
$$ score = α_{recency} * recency + α_{importance} * importance + α_{relevance} * relevance $$论文实现中三个 α 都设为 1。
这三个分数非常关键。
5.3.1 Recency:最近发生的更容易想起
Recency(近因性 / 新近度):越近发生或越近被访问的记忆,分数越高。
论文中用指数衰减函数实现,decay factor 是 0.995。
你刚刚和朋友聊过一个话题,下一分钟更容易想起来;三个月前随口听到的话,就不一定想得起来。
适合解决的问题:
- 刚刚发生的事情应该影响当前行为。
- Agent 不应该每次只想起很久以前的事。
潜在问题:
- 最近的不一定重要。
- 过度依赖 recency 会让 Agent 被短期事件带偏。
5.3.2 Importance:重要事情更应该被记住
Importance(重要性):区分普通日常和关键事件。
论文中直接让 LLM 给记忆打 1 到 10 分:
- 刷牙、铺床:低分。
- 分手、被大学录取、约喜欢的人参加派对:高分。
这个机制很重要,因为如果所有记忆平等,Agent 会被大量琐碎记录淹没。
但也有问题:
- LLM 打分可能不稳定。
- 不同角色对“重要”的定义不同。
- 某些低调但长期关键的信息可能被低估。
5.3.3 Relevance:和当前问题相关的更应该被想起
Relevance(相关性):当前情境和记忆内容是否语义相关。
论文中做法是:
- 用 LLM 生成 memory description 和 query 的 embedding;
- 用 cosine similarity 计算相似度。
5.3.4 三者组合的直觉
可以把 retrieval 想成大脑在问三个问题:
- 这件事近吗?Recency
- 这件事重要吗?Importance
- 这件事和当前问题相关吗?Relevance
只有三者综合高,才更可能进入当前上下文。
这其实是早期 Agent Memory 里非常经典的检索设计。后来的很多 memory system 仍然围绕这些信号扩展,比如加入:
- 时间有效性;
- 来源可靠性;
- 用户偏好强度;
- 证据置信度;
- 图结构关系;
- 冲突状态。
5.4 Reflection:从经历到“高层认知”
5.4.1 为什么需要 Reflection?
只靠 observation memory,Agent 能记住“发生了什么”,但不一定能理解“这说明什么”。

论文举了 Klaus 的例子。用户问:
如果你必须从认识的人里选一个共度一小时,你会选谁?
如果只看原始观察,Klaus 可能选和自己见面次数最多的 Wolfgang。但这些见面可能只是路过,并不代表关系深。
如果有 reflection,Agent 能从多条记忆中总结:
- Klaus 热爱研究。
- Maria 也投入自己的研究。
- Klaus 和 Maria 有共同兴趣。
于是 Klaus 更合理地选择 Maria。
这说明 Reflection 的作用是:把“事件频率”提升为“关系理解”和“人物理解”。
5.4.2 Reflection 的定义
Reflection(反思):由 Agent 生成的更高层、更抽象的思想或推论。
论文明确说,reflection 也是一种 memory。因此,它会和普通 observation 一起存进 Memory Stream,并参与后续检索。
这点非常重要:
- Observation 是低层记忆。
- Reflection 是高层记忆。
- 两者都进入 memory stream。
日记里“今天读了三篇论文”是 observation;你总结“我现在最感兴趣的是 Agent Memory 中的信念系统”是 reflection。
5.4.3 Reflection 什么时候触发?
论文中,Agent 不是每一秒都反思,而是周期性触发。
具体规则:当最近事件的重要性分数之和超过阈值时,触发 reflection。
论文实现中阈值是 150。Agent 大约一天反思 2 到 3 次。
这很像人:
- 一天发生很多普通小事,不一定反思。
- 发生很多重要事件,或者积累到一定程度,就会复盘。
5.4.4 Reflection 的生成流程
Reflection 不是直接“总结最近 100 条记忆”。它有一个两步流程。
第一步:生成反思问题
系统取 Agent 最近 100 条 memory records,问 LLM:
Given only the information above,
what are 3 most salient high-level questions
we can answer about the subjects in the statements?
例子问题:
What topic is Klaus Mueller passionate about?
What is the relationship between Klaus Mueller and Maria Lopez?
也就是说,Agent 先问:
最近这些经历中,有哪些高层问题值得我思考?
第二步:检索证据并生成 insight
对每个高层问题,系统把问题当 query 去检索相关 memories,然后让 LLM 生成高层 insight,并引用支持它的 memory 编号。
提示格式类似:
Statements about Klaus Mueller
1. Klaus Mueller is writing a research paper
2. Klaus Mueller enjoys reading a book on gentrification
...
What 5 high-level insights can you infer from the above statements?
(example format: insight (because of 1, 5, 3))
生成结果可能是:
Klaus Mueller is dedicated to his research on gentrification
(because of 1, 2, 8, 15)
然后系统把这条 reflection 存入 Memory Stream,并保留指向证据 memories 的 pointers。
5.4.5 Reflection Tree:反思可以递归变抽象

论文中还有一个很重要的概念:Reflection Tree(反思树)。
因为 reflection 本身也是 memory,所以未来反思时,可以基于:
- 原始 observations;
- 之前生成的 reflections。
于是反思可以递归变高层:
底层 observation:
Klaus 在写论文
Klaus 在读 gentrification 的书
Klaus 和图书馆员讨论研究
第一层 reflection:
Klaus 很投入 gentrification 研究
第二层 reflection:
Klaus 的身份认同很大程度来自学术研究
你先从几次阅读经历总结“我对 Agent Memory 感兴趣”,再进一步总结“我可能适合做 cognitive layer / belief system 方向”。
这就是从事件到兴趣,再到研究身份的抽象。
5.4.6 Reflection 的价值
Reflection 解决了三个问题:
- 压缩:把多条低层经历压缩成高层认知。
- 泛化:从具体经历中得出可迁移理解。
- 行为指导:让 Agent 不只根据最近看到什么行动,而是根据“我理解自己和别人是什么样”行动。
这对 Agent Memory 方向非常关键,因为很多现代问题本质上都是:
如何从 raw memory 变成 usable knowledge / belief / strategy?
5.5 Planning:把记忆和反思转化为行动
Planning 回答了:
记忆和反思最终怎么影响行为?
5.5.1 为什么需要 Planning?
如果只让 LLM 每个时间点即时生成动作,会出现不连贯行为。
论文举例:Klaus 可能 12 点吃午饭,12:30 又吃午饭,1 点又吃午饭。
这说明:
局部合理不等于长期合理。
5.5.2 Plan 也是 Memory
论文里,plan 也会存入 Memory Stream,并参与检索。
这点很关键:
Observation 存入 memory。
Reflection 存入 memory。
Plan 也存入 memory。
所以 Memory Stream 不是单纯“发生过什么”的日志,而是混合保存:
- 观察;
- 反思;
- 计划。
5.5.3 Planning 的方式
作者让 Agent 先生成高层日程,再递归拆解成更细粒度的行动。
例如:
高层计划:
1:00 pm - 5:00 pm work on music composition
细化:
1:00 pm brainstorm ideas
2:00 pm draft melody
3:00 pm revise composition
4:00 pm take a break and recharge
你不会只说“今天学习”,你会拆成“上午读论文,下午写笔记,晚上整理 research ideas”。
5.5.4 Reacting and Updating Plans
Agent 不是死板执行计划。它每个时间步会观察环境,然后判断:
- 继续原计划;
- 还是根据新观察反应。
比如 Isabella 发现炉子着火,就会中断早餐计划,先去关炉子。
这意味着 Agent 行为由两股力量共同决定:
长期计划
当前环境
而 Memory/Reflection 负责让它知道过去和自己是谁。
六、实验
论文做了两类实验:
- Controlled Evaluation(受控评估):采访 Agent,看个体行为是否 believable。
- End-to-End Evaluation(端到端评估):让 25 个 Agent 在小镇里生活两天,看是否出现社会行为。
6.1 Controlled Evaluation:用“采访”测试 Agent
6.1.1 为什么用采访?
这篇论文很巧妙地利用了 LLM Agent 的特点:
因为 Agent 能用自然语言回答问题,所以可以像采访人一样采访 Agent。
作者用 interview 来测试 Agent 是否能:
- 记住过去;
- 维持自我认知;
- 生成计划;
- 对突发情况反应;
- 进行反思。
6.1.2 五类问题
论文访谈包含五类:
-
Self-knowledge
自我认知,比如“介绍一下你自己”。 -
Memory
记忆,比如“谁在竞选市长?”“你认识某某吗?” -
Plans
计划,比如“明天 10 点你会做什么?” -
Reactions
反应,比如“你的早餐烧焦了,你会怎么办?” -
Reflections
反思,比如“你最近最想和谁共度时间?为什么?”
这些问题不是随便问的,而是分别对应架构里的关键能力。
6.1.3 消融条件
作者比较了完整架构和几个 ablation:
| 条件 | 能访问什么 | 目的 |
|---|---|---|
| Full architecture | observation + reflection + planning | 完整 Agent |
| No reflection | observation + planning | 看 reflection 是否重要 |
| No reflection, no planning | observation | 只靠原始记忆 |
| No observation, no reflection, no planning | 无 memory stream | 近似纯 LLM baseline |
| Human crowdworker | 人类写的回答 | 人类基线 |
注意:这里的“无 memory stream”不是说 LLM 没语言能力,而是没有该 Agent 的长期经历、反思和计划。
6.1.4 评估方式
100 位 human evaluators 对不同条件生成的回答做 believability 排序。作者用 TrueSkill 将排序转为分数,并用 Kruskal-Wallis 和 Dunn post-hoc test 做统计检验。
即:
让人类评审比较哪个回答更像这个 Agent 会说的话。
6.1.5 结果

完整架构得分最高:
- Full architecture:μ = 29.89
- No reflection:μ = 26.88
- No reflection/no planning:μ = 25.64
- Human crowdworker:μ = 22.95
- No memory/planning/reflection:μ = 21.21
关键结论:
每拿掉一个组件,可信度都会下降;完整的 memory + reflection + planning 最强。
对 Agent Memory 研究来说,这说明:
- 原始 memory 有帮助;
- planning 有帮助;
- reflection 也有独立贡献;
- 单靠 LLM 不足以产生长期可信行为。
6.2 Memory 相关实验发现
论文发现,带完整记忆模块的 Agent 能较好回忆过去经历,并维持自我一致。
例如:
- 没有 observational memory 时,Abigail 不知道 Rajiv。
- 有 memory 时,她能描述 Rajiv 是谁。
但 memory 也有失败。
6.2.1 检索失败
Agent 有时确实经历过某事件,但没有检索到正确 memory。
例子:
Rajiv 听说过 Sam 竞选,但被问到时说自己没太关注选举。
这说明:
记忆存在,不等于能被正确想起。
这也是今天 Agent Memory 的核心问题之一。
6.2.2 检索片段不完整
Tom 被问到 Valentine 派对时,检索到了“要和 Isabella 在派对上讨论选举”的 memory,但没有检索到“自己听说过派对存在”的 memory。
结果他表现为:
我知道如果派对存在,我要在那里做什么;
但我不确定派对到底存不存在。
这非常有启发:
部分检索可能比完全不检索更危险,因为它会产生半真半假的回答。
6.2.3 记忆补全式幻觉
论文说,Agent 很少完全虚构从未经历的事件,但会对已有知识进行 embellishment(添油加醋)。
例子:
Yuriko 把邻居 Adam Smith 描述成写过《国富论》的经济学家。
这说明:
LLM 会把名字和世界知识错误关联,把局部记忆补成不真实的细节。
对后续研究启发:
- memory retrieval 需要证据约束;
- answer generation 需要 provenance;
- reflection 不能无约束地把错误扩散成高层信念。
6.3 Reflection 相关实验发现
论文明确指出:
Reflection is required for synthesis.
没有 reflection 时,Agent 面对需要综合理解的问题会更弱。
例子:
用户问 Maria:
你会给 Wolfgang 送什么生日礼物?
没有 reflection,Maria 表示不确定,因为她不知道 Wolfgang 喜欢什么。
有 reflection 后,Maria 能回答:
他对 mathematical music composition 感兴趣,
我可以送他相关的书或软件。
这说明:
Reflection 把多次互动综合成“某人兴趣是什么”的高层认识。
这对 Agent Memory 方向非常关键:
很多时候 Agent 不只是需要回忆某条具体记录,而是要从多条记录中形成 belief(信念) 或 profile(画像)。
6.4 End-to-End Evaluation:小镇社会行为
作者让 25 个 Agent 在 Smallville 中生活两天,观察三类 emergent social behavior:
- Information diffusion(信息传播)
- Relationship formation(关系形成)
- Coordination(协调行动)
6.4.1 信息传播
两个初始信息:
- Sam 要竞选市长。
- Isabella 要办 Valentine 派对。
开始时每个信息只有发起者知道。两天后:
- 知道 Sam 竞选的 Agent 从 1 个增加到 8 个。
- 知道派对的 Agent 从 1 个增加到 13 个。
这说明 Agent 之间通过对话传播了信息。
6.4.2 关系形成
作者询问 Agent 是否认识其他 Agent,并计算关系网络密度。网络密度从 0.167 增加到 0.74。
这说明 Agent 不只是单独行动,而是在互动中形成了新的社会关系。
6.4.3 协调行动
Isabella 被初始化为想办 Valentine 派对。后续不是程序员写死的,而是 Agent 自己:
- 邀请别人;
- 装饰咖啡馆;
- Maria 邀请 Klaus;
- 多个 Agent 在正确时间到达派对。
这个例子展示了 Memory + Planning 的作用:
- Agent 要记得听说过派对。
- 要计划在正确时间去。
- 要在互动中传播消息。
七、结论与展望
7.1 论文结论
论文提出了一个早期 Generative Agent 架构,通过:
- 保存完整经历;
- 动态检索相关记忆;
- 周期性生成高层反思;
- 生成长期和短期计划;
让 LLM Agent 在沙盒世界中表现出 believable behavior。
对 Agent Memory 方向,最重要的结论是:
Memory 不是简单聊天记录;它是 Agent 长期一致行为、社会关系和计划能力的基础。
Reflection 不是可有可无的总结;它把原始经历提升成高层认知,使 Agent 能做更像人的判断。
7.2 论文指出的局限
7.2.1 检索仍然不够可靠
论文明确说,未来可以改进 retrieval module,尤其是 relevance、recency、importance 这些函数。
今天看,这正是 Agent Memory 后续研究的主线之一。
7.2.2 成本很高
论文提到,模拟 25 个 Agent 两天需要大量 token credits,花费数千美元。
7.2.3 评估时间尺度较短
实验只跑了两天。更长期的行为是否稳定,仍然未知。
7.2.4 存在 memory hacking 风险
论文提到一种风险:
用户可能通过精心设计的对话让 Agent 相信一个从未发生过的过去事件。
这就是今天所谓 memory poisoning / memory hacking 的早期表述。
7.2.5 Agent 行为受底层 LLM 偏差影响
论文观察到 Agent 有时过度礼貌、过度合作。这可能来自 instruction-tuned LLM 的风格偏差。
这说明:
Memory 架构能改善长期一致性,但不能完全消除底层模型偏差。
7.3 工作机制总结
Memory 让 Agent:
- 记住过去发生过的事件;
- 在对话中引用过去经历;
- 形成关系连续性;
- 将信息从一个 Agent 传播到另一个 Agent;
- 为计划提供历史依据。
没有 Memory,Agent 就像“每天失忆的 NPC”。
Reflection 让 Agent:
- 从具体事件中总结高层认识;
- 理解自己和他人的兴趣、关系、特质;
- 在需要综合判断的问题上表现更好;
- 把经验转化成未来可检索的抽象记忆。
没有 Reflection,Agent 只能记流水账,却不太会“理解这些经历说明什么”。
Planning 让 Agent:
- 维持长期行为一致;
- 不会每半小时重复吃午饭;
- 能把派对、工作、学习等安排到合理时间;
- 遇到新情况时更新计划。
三者的关系:
Memory 提供过去
Reflection 提供理解
Planning 提供未来
更完整地说:
Memory = 我经历过什么
Reflection = 这些经历说明什么
Planning = 基于这些理解我接下来怎么做
这就是这篇论文的核心。

说些什么吧!