Agent Memory Architecture 白皮书拆解 5 层智能体记忆架构,Token 消耗最高降 90%

AYi · @AYi_AInotes · X·2026-09-15 20:12·15小时前
AI 导读

一份 13 页的 Agent Memory Architecture 白皮书把可学习、能自愈的智能体拆成 5 层:工作记忆(上下文窗口)、情景记忆(带时间戳日志)、语义记忆(知识图谱)、程序记忆(固化成功路径为可重用 Skill)和遗忘引擎(修剪矛盾数据)。

AYi@AYi_AInotes
63AI 编辑部评分,满分 100

Agent Memory Architecture 白皮书拆解 5 层智能体记忆架构,Token 消耗最高降 90%

2026-09-15 20:12· 15小时前
AI 导读

一份 13 页的 Agent Memory Architecture 白皮书把可学习、能自愈的智能体拆成 5 层:工作记忆(上下文窗口)、情景记忆(带时间戳日志)、语义记忆(知识图谱)、程序记忆(固化成功路径为可重用 Skill)和遗忘引擎(修剪矛盾数据)。

Anthropic 的 这个13 页 Agent 记忆白皮书有点牛逼啊,是今年我看过对「智能体记忆工程」拆解得最通透、最值钱的一份生产级手册:

很多做 Agent 的人死都想不明白:为什么自己的机器人越跑越蠢、矛盾百出? 因为你的 Agent 从来不会遗忘, 读懂这套把大模型调用成本砍掉 90% 的 5 层记忆金字塔,你才会看清工业级 Agent 的生死线在哪里:

它开篇第一句就直击所有开发者的灵魂痛点: 大模型这两年聪明了 10 倍,但缺乏记忆的 Agent,每天都在你的代码库里重演《土拨鼠之日》—— 每天早上重新读一遍同样的 12 个文件、重新踩一遍昨天的坑、再向你收取一模一样的 Token 账单!

手册把能学习、能自愈的 Agent,严格拆成了 5 个物理层级:

• Layer 1【工作记忆(Working Memory)· 上下文窗口】: 模型当前这一瞬间看到的全部信息。90% 的玩具 Agent 止步于此,一旦填满就从头硬性截断,把最初的任务目标和关键决策直接切碎丢掉,然后纳闷为什么系统又崩溃了; • Layer 2【情景记忆(Episodic Memory)· 发生了什么】: 带时间戳的完整交互流水日志。当工作记忆溢出时,关键事件下沉到这里。它会清楚记得“周二凌晨 3 点脚本报错是因为第 42 行有个拼写错误”,防止在同一个坑里跌倒两次; • Layer 3【语义记忆(Semantic Memory)· 什么是客观事实】: 从日志中提纯出来的知识图谱与实体关系。比如“该用户偏好 TypeScript”、“生产数据库禁止直接写入”。即使会话关闭,这些跨会话事实也永远不会过期; • Layer 4【程序记忆(Procedural Memory)· 怎么把事情做成】: 这是 Agent 产生“技能复利”的核心!它尝试了 3 种报错解法,最后发现第 3 种行得通——系统自动将这次成功路径固化为一个可重用的 Skill 脚本。下次遇到类似任务,跳过所有试错,直接调用最优解; • Layer 5【最反直觉的一层:遗忘引擎(Forgetting Engine)· 什么时候该删】: 从不遗忘的 Agent,最终一定会精神分裂! 旧偏好会和新指令激烈冲突(用户早就搬家了,它还在执着地推荐前东家楼下的外卖)。没有定期的垃圾修剪与矛盾消解,上下文只会演变成不可维护的毒瘤。

这笔账在工程上极其惊人: 实测引入这套架构后,Mem0 的单次查询 Token 消耗从 26,000 个断崖式暴降至 1,800 个(账单直接砍掉 90%),延迟压低 91%; Snowflake 加上语义实体层后,不仅准确率飙升 20%,工具调用轮次更是暴减 39%。

别再去无脑迷信更大的上下文窗口了。 没有分层沉淀和遗忘机制,给你 1000 万 Token 也只是买了一个更昂贵的失忆黑盒; 把记忆做成可检索、可进化、可修剪的工程资产,你的 Agent 才算真正拥有了灵魂。