# 解读 Google DeepMind Dream-RSI 论文：冻结权重、离线筛选探索策略，模型调用最多减少 162 倍

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-17 09:48
- AIHOT 分数：55
- AIHOT 链接：https://aihot.news/items/cmu4w67iv0ahcrokckjcprsdf
- 原文链接：https://x.com/AYi_AInotes/status/2100401558009598018

## AI 摘要

作者解读 Google DeepMind 的 Dream-RSI 论文：冻结大模型权重不动，只自我改进指导搜索、回溯和分支选择的探索策略，并把历史轨迹存成历史树作为离线模拟器低成本试错。在数学优化、算法设计和 GPU 内核优化任务上取得持平或更好的结果，在线调用大模型次数最多减少 162 倍；作者同时指出该方法依赖可客观判定的任务，写文章、做设计等无客观裁判的场景不适用。

## 正文

卧槽，Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸，奇点要来了吗！？

以前让 Agent 去探索一个复杂的算法或 GPU 算子，每试错一次就要花几十美分、还要等编译跑分，钱包根本扛不住。 谷歌 Dream-RSI 的思路变了：它让模型在过去的历史日志里做梦，用极低成本试完几千种打法，选出最好的再上线实测。

早上好好看了下，发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重， 他们终于找到了一种办法，把调用大模型做探索的成本直接打掉了最高 162 倍。
对正在做代码智能体、自动科研和算法优化的人来说，这篇论文给出了一个极度清醒的工程底座。 它的思路非常克制，一共踩实了三步：
1️⃣ 冻结模型权重，只改战术打法 科幻小说里的自进化，往往是让模型自己改自己的底层代码或权重，结果往往是灾难性遗忘和幻觉暴增； 谷歌第一步就把安全阀焊死了：底层的大模型完全固定不动，它只负责干活； 自我改进的对象，是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。
2️⃣ 把历史残局做成做梦模拟器 这是全篇最聪明的一步。 以前让 Agent 探索长链条任务，最昂贵的是每一步都要真机运行、在线打分； Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树； 这棵树就是环境模拟器，系统可以在离线状态下疯狂做梦，把成千上万种新的探索打法放在历史数据上快速过一遍， 既不需要重新调用大模型生成一遍内容，也不用重复去跑耗时的编译器。
3️⃣ 用历史教训筛选出最佳策略再实战 在沙盒里挑选出得分最高的探索策略后，才把它装载到下一轮真实的业务环境里； 在数学优化、算法设计和 GPU 内核优化的测试中，它不仅拿到了持平甚至更好的方案， 还把在线调用大模型的次数砍到了原本的几十分之一，特定测试下甚至减少了 162 倍。
但看这篇论文必须看清它的取信边界： 这种自我进化之所以成立，是因为算法和 GPU 代码有着极其冷酷的判定器，能不能编译、运行速度快了多少，物理世界会给出绝对确定的分数； 如果换成写文章、做设计等没有客观真理裁判的场景，做梦机制会瞬间退化成自我陶醉的幻觉堆叠。
真正的智能化突破，往往不是靠盲目堆算力去穷举试错； 模型的能力可以固定，但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致， 这套把经典强化学习移植进 Agent 系统的框架，给很多被高昂 API 账单卡住的团队，指了一条极其实在的生路。
