解读 Google DeepMind Dream-RSI 论文:冻结权重、离线筛选探索策略,模型调用最多减少 162 倍

AYi · @AYi_AInotes · X·2026-09-17 09:48·1小时前
AI 导读

作者解读 Google DeepMind 的 Dream-RSI 论文:冻结大模型权重不动,只自我改进指导搜索、回溯和分支选择的探索策略,并把历史轨迹存成历史树作为离线模拟器低成本试错。在数学优化、算法设计和 GPU 内核优化任务上取得持平或更好的结果,在线调用大模型次数最多减少 162 倍;作者同时指出该方法依赖可客观判定的任务,写文章、做设计等无客观裁判的场景不适用。

AYi@AYi_AInotes
55AI 编辑部评分,满分 100

解读 Google DeepMind Dream-RSI 论文:冻结权重、离线筛选探索策略,模型调用最多减少 162 倍

2026-09-17 09:48· 1小时前
AI 导读

作者解读 Google DeepMind 的 Dream-RSI 论文:冻结大模型权重不动,只自我改进指导搜索、回溯和分支选择的探索策略,并把历史轨迹存成历史树作为离线模拟器低成本试错。在数学优化、算法设计和 GPU 内核优化任务上取得持平或更好的结果,在线调用大模型次数最多减少 162 倍;作者同时指出该方法依赖可客观判定的任务,写文章、做设计等无客观裁判的场景不适用。

卧槽,Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸,奇点要来了吗!?

以前让 Agent 去探索一个复杂的算法或 GPU 算子,每试错一次就要花几十美分、还要等编译跑分,钱包根本扛不住。
谷歌 Dream-RSI 的思路变了:它让模型在过去的历史日志里做梦,用极低成本试完几千种打法,选出最好的再上线实测。

早上好好看了下,发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重,
他们终于找到了一种办法,把调用大模型做探索的成本直接打掉了最高 162 倍。 对正在做代码智能体、自动科研和算法优化的人来说,这篇论文给出了一个极度清醒的工程底座。
它的思路非常克制,一共踩实了三步: 1️⃣ 冻结模型权重,只改战术打法
科幻小说里的自进化,往往是让模型自己改自己的底层代码或权重,结果往往是灾难性遗忘和幻觉暴增;
谷歌第一步就把安全阀焊死了:底层的大模型完全固定不动,它只负责干活;
自我改进的对象,是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。 2️⃣ 把历史残局做成做梦模拟器
这是全篇最聪明的一步。
以前让 Agent 探索长链条任务,最昂贵的是每一步都要真机运行、在线打分;
Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树;
这棵树就是环境模拟器,系统可以在离线状态下疯狂做梦,把成千上万种新的探索打法放在历史数据上快速过一遍,
既不需要重新调用大模型生成一遍内容,也不用重复去跑耗时的编译器。 3️⃣ 用历史教训筛选出最佳策略再实战
在沙盒里挑选出得分最高的探索策略后,才把它装载到下一轮真实的业务环境里;
在数学优化、算法设计和 GPU 内核优化的测试中,它不仅拿到了持平甚至更好的方案,
还把在线调用大模型的次数砍到了原本的几十分之一,特定测试下甚至减少了 162 倍。 但看这篇论文必须看清它的取信边界:
这种自我进化之所以成立,是因为算法和 GPU 代码有着极其冷酷的判定器,能不能编译、运行速度快了多少,物理世界会给出绝对确定的分数;
如果换成写文章、做设计等没有客观真理裁判的场景,做梦机制会瞬间退化成自我陶醉的幻觉堆叠。 真正的智能化突破,往往不是靠盲目堆算力去穷举试错;
模型的能力可以固定,但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致,
这套把经典强化学习移植进 Agent 系统的框架,给很多被高昂 API 账单卡住的团队,指了一条极其实在的生路。