卧槽,Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸,奇点要来了吗!?
以前让 Agent 去探索一个复杂的算法或 GPU 算子,每试错一次就要花几十美分、还要等编译跑分,钱包根本扛不住。 谷歌 Dream-RSI 的思路变了:它让模型在过去的历史日志里做梦,用极低成本试完几千种打法,选出最好的再上线实测。
早上好好看了下,发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重, 他们终于找到了一种办法,把调用大模型做探索的成本直接打掉了最高 162 倍。 对正在做代码智能体、自动科研和算法优化的人来说,这篇论文给出了一个极度清醒的工程底座。 它的思路非常克制,一共踩实了三步: 1️⃣ 冻结模型权重,只改战术打法 科幻小说里的自进化,往往是让模型自己改自己的底层代码或权重,结果往往是灾难性遗忘和幻觉暴增; 谷歌第一步就把安全阀焊死了:底层的大模型完全固定不动,它只负责干活; 自我改进的对象,是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。 2️⃣ 把历史残局做成做梦模拟器 这是全篇最聪明的一步。 以前让 Agent 探索长链条任务,最昂贵的是每一步都要真机运行、在线打分; Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树; 这棵树就是环境模拟器,系统可以在离线状态下疯狂做梦,把成千上万种新的探索打法放在历史数据上快速过一遍, 既不需要重新调用大模型生成一遍内容,也不用重复去跑耗时的编译器。 3️⃣ 用历史教训筛选出最佳策略再实战 在沙盒里挑选出得分最高的探索策略后,才把它装载到下一轮真实的业务环境里; 在数学优化、算法设计和 GPU 内核优化的测试中,它不仅拿到了持平甚至更好的方案, 还把在线调用大模型的次数砍到了原本的几十分之一,特定测试下甚至减少了 162 倍。 但看这篇论文必须看清它的取信边界: 这种自我进化之所以成立,是因为算法和 GPU 代码有着极其冷酷的判定器,能不能编译、运行速度快了多少,物理世界会给出绝对确定的分数; 如果换成写文章、做设计等没有客观真理裁判的场景,做梦机制会瞬间退化成自我陶醉的幻觉堆叠。 真正的智能化突破,往往不是靠盲目堆算力去穷举试错; 模型的能力可以固定,但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致, 这套把经典强化学习移植进 Agent 系统的框架,给很多被高昂 API 账单卡住的团队,指了一条极其实在的生路。