铭鸿体育资讯网

解读下dream rsi论文 这篇论文是谷歌联合马里兰大学、弗吉尼亚大学和Google DeepMind在2026年9月中旬发布的研究《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》,核心是让AI Agent通过"做梦"实现递归自我改进,重点优化的是探索策略而非模型权重本身。 核心问题 当前AI自主科研 ​

解读下dream rsi论文

这篇论文是谷歌联合马里兰大学、弗吉尼亚大学和Google DeepMind在2026年9月中旬发布的研究《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》,核心是让AI Agent通过"做梦"实现递归自我改进,重点优化的是探索策略而非模型权重本身。

核心问题

当前AI自主科研系统(如AlphaEvolve)已经能跑"生成方案→执行实验→评估结果→修改方案"的发现循环,但存在一个致命瓶颈:探索策略是人工写死的。

- 哪个分支该多分配算力、哪个该剪掉、何时开并行,全靠工程师预设- 搜索空间扩大后,固定策略会把大量算力砸进死胡同,而且"不长记性"- 如果让策略在线自我进化,评估成本极高——每改一版策略都要重跑几百上千轮真实实验,等几天才出一个分数

核心洞察:历史就是模拟器

Dream-RSI的关键创新在于:把AI真实探索留下的历史记录变成一台可重放的模拟器。

每次在线探索会形成一棵结构化的发现树(Discovery Tree),每个节点记录了一次候选方案的完整现场——生成的代码、执行结果、评估分数、计算成本等。这棵树本身就是一个"回放世界":

- 换一套探索策略在这棵树上"重走一遍",直接读取已有节点的结果,无需重新调用模型、无需重新跑代码- 想试"这条路多走两步"就读取对应记录,想试"那条路早点放弃"就少读几个节点- 评估成本几乎为零,一次昂贵的真实探索可以支撑成千上万次低成本的策略评估

这就是论文所说的"做梦"(Dreaming)——在由历史构成的世界里,离线模拟不同策略的执行效果。

三阶段递归闭环

Dream-RSI的运行循环分为三个阶段:

1. 在线探索(Online Explore):当前探索策略引导Coding Agent在真实环境中运行,扩展发现树并保存完整轨迹2. 构建重放模拟器(Construct Replay Simulator):将新的发现树加入历史集合,形成持续扩大的模拟器池3. 基于做梦的策略改进(Dreaming-based Policy Improvement):一个专门的策略开发Agent在模拟器中"做梦",不断修改探索策略代码,产生大量候选策略并在模拟器上快速打分,选出最优者部署到下一轮在线探索

重要的是,底层模型(Gemini 3.1 Pro或3.7 Flash)权重完全不变,自我进化的对象只有顶层那段Python写的探索策略代码。

实验结果

论文在算法工程、数学优化和GPU内核工程三个领域进行了评估:

- Lasso正则化路径求解:Gemini 3.1 Pro + Dream-RSI仅用317次调用就将平均运行时间降至2931ms,优于固定策略的550次/3587ms;相比基线SimpleTES最多减少162倍Agent调用- 数学优化:在Sum-Difference、Circle Packing等问题上,1000代以内追平或超越基线;Auto Correlation问题中SimpleTES需51200代,Dream-RSI仅需1000代,节省50倍以上预算- GPU内核工程:VGG16和LayerNorm任务分别节省2.43倍和1.79倍生成次数达到同等性能;ConvDiv和ConvMax在同等预算下性能提升2.09倍和1.44倍

一个反直觉的发现

研究团队还做了一个有意思的对照实验:把历史经验总结成高层语义指导塞进Prompt里"手把手教"AI往哪走,结果加了指导的反而表现更差。

论文解释是:任何总结都是一种压缩,会丢失大量细节信息(在什么条件下失败、失败到什么程度、旁边还有哪些未尝试的分支等)。一旦抽象为高层原则,就转化为认知偏见,过度约束搜索空间,扼杀探索多样性,让AI困在局部最优。而Dream-RSI的"做梦"机制保留的是完整的过程记录,过去的失败不再是单纯的失败,而是一个可以被重新进入的空间。

总结与意义

Dream-RSI展示了一条不同于传统RSI想象的路径:不需要AI修改自己的权重或重新训练模型,仅仅通过优化"寻找知识的方法"就能实现能力跃升。

这本质上是将强化学习中"世界模型"的概念迁移到了LLM Agent的探索过程中——历史不再是静态的上下文或微调数据,而是一个动态的、可反复试验的沙盒环境。随着每轮真实探索不断扩展"梦境"的边界,探索策略也在持续迭代进化,形成"在线收集历史→离线重放评估→重新在线部署"的自改进飞轮。

当然,它也有局限:对于历史上从未到达过的区域,Dream-RSI无法凭空推演结果,仍需回到真实环境探索。但这条思路的意义在于——未来更强的AI未必每轮都需要一个更聪明的模型,它可能只是越来越擅长"记住自己走过的路,然后少走弯路"。

想继续深入哪个方向?

- 策略表示形式:python代码表示- 探索策略设计:Dream-RSI具体是怎么设计这个策略的,有哪些关键组件网页链接