DreamRSI:Google用历史做梦降低探索调用,最高降162倍

TL;DR

Google DeepMind与马里兰大学联合提出了DreamRSI方法,通过将历史探索记录转化为离线回放模拟器,让AI在历史数据中做梦来筛选候选探索策略。长程任务的探索调用开销最高降低162倍,算法工程任务从51200次调用降至317次。该方法已发布在arXiv(2609.14858)。

为什么要做梦

训练AI模型解决复杂长程任务时,判断一套新探索策略到底好不好成本极高:不能只看某一步的结果,而要让AI完整跑完一整轮才能评估。传统做法要么依赖固定策略浪费算力,要么在线反复试错,成本难以承受。

DreamRSI的核心洞察是:AI公司积累的探索历史——每一次尝试、每一次失败、每一个结果——本身就是一座零成本的经验回放世界模拟器,不需要重新运行底层Agent和评估器。

三阶段闭环架构

第一阶段:在线探索

探索策略引导发现Agent执行任务,评估器对结果打分并给出诊断反馈。每次探索结束后,留下的是一棵结构化的发现树——每个节点记录了AI写了什么代码、跑出什么结果、得了多少分。

第二阶段:构建回放模拟器

将历史发现树转换为离线回放模拟器M(T)。新策略在这棵树上模拟如果当初选择另一条路会怎样——所有执行结果早已存在历史日志里,回放一条新轨迹只需O(1)字典查表,零GPU算力消耗。

第三阶段:离线做梦优化策略

候选探索策略在回放模拟器中评估,以极低成本筛选出最优调度算法,再将升级后的策略重新部署到在线探索阶段,形成自我改进闭环。

实验结果

任务领域 基线方法 DreamRSI效果 调用量降幅
Lasso算法工程 SimpleTES(51200次调用) 317次调用达可合并标准 162倍
数学优化(自相关不等式) SimpleTES(51200代) 1000代以内追平或超越 50倍以上
GPU内核工程(KernelBench) 固定探索基线 1.79-2.43倍更少代数达目标速度 最高2.09倍性能提升

方法亮点:不做提示词工程

论文还发现一个反直觉结论:人类精心设计的高层次语义指导(Semantic Guidance)非但没有帮助,反而会诱发过早语义偏见,扼杀AI搜索的多样性。DreamRSI不依赖提示词工程,也不微调底层模型权重,而是通过离线模拟器实现策略层面的自我进化。

FAQ

Q: DreamRSI和传统强化学习有什么区别?
A: 传统RL需要在线反复试错来评估策略好坏,成本极高。DreamRSI将历史探索转化为离线回放模拟器,评估新策略不需要任何GPU调用,成本降为零。

Q: 162倍调用量降低具体是什么意思?
A: Lasso任务中,基线方法SimpleTES需要51200次Agent调用才能找到有效解,DreamRSI只需317次,降低约162倍,同时解的质量相当或更优。

Q: 这个方法适用哪些场景?
A: 适用于算法工程(如Lasso正则化求解器)、数学优化(如不等式证明)、GPU内核工程等需要大量探索试错的长程任务。