MirroS开源AgentGarten:代码+神经渲染,让智能体在物理世界边玩边学

想让AI真正理解物理世界,仅靠海量视频远远不够——就像学游泳不能只看录像,必须亲自下水。MirroS团队最新发布AgentGarten,将可执行代码与神经渲染器打通:代码定义物理规则,模型实时渲染画面,智能体持续与物理世界交互,在试错中积累经验,效率远高于纯视频路线。

从2500万局到第4轮:智能体自我博弈学会策略

团队重做了经典捉迷藏实验。与OpenAI 2019年研究需要2500万局强化学习才能涌现掩体搭建行为不同,AgentGarten中的智能体在第4轮就学会了搬挡板搭掩体;第10轮掌握借坡道翻墙。这一飞跃来自智能体自己写的「实验手册」——每轮结束后复盘尝试、记录发现并指导下一轮策略。团队还在空间导航、物体操控、运镜重拍、多车竞速四个不同世界中各运行四轮,均能快速收敛到有效策略。

对抗训练+算子优化:480p分辨率30fps稳定交互

为解决流式生成中误差累积问题,团队引入Adversarial Forcing对抗训练方法,并手写Triton融合算子,配合CUDA Graph消除调度开销,最终以480p分辨率、30fps以上的吞吐稳定支撑闭环交互。

代码+渲染+手册:Physical RSI路线开源

AgentGarten已开源,代码与技术报告均已公开。这是MirroS探索Physical RSI(物理世界的递归自我改进)路线的一次开源实践。

四个世界里的四轮收敛记录

除了捉迷藏,团队还在另外四个世界各跑四轮。陪伴小狗场景里,得分从第 1 轮的 13 分涨到第 4 轮的 19 分;单车道会车任务中,两车错车总耗时从 71 秒压到 41 秒;合作牧羊任务从第 1 轮超时只圈进三只,到后三轮稳定做到一只不漏;采石场装载机任务在 360 秒时限内提前 31 秒跑通推石、送料、入库全流程。

相关阅读:星动纪元VPP2登顶RoboDojo:仿真32.26%/真机58.5%,清华系具身智能超越GPT-6-Astra