想让AI真正理解物理世界,仅靠海量视频远远不够——就像学游泳不能只看录像,必须亲自下水。MirroS团队最新发布AgentGarten,将可执行代码与神经渲染器打通:代码定义物理规则,模型实时渲染画面,智能体持续与物理世界交互,在试错中积累经验,效率远高于纯视频路线。
从2500万局到第4轮:智能体自我博弈学会策略
团队重做了经典捉迷藏实验。与OpenAI 2019年研究需要2500万局强化学习才能涌现掩体搭建行为不同,AgentGarten中的智能体在第4轮就学会了搬挡板搭掩体;第10轮掌握借坡道翻墙。这一飞跃来自智能体自己写的「实验手册」——每轮结束后复盘尝试、记录发现并指导下一轮策略。团队还在空间导航、物体操控、运镜重拍、多车竞速四个不同世界中各运行四轮,均能快速收敛到有效策略。
对抗训练+算子优化:480p分辨率30fps稳定交互
为解决流式生成中误差累积问题,团队引入Adversarial Forcing对抗训练方法,并手写Triton融合算子,配合CUDA Graph消除调度开销,最终以480p分辨率、30fps以上的吞吐稳定支撑闭环交互。
代码+渲染+手册:Physical RSI路线开源
AgentGarten已开源,代码与技术报告均已公开。这是MirroS探索Physical RSI(物理世界的递归自我改进)路线的一次开源实践。
四个世界里的四轮收敛记录
除了捉迷藏,团队还在另外四个世界各跑四轮。陪伴小狗场景里,得分从第 1 轮的 13 分涨到第 4 轮的 19 分;单车道会车任务中,两车错车总耗时从 71 秒压到 41 秒;合作牧羊任务从第 1 轮超时只圈进三只,到后三轮稳定做到一只不漏;采石场装载机任务在 360 秒时限内提前 31 秒跑通推石、送料、入库全流程。
相关阅读:星动纪元VPP2登顶RoboDojo:仿真32.26%/真机58.5%,清华系具身智能超越GPT-6-Astra
延伸阅读
- 诺因智能半年融 5 轮、累计破 10 亿元:京东领投1 周前
- 因果智能机器人0.2秒急停:UCSD团队让机器人理解物理因果11 小时前
- 正行创新发布零售具身智能方案:人形机器人H1亮相,2027年商业化1 天前
- 宇树机器人公司资本狂飙:注册资本从10万增至2510万,增幅250倍5 天前
AI 自学笔记 每天更新 AI 前沿动态,订阅 RSS,或按 Ctrl/⌘+D 收藏本站,明天见。
