星动纪元VPP2登顶RoboDojo,真机58.5%超越GPT-6-Astra

星动纪元,一家脱胎于清华大学的国家高新技术企业,凭借自研的世界动作模型 VPP2,在全球具身智能领域扔下了一颗深水炸弹。在香港大学 MMLab 主导的 RoboDojo 仿真榜单中,VPP2 综合平均成功率 32.26%、综合平均得分 39.26 分,双双超越 GPT-6-Astra、Physical Intelligence π0.5、英伟达 GR00T-N1.7 等全球头部具身模型。更关键的是,它在真实 ALOHA 双臂机器人上零样本迁移后实现了 58.5% 的成功率——这一数字比 π0.5 高出近 19 个百分点,标志着具身智能「仿真强≠真机强」的铁律正在被改写。

RoboDojo:具身智能的珠穆朗玛峰

RoboDojo 由香港大学 MMLab 牵头、全球近 20 所顶尖学术机构共同建设,是目前具身智能领域最接近真实物理世界复杂度的高仿真基准。测试覆盖 42 项双臂操作任务,从泛化能力、精准操作、长程任务、记忆、开放词汇指令理解五个维度对模型进行系统性评估。值得注意的是,VPP2 并未借助 Agent RSI 等外挂增强策略,也未额外扩充训练数据——这意味着它的领先来自模型本身的泛化能力,而非数据工程的堆砌。

仿真到真机:零样本迁移 58.5% 成功率

团队将 VPP2 部署到真实 ALOHA 双臂机器人,执行抓取、放置、堆叠、折叠、倾倒等 10 类零样本操作任务:平均成功率 58.5%,高于 π0.5 的 40%,且在 10 类任务中拿下 9 类最佳成绩。具体对比中,VPP2 在 RoboDojo 仿真中领先 GPT-6-Astra 达 9.78 个百分点(32.26% vs 22.48%),差距在真实物理世界进一步扩大。

技术路线:视频预测优先,解耦式训练破局

VPP2 的核心突破在于将视频预测能力先练到足够强,再让机器人在陌生环境里真正动起来。这一解耦式训练路线解决了传统世界动作模型(WAM)「视频预测漂亮但动作执行差」的老大难问题。业内评价认为,该路线意味着 VPP2 的基座足够泛化,无需靠数据扩充「刷分」。随着具身智能从仿真向真实物理世界加速落地,VPP2 的技术路径为行业提供了一条可参考的工程化方向。

竞争格局:清华系为何能在具身赛道突围

具身智能领域此前由 Physical Intelligence(π0.5)、英伟达(GR00T-N1.7)、OpenAI(GPT-6-Astra)等头部玩家主导,星动纪元作为清华嫡系创业公司,路径与众不同:与小米 MiMo-V2.6 的端侧 Agent 路线、B站 Index-Translate 的多语言模型路线异曲同工,星动纪元选择了高仿真到真机迁移这一最难的垂直路径。其背后反映的趋势是:中国具身智能正在从跟随走向局部引领。

关键数据对比表

模型 机构 RoboDojo仿真成功率 RoboDojo仿真得分 真机零样本成功率 数据增强
VPP2 星动纪元 32.26% 39.26分 58.5% 否
GPT-6-Astra OpenAI 22.48% — — —
π0.5 Physical Intelligence — — 40% —
GR00T-N1.7 英伟达 — — — —

VPP2 在仿真榜单和真机验证两个维度同时取得领先,这在具身智能领域尚属首次。随着 RoboDojo 基准的影响力扩大,VPP2 的评测方法论本身也可能成为行业新标准。

FAQ

星动纪元 VPP2 是什么?

VPP2(Vision-Language-Policy v2)是星动纪元自研的世界动作模型,核心架构基于视频预测优先的解耦式训练路线,旨在让机器人在陌生环境中实现零样本泛化的物理操作能力。

RoboDojo 榜单是什么水平的评测?

RoboDojo 由香港大学 MMLab 牵头、全球近 20 所顶尖学术机构共建,是目前最具影响力的具身智能高仿真基准,包含 42 项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆和开放词汇指令理解五个维度。

58.5% 的真机成功率意味着什么?

在 ALOHA 双臂机器人上实现 58.5% 的零样本成功率,意味着 VPP2 将仿真世界学到的泛化能力有效迁移到了真实物理世界——比当前最有力的竞品 Physical Intelligence π0.5 高出约 19 个百分点,是具身智能从仿真到真实场景落地的重要里程碑。

相关阅读

三阶段训练:先把事件级预测学扎实

公开路线显示,VPP2 的训练被拆成三段。第一阶段做事件级视频继续预训练,让模型学会预测一次完整操作从开始到结束的变化,而不是只猜接下来几帧;第二阶段做固定时长视频后训练与蒸馏,让预测速度跟得上机器人实时执行的节奏;第三阶段才训练动作专家,把视频预测转成具体动作,同时尽量保住前两阶段攒下的泛化能力。

基座用的是阿里开源的 Wan2.1-I2V-14B,训练数据混了机器人操作、人类活动与通用视频,覆盖不同机器人本体与操作方式。团队还会把操作过程切成语义完整的片段再配详细描述,避免出现同一句模糊指令对应无数种动作轨迹的问题。

同场对比里还有一个容易被忽略的数字。在后训练评测口径下,GPT-6-Astra 的平均成功率是 22.48%、平均得分 28.97 分,VPP2 则是 32.26% 与 39.26 分。两个指标口径不同,成功率看任务有没有完整跑完,得分看没能跑完时能推进到哪一步,两项都领先说明它面对做不完的任务也能停在更靠前的中间状态。

相关阅读:MirroS开源AgentGarten:代码+神经渲染,让智能体在物理世界边玩边学

相关阅读:星动纪元VPP2登顶RoboDojo:综合得分39.26分超越GPT-6-Astra