FLUX 3 Action 开源机器人模型发布:7B参数登顶RoboLab基准

Black Forest Labs(BFL)于9月23日发布 FLUX 3 Action——一个70亿参数的开源「世界动作模型」(World Action Model),能根据摄像头画面、机械臂状态和文本指令预测下一步动作,并同步生成未来场景视频。这是 FLUX 3 多模态底座发布以来首个开源权重版本。BFL 宣称该模型在 NVIDIA RoboLab-120 仿真基准上创下成功率纪录,参数规模不到此前最佳开源模型的一半,推理速度快至3.95倍。

什么是 FLUX 3 Action

FLUX 3 Action 是一个流匹配(flow-matching)模型,将文本、最近视频和机械臂状态转为 token 后联合去噪「未来视频」和「下一个动作」,而非传统的「视觉语言模型+动作头」分立结构。这种联合预测让模型在执行动作前就能模拟场景变化,减少试错成本。

该模型基于 FLUX 3 多模态底座训练——95%以上的预训练数据为视频,另有少量图像和音频。随后的「动作中间训练」阶段混合了游戏画面、第一视角人类手部视频、带夹爪的遥控操作数据,来自14种不同机械臂形态。BFL 数据显示,SO-101 机械臂仅用约200条遥控演示就学会了抓取放置任务。

模型 参数量 RoboLab-120成功率 推理速度(vs Cosmos3-Nano)
FLUX 3 Action 7B 42.92% 3.95x faster
Cosmos3-Nano(NVIDIA) 12B+ 36.8% baseline
OASIS WAM(闭合模型) — 39.0% —
π0.5 — 28.0% —

发布内容一览

权重文件托管于 Hugging Face 的 FLUX 3 Action 集合,遵循 FLUX Kommunity License v1.0;训练和推理代码在 GitHub 仓库(Apache-2.0)开源。发布内容包括:

  • 共享基础检查点:含视频 VAE 和 Qwen3-VL-4B-Instruct 文本编码器
  • 预制策略:DROID 配置(Franka 臂+三摄像头)和低成本 SO-101 臂(通过 Hugging Face LeRobot 框架用 LoRA 微调)
  • 三种推理配方(各含 BF16 和 FP8 版本):基础模型(4步采样+引导)、引导蒸馏版、单步蒸馏版(单步推理)

模型卡明确禁止用于「在无人监督情况下以危害人员的方式控制机器」。

真实机械臂测试结果

BFL 委托 Positronic Robotics 对 Franka 机械臂进行盲测:10项 DROID 任务,每项3次尝试,240秒上限。FLUX 3 Action 完成30次中的28次;Cosmos3-Nano 完成27次,DreamZero 20次,π0.5 仅13次。两者在简单拾放任务上基本持平,差异主要体现在模型规模和速度上。

BFL 还在游戏、无人机、控制软件等数字场景展示了微调版本。BFL 观点是:「能玩游戏体的智能体距离操控其他软件只差一小步」。

与推理模型配合:快策略+慢规划

大推理模型(如 OpenAI Astra)规划能力强,但速度慢、成本高。BFL 测试显示:单独使用 Astra 每次成功成本约13.47美元、耗时16分钟;让 Astra 只在必要时介入,日常控制交由 FLUX 3 Action 处理,成功率保持90%的同时成本降至8.77美元、耗时约8分钟,比最优替代方案便宜29%、快40%。

这种「快速策略模型+慢速规划模型」的组合预计是此类系统在实际部署中的主流用法。

当前局限性

BFL 坦诚表示:「仍有一些任务是所有策略(包括自家的)无法独立解决的」。基准测试成绩由 BFL 自行提供,NVIDIA 公开排行榜尚未更新。真实机械臂测试也仅覆盖简单拾放任务。不过开源权重意味着这些结果现在都可以被独立验证。

小结

FLUX 3 Action 的发布再次证明视频生成模型是机械臂控制的强力底座。对研究者而言,关键吸引力在于:7B 开源模型可在单卡运行、有低成本爱好者机械臂的 LeRobot 配方、微调代码完全公开。相比排行榜上多数方案,这些条件让独立复现的门槛低得多。结合大推理模型的规划能力,FLUX 3 Action 有望成为机器人物的大脑+小脑组合中的「小脑」角色。


新闻来源:NYU Shanghai RITS – Black Forest Labs Releases FLUX 3 Action