9月10日,宇树科技正式宣布开源新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,代码、模型、数据集同步开放。参数量 6B,基于 UnifoLM-ER-Flow 多模态主干网络搭配 MMDiT 动作专家模块,训练使用约 2500 小时高质量真机数据与 500 万 + ER 训练样本。
核心架构
UnifoLM-WLA-1.0 架构包含两层:
- UnifoLM-ER-1:多模态具身推理主干,基于 Qwen3-VL-4B 构建,使用超过 500 万个具身推理样本训练,涵盖图像点预测、目标检测、多图像推理、二维/三维轨迹预测、空间问答等任务
- UnifoLM-ER-Flow:在 ER-1 基础上引入离散动作标记和掩码标记,通过统一动作空间(末端执行器姿态、关节、下肢)联合对齐视觉、语言和动作表示
- MMDiT 动作专家:负责动作生成,与多模态主干协同
真机表现:单模型 64 项任务
评测在宇树 G1 人形机器人上完成,单模型统筹 64 项任务(54 项桌面操作 + 10 项全身移动操作),覆盖倒垃圾、铺床、整理厨房浴室、叠衣服、收纳餐盘等日常场景。
最关键的是——该模型不绑定单一末端执行器,平行夹爪与两类灵巧手均能驱动,实现跨末端执行器泛化。
性能对比
在 16 项多模态感知与理解基准测试中,UnifoLM-ER-1 在 7 项中领先开源模型,整体性能达到与领先专有模型相当的水平。
重要说明:资源尚待全部上线
宇树官方使用「完全开源」表述,但截至 9 月 11 日官方项目页面显示:Code / Models / Datasets 均为 Coming soon,资源尚未全部开放下载。准确状态为「已宣布开源、资源待开放」。
