GPT-6 Astra接宇树G1进厨房:一个周末学会整理抽屉、递药到家

一句话结论:斯坦福团队让GPT-6 Astra接上宇树G1人形机器人,让机器人在陌生厨房里自主探索环境、建立空间记忆、记住物品位置,再按语言指令完成取药、收拾台面等复杂多步任务,全程无需针对新环境重新训练。

HomeBody是什么:GPT-6 Astra接宇树G1进厨房

2026年9月30日,斯坦福团队发布项目HomeBody,首次让GPT-6 Astra与宇树科技G1人形机器人联动,在真实厨房场景中完成物品整理、取药递送等日常任务。与此前大模型控制机械臂的桌面抓放测试不同,这次机器人不只判断眼前抓什么,还得记住东西在哪,再把行走、抓取、放置连贯成串。

测试中,G1先自主探索一个从未见过的厨房,记录相机画面、激光雷达扫描和空间结构,然后根据用户一句「帮我把药拿来」,走到之前保存画面中的抽屉前,开抽屉、取药、递给人——即使药不在当前视野内。另一个任务要求它把咖啡袋归拢到岛台、丢掉指定纸盒,G1同样完成。

三步走:探索厨房 → 数字孪生 → 自主规划动作

HomeBody让机器人干活分三步走。

第一步,自主探索建地图。 机器人接到「探索这个空间」的指令后,Astra选择值得观察的位置,引导G1移动。机器人同时记录相机画面、激光雷达扫描和自身关节姿态,用SLAM同步定位建图。这些空间记忆不会随机器人转身消失,后续任务可随时调用。

第二步,Real2Sim构建数字厨房孪生。 Astra在Isaac Sim仿真平台里搭建数字厨房,将真实定位地图与数字模型对齐到同一坐标系,把相机画面、内容描述与对应位置关联。这样,之前保存的抽屉画面不仅记录「见过这个抽屉」,还对应一个可返回的三维坐标。

第三步,语言指令驱动多步任务。 用户给出「收拾厨房」类指令,Astra结合当前画面、地图、空间记忆和手里状态,自主选择导航、抓取、放置、开抽屉等技能,把任务一步步执行完。

System 2调用技能库:GPT做决策,技能模块管执行

HomeBody的核心架构可概括为「让GPT把机器人技能当工具调用」,Astra负责理解目标、安排步骤,再调用技能把任务做完。

整个系统有三层分工:System 2是视觉语言模型(VLM),负责看图、理解指令、决定做什么;System 1是技能模块,负责把动作规划出来;System 0是底层控制器,负责协调身体执行。HomeBody调整了中间这一环:让System 2直接调用技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过学习型VLA。

技能库里封装了Navigate(导航)、Pick(抓取)、Place(放置)、Open drawer(开抽屉)、Pick from drawer(从抽屉取物)等可复用技能,接口统一:大模型告诉它「去哪、抓什么、放到哪」,技能自己执行,执行完反馈结果给大模型。

以抓取为例,Astra只需在画面中点出目标物体、指定用左手还是右手。技能内部感知模块圈出物体、估计深度、计算抓取姿态,运动规划器规划机械臂路径,交给控制模块执行。换句话说,GPT决定抓哪个、用哪只手,技能模块解决手怎么伸过去、怎么抓起来。

不需要重新训练,为什么泛化到新厨房

HomeBody宣称部署到新厨房「不需要额外采集训练数据,也无须再训练专用动作策略」。这背后有两层含义。

第一,系统不用为每个新厨房重新训练一套专用动作策略。现成的感知模型、运动规划和预训练控制器(AMO控制策略)仍是机器人能把活干起来的基础。第二,省去了针对新环境的训练,但不代表整套系统从未训练过——感知、规划、技能执行都需要RTX 4090笔记本支撑,Astra在远端负责决策。

部署成本方面,前期重建数字厨房需要准备时间和API成本;实际执行任务时,模型推理也会让动作之间出现等待。长时间干活的另一个瓶颈在硬件侧:手指舵机过热是系统目前面临的限制之一。

技术细节与局限性

HomeBody运行在一台搭载RTX 4090的笔记本上,Astra在远端负责决策。具体配置:

  • 感知与规划:RTX 4090笔记本本地运行
  • 决策模型:GPT-6 Astra(远端API)
  • 机器人:宇树G1人形机器人
  • 仿真平台:Isaac Sim

局限性包括:动作间存在等待延迟、数字孪生重建有前期成本、手指舵机过热不适合长时间连续作业。把GPT接上宇树机器人确实能让机器人进厨房干活,但背后需要感知、规划、控制一整套系统配合。

维度 传统机械臂控制 HomeBody方案
控制对象 夹爪位置、朝向、开合 导航/抓取/放置/开抽屉等技能
决策模型 学习型VLA GPT-6 Astra直接调用技能库
新环境适配 需重新采集数据+训练 无需重新训练
算力需求 车载计算单元 RTX 4090笔记本+远端API
任务范围 桌面抓放 跨房间多步任务(取药、整理)

FAQ:常见问题

HomeBody与之前Robocurve的控制方式有什么核心区别?

Robocurve让GPT/Claude根据相机画面和机器人状态,通过工具调用指定夹爪的位置、朝向和开合状态,再由底层模块转换成具体动作。HomeBody交给GPT的是更完整的技能:导航、抓取、放置、开抽屉等,每个技能内部封装了感知、规划和执行,大模型只需决定「做什么」而不是「怎么做」。

为什么说「不需要重新训练」不等于系统从未训练过?

HomeBody不用为新厨房重新训练专用动作策略,但感知模型、运动规划和预训练控制器仍是机器人能把活干起来的基础。这些底层能力来自预训练,而非零基础涌现。省去的是针对特定新环境的训练,而非所有训练。

这个方案离实际家用还有多远?

主要瓶颈在硬件:手指舵机过热不适合长时间连续作业,RTX 4090笔记本的算力需求难以压缩到便携终端,数字孪生重建的前期成本也制约快速部署。技术路径已跑通,但工程化落地还需要时间。

小结

HomeBody代表大模型控制机器人从「桌面抓放」向「跨房间多步任务」的又一次边界扩展。GPT-6 Astra通过工具调用而非端到端动作生成的方式,让机器人具备空间记忆和自主任务规划能力,泛化到新环境不需要重新训练数据或专用策略。这一路径的可行性已验证,但硬件耐久性和端侧算力仍是制约大规模应用的关键瓶颈。随着具身智能持续迭代,「动嘴让机器人整理房间」有望在三到五年内从演示走向产品化。

相关阅读