InterTrack 让人形机器人看懂地形再迈步:交互成功率 81.3%,达最优基线 4.3 倍

InterTrack 把人形机器人的全身控制从「模仿一套固定动作」推进到「理解地形后自行决定全身怎么动」:在地形交互类任务上它取得 81.3% 的成功率,是当前表现最好的已评估基线的 4.3 倍,跌倒后的恢复成功率达到 99.3%。论文同时宣称给出了人形机器人上首次实时跨地形全身遥操作演示。差别不在跑通了多少个动作,而在学习对象从「关节轨迹」变成了「带环境条件的动力学」。

两条老路各自的短板

人形机器人的运动控制长期存在一条分裂。第一条是通用动作跟踪(whole-body tracking):这类策略能跟随多样化的全身动作并保持平衡,能力很泛,但训练数据几乎都来自平地,于是双足在复杂地形上的移动潜力被直接浪费,遇到台阶、斜坡就束手无策。第二条是跨地形控制器:它们确实能对付复杂地面,但往往是任务专属的,或者只接受低维度的移动指令——比如一个方向和速度——因而无法表达「扶着栏杆跨过去」这类需要上半身参与的意图。

缺的是中间那一层

两条路线之间的空白,本质上是缺少一种既能接受丰富全身指令、又能知道「当前脚下是什么」的表达方式。InterTrack 的定位正是填补这一层:它被称为首个面向「带环境交互的鲁棒全身跟踪」的行为世界模型(Behavior World Model,BWM)。

行为世界模型:同时预测动作、状态和「行为分布」

InterTrack 的核心是一个 Transformer,它不像常见的策略网络那样只输出下一个动作,而是联合预测三件事:下一个动作、下一个状态,以及行为的分布。前两项让模型学习到「在什么状态下做什么动作会走到什么状态」,第三项则让它学习到一个行为层面的表征。由于这些训练信号来自真实的环境交互,模型学到的是以环境为条件的动力学——也就是地形如何影响运动的规律,而非某条固定的参考轨迹。

数据从哪来:自动标注重建 3D 支撑几何

交互数据的稀缺一直是这条路的瓶颈。论文的应对是一条自动标注流水线:对重定向后的人类动作进行重建,还原出三维的支撑几何——简单说,就是推断出人在做这个动作时,脚(或其他部位)究竟踩在什么形状的面上。有了这层几何信息,成规模的动作数据才带上「地形上下文」,具备用于训练交互策略的条件。

部署时的兜底:不可行动作按「尽力而为」处理

真实遥操作里,操作员常常在当前地形上发出根本做不到的指令。InterTrack 的处理方式不是报错或僵住,而是以 best-effort(尽力而为)的方式应对:在理解地形约束的前提下给出最接近意愿且仍然稳定的动作。这也是它区别于纯跟踪方案的地方:后者只会照着动作硬执行,指令超出地形能力时往往直接失衡。

数据之外:它实际表现如何

论文披露的量化结果集中在地形交互这一最难的场景。除了 81.3% 的交互成功率和 99.3% 的跌倒恢复率,InterTrack 在自由空间(free-space)的动作跟踪上同样优于三家主流的跟踪基线,并且在这种评价口径下全面胜出。配套的演示则覆盖物体交互、面对支撑缺失时的稳定响应、从跌倒中恢复,以及前述的实时跨地形全身遥操作。

关键指标一览

能力维度 InterTrack 表现 参照对象
地形交互成功率 81.3% 最优已评估基线的 4.3 倍
跌倒恢复率 99.3% 论文未给出同比对照数值
自由空间动作跟踪 优于主流方案 三家领先跟踪基线
训练数据类型 重定向动作 + 自动重建的 3D 支撑几何 传统方案多为纯平地动作数据
跨地形实时遥操作 论文称为人形机器人上的首次演示 此前多为任务专属跨地形控制

FAQ:关于 InterTrack 你最可能关心的 3 个问题

「行为世界模型」和普通的「世界模型」有什么区别?

一般意义上的世界模型关注环境本身如何演化,比如下一帧画面长什么样。InterTrack 关注的是行为层面的表征:它的 Transformer 联合预测下一个动作、下一个状态与行为分布,因此在预测未来的同时也在刻画「什么样的行为在当前地形下是合理的」,最终学到的是环境条件下的动力学。

4.3 倍这个数字该怎么理解?

论文的表述很清楚,它是相对「表现最好的已评估基线」而言的倍数,而不是相对所有已知方法的倍数,更不是同一套测试集上的绝对差值。它足以说明跨代际的量级差异,但不适合被当作任意场景下的通用换算系数。

距离真实落地还有多远?

目前披露的结果来自论文中的实验与演示。99.3% 的跌倒恢复率和 81.3% 的交互成功率都说明策略层有了明显进步,但真机部署还要面对传感器噪声、地形感知误差、长时间运行的稳定性等系统级问题,这些不在本文数据覆盖范围内。

小结

InterTrack 的意义可以浓缩成一句话:它让机器人学的不再是「什么时候抬哪条腿」,而是「什么地形下全身该怎么配合」。这种把「地形如何影响运动」抽象成可学习表征的做法,比单纯刷高某个成功率更有迁移价值。下一步最值得关注的,是这套方法向更多地形类型、以及在配备真实感知的机器人上的泛化表现。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 arXiv:2608.18234

相关阅读

这条线上还有几篇站内文章可以接着看: