CloudEdgeVLA 把拖累机器人的网络延迟变成可学问题:40 步延迟下仍有 63.8%~78.0% 成功率

把十亿参数级的视觉—语言—动作模型(Vision-Language-Action,VLA)塞进移动机器人,本质上是一场系统冲突:语义推理天然想吃云端 GPU 的算力,闭环控制却必须在本地及时响应网络延迟和抖动。CloudEdgeVLA 给出的解法是不跟延迟做对抗,而是把时间上的错配当成表征学习问题处理——在 40 步均匀延迟窗口下,它在四个 LIBERO 测试套件上仍保留 63.8%~78.0% 的成功率,而 VLASH 最高只有 6.4%,被测的单路径基线最高仅 3.0%。

矛盾何在:大模型的算力在云,闭环控制的 deadline 在本地

VLA 策略的价值来自它对语言和视觉的联合理解,代价是参数量。移动端算力难以承载十亿级模型,云端又意味着一次往返的网络开销;更糟的是这种开销并不稳定,延迟会抖,帧会迟到。于是出现两难:把模型放本地,能力受限;放云端,控制环可能被拖慢到失去可用性。

已有方案的遗留问题

层级式与异步式的策略确实提升了吞吐,但它们没有真正解决「慢通道」的信息质量问题:来自云端的慢通道表征要么是过期的(stale),要么需要显式的调度信号或人工设计的延迟提示(delay cues)才能被正确使用。前者等于把滞后信息当现实用,后者则把系统复杂度转嫁给了工程实现。

CloudEdgeVLA 的做法:让两条路径各自长出专长

这套云边协同策略的关键设定是:训练时把「当前帧」和「随机延迟帧」配对到同一个当前动作目标上,分别送入新鲜路径(fresh path)与陈旧路径(stale path)。云端 VLA 负责把滞后的观测编码成缓慢变化的任务级特征;轻量级的边缘头(edge head)则把最新可用的云端特征与本地当下的视觉输入结合起来输出动作。

为什么这样能奏效

由于两条路径追求的是同一个动作标签,优化过程会自然产生分工(论文称之为涌现式表征专业化,emergent representational specialization):云端侧若想凭过期观测被用好,就必须保留那些不容易随时间改变的任务级语义;而实时、对状态敏感的那部分修正,只能由看得见当下画面的边缘路径负责。分工不是人为写死的,而是训练目标逼出来的。

控制环里没有阻塞等待

工程上同样重要的是这套设计把阻塞式同步从控制回路里拿掉了。边缘端不必等到云端返回才敢动作,而是「有就用最新的,没有就先用上一版」。对机器人来说,这意味着控制频率不再被网络质量直接绑定,也为云端模型后续继续增大留出了空间。

实验结果:对照方法几乎全线失守

评测在 LIBERO 的四个套件上进行,压力条件是 40 步的均匀延迟窗口。CloudEdgeVLA 的 63.8%~78.0% 成功率区间跨度不小,说明不同套件对延迟的敏感度存在差异,但即使最弱的一项,也远高于对照:VLASH 的上限是 6.4%,而被评估的单路径基线最高只到 3.0%。

方案定位对照

方案 慢通道信息来源 40 步延迟下的成功率
CloudEdgeVLA 云端任务特征 + 边缘本地视觉联合校正 63.8%~78.0%(四个 LIBERO 套件)
VLASH 异步策略,慢通道表征可能过期 最高 6.4%
被评估的单路径基线 单一路径,无云边分工 最高 3.0%
层级式策略(文中分类) 慢通道表征仍可能陈旧或需显式调度 论文未给出本文口径下的数值

FAQ:关于 CloudEdgeVLA 你最可能关心的 3 个问题

它和常见的「云边分层」有什么不同?

区别在于处理方式。分层方案通常先设计好结构,再由工程师写调度或补延迟提示。CloudEdgeVLA 把时间错配写进了训练目标:当前帧与随机延迟帧共享同一个当前动作标签,让两条路径在优化中自发专业化,不需要外部 cue 告诉策略「这份特征是旧的」。

63.8%~78.0% 的区间说明什么?

它是在 LIBERO 四个套件上分别测得的结果范围,较低值不代表方法失效,而是反映不同任务对延迟的敏感程度不同。论文给出的对照同样重要:同样条件下 VLASH 最高仅 6.4%,单路径基线最高 3.0%,量级差距足以说明方法的有效性。

边缘侧的计算负担会增加很多吗?

论文强调的是边缘头为「轻量级」(lightweight),云端特征拿来后与本地视觉做融合即可,不承担十亿参数模型的推理。文中未披露具体参数量与推理耗时,因此这里不做进一步推断;可以确定的是设计目标就是让云侧模型能继续变大,而边侧保持轻量与实时。

小结

CloudEdgeVLA 最值得留意之处,是它没有把「网络延迟」当作一个要在系统层硬扛的缺陷,而是把它摆进学习目标里:让慢的那条路负责不随时间变化的语义,让快的那条路负责当下才能看见的状态修正。对希望在真实设备上用上大模型的团队来说,这类「延迟友好」的训练范式可能比继续压缩模型更有实际意义。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 arXiv:2608.00569

相关阅读

这条线上还有几篇站内文章可以接着看: