把十亿参数级的视觉—语言—动作模型(Vision-Language-Action,VLA)塞进移动机器人,本质上是一场系统冲突:语义推理天然想吃云端 GPU 的算力,闭环控制却必须在本地及时响应网络延迟和抖动。CloudEdgeVLA 给出的解法是不跟延迟做对抗,而是把时间上的错配当成表征学习问题处理——在 40 步均匀延迟窗口下,它在四个 LIBERO 测试套件上仍保留 63.8%~78.0% 的成功率,而 VLASH 最高只有 6.4%,被测的单路径基线最高仅 3.0%。
矛盾何在:大模型的算力在云,闭环控制的 deadline 在本地
VLA 策略的价值来自它对语言和视觉的联合理解,代价是参数量。移动端算力难以承载十亿级模型,云端又意味着一次往返的网络开销;更糟的是这种开销并不稳定,延迟会抖,帧会迟到。于是出现两难:把模型放本地,能力受限;放云端,控制环可能被拖慢到失去可用性。
已有方案的遗留问题
层级式与异步式的策略确实提升了吞吐,但它们没有真正解决「慢通道」的信息质量问题:来自云端的慢通道表征要么是过期的(stale),要么需要显式的调度信号或人工设计的延迟提示(delay cues)才能被正确使用。前者等于把滞后信息当现实用,后者则把系统复杂度转嫁给了工程实现。
CloudEdgeVLA 的做法:让两条路径各自长出专长
这套云边协同策略的关键设定是:训练时把「当前帧」和「随机延迟帧」配对到同一个当前动作目标上,分别送入新鲜路径(fresh path)与陈旧路径(stale path)。云端 VLA 负责把滞后的观测编码成缓慢变化的任务级特征;轻量级的边缘头(edge head)则把最新可用的云端特征与本地当下的视觉输入结合起来输出动作。
为什么这样能奏效
由于两条路径追求的是同一个动作标签,优化过程会自然产生分工(论文称之为涌现式表征专业化,emergent representational specialization):云端侧若想凭过期观测被用好,就必须保留那些不容易随时间改变的任务级语义;而实时、对状态敏感的那部分修正,只能由看得见当下画面的边缘路径负责。分工不是人为写死的,而是训练目标逼出来的。
控制环里没有阻塞等待
工程上同样重要的是这套设计把阻塞式同步从控制回路里拿掉了。边缘端不必等到云端返回才敢动作,而是「有就用最新的,没有就先用上一版」。对机器人来说,这意味着控制频率不再被网络质量直接绑定,也为云端模型后续继续增大留出了空间。
实验结果:对照方法几乎全线失守
评测在 LIBERO 的四个套件上进行,压力条件是 40 步的均匀延迟窗口。CloudEdgeVLA 的 63.8%~78.0% 成功率区间跨度不小,说明不同套件对延迟的敏感度存在差异,但即使最弱的一项,也远高于对照:VLASH 的上限是 6.4%,而被评估的单路径基线最高只到 3.0%。
方案定位对照
| 方案 | 慢通道信息来源 | 40 步延迟下的成功率 |
|---|---|---|
| CloudEdgeVLA | 云端任务特征 + 边缘本地视觉联合校正 | 63.8%~78.0%(四个 LIBERO 套件) |
| VLASH | 异步策略,慢通道表征可能过期 | 最高 6.4% |
| 被评估的单路径基线 | 单一路径,无云边分工 | 最高 3.0% |
| 层级式策略(文中分类) | 慢通道表征仍可能陈旧或需显式调度 | 论文未给出本文口径下的数值 |
FAQ:关于 CloudEdgeVLA 你最可能关心的 3 个问题
它和常见的「云边分层」有什么不同?
区别在于处理方式。分层方案通常先设计好结构,再由工程师写调度或补延迟提示。CloudEdgeVLA 把时间错配写进了训练目标:当前帧与随机延迟帧共享同一个当前动作标签,让两条路径在优化中自发专业化,不需要外部 cue 告诉策略「这份特征是旧的」。
63.8%~78.0% 的区间说明什么?
它是在 LIBERO 四个套件上分别测得的结果范围,较低值不代表方法失效,而是反映不同任务对延迟的敏感程度不同。论文给出的对照同样重要:同样条件下 VLASH 最高仅 6.4%,单路径基线最高 3.0%,量级差距足以说明方法的有效性。
边缘侧的计算负担会增加很多吗?
论文强调的是边缘头为「轻量级」(lightweight),云端特征拿来后与本地视觉做融合即可,不承担十亿参数模型的推理。文中未披露具体参数量与推理耗时,因此这里不做进一步推断;可以确定的是设计目标就是让云侧模型能继续变大,而边侧保持轻量与实时。
小结
CloudEdgeVLA 最值得留意之处,是它没有把「网络延迟」当作一个要在系统层硬扛的缺陷,而是把它摆进学习目标里:让慢的那条路负责不随时间变化的语义,让快的那条路负责当下才能看见的状态修正。对希望在真实设备上用上大模型的团队来说,这类「延迟友好」的训练范式可能比继续压缩模型更有实际意义。
消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 arXiv:2608.00569
相关阅读
这条线上还有几篇站内文章可以接着看:
- 宇树科技发布 UnifoLM-OminiA-0.3:单模型统筹家居康养,具身大模型进入“一站式”时代
- MAGS 多智能体形式化验证:以 Dafny 为中间表示,220 个任务 100% 产出带安全保证程序
- InterTrack 让人形机器人看懂地形再迈步:交互成功率 81.3%,达最优基线 4.3 倍
延伸阅读
- 科大讯飞开源星火 X2.5 端侧模型:4B 参数,原生 100 万 Token 上下文,能本地干活了3 周前
- 千问输入法上线:300 字/分钟语音输入 + AI 自动润色,支持 9 种方言且纯净无广告2 天前
- 美团 LongCat-2.0 开源:1.6T 参数每 token 激活 33B–56B,首个五万卡国产集群推理的万亿模型2 天前
- StepAudio 3 系列发布:五款语音模型,Realtime 98.9 分登顶、ASR 词错率 1.7%3 天前
