agentic-eCAL 把能耗度量从单次推理推广到多智能体工作流,实测结论相当反直觉:跨 5G 无线接入网、城域网与光链路传输智能体之间的文本,只占整个工作流能耗的 0.25%。真正的能耗大头是通信所诱发的额外推理与上下文处理——多一次协调,就要多跑一遍预填充,多背一段上下文。
为什么需要一个新的能耗指标
通信网络正向 5G-Advanced 与 6G 的自治化演进,智能体工作流被越来越多地部署在边云连续体上:大模型执行多步推理、调用诊断工具、检索领域知识,并在多个智能体之间协调。但现有的 AI 生命周期能耗指标,要么只评估孤立的单次模型推理,要么干脆忽略多智能体的执行图。结果是网络运营方缺少一个基础模型来判断:分布式智能体通信到底值不值得算能耗账,以及智能体团队该放在边云的哪一层。
一个可作为参照的量级
论文给出了一个对比:生物大脑完成复杂认知的代谢功率预算约为 20 瓦,而当代大语言模型在能耗与显存两方面都极其昂贵。这个量级差距决定了「可持续的生命周期编排」不是锦上添花,而是运营层面的必答题。
agentic-eCAL 是怎么算的
两速率的单次调用能耗模型
指标的核心是一个闭式的两速率模型(two-rate single-call energy model):把一次调用拆成计算受限的预填充阶段(prefill)与显存带宽受限的解码阶段(decode)。两个阶段的系统瓶颈不同,能耗随批大小与序列长度的变化规律也不同,分开建模才不会系统性偏估。
叠加七层 OSI 传输能耗
在此之上,agentic-eCAL 把 7 层 OSI 数据传输模型的能耗叠加进来,并把单次调用沿有向的多智能体工作流图展开,从而得到整条工作流的能耗与显存画像。这正是它对原有 eCAL(Energy Cost of AI Lifecycle)指标的推广之处:从单点推理走向有向图。
实测覆盖的范围
| 维度 | 覆盖范围 |
|---|---|
| 硬件 | NVIDIA A100 与 H100,数百组 GPU 基准配置 |
| 模型 | 16 个开源权重模型 |
| 编排 | 8 种编排拓扑 |
| 网络 | 5G 无线接入网、城域网、光链路 |
| 指标 | 两速率能耗模型 + 7 层 OSI 传输能耗 |
论文结果:智能体之间的文本传输在 5G RAN、城域网与光链路上,仅占工作流能耗的 0.25%。
0.25% 之后,成本究竟在哪
通信的间接成本远大于直接成本
0.25% 这个数字容易被误读成「网络可以随便用」。论文的完整结论恰恰相反:分布式部署的主要能耗并不在传输文本本身,而在通信所诱发的额外推理与上下文处理。多智能体每多一次协调,接收方就要重新做一次预填充,把更长的上下文装进显存;这类成本随回合数与上下文长度累加,量级远高于搬运字节。
对边云放置的启示
因此,「智能体该住在哪里」这道题的答案不在链路带宽上。把智能体拆到多个边缘节点,如果换来的只是更多轮次的互相通报,整体反而可能更耗能;真正值得优化的是减少无效回合、压缩共享上下文,以及让小模型承担那些小模型就能完成的环节。
运营方该怎么用这个指标
对网络运营方来说,agentic-eCAL 提供的是一把可量化的尺子:给定一个工作流的拓扑、模型与部署层级,就能预估它的能耗与显存画像,从而比较「全放云上」「下沉到边缘」「按角色拆分」几种方案的优劣。需要提醒的是,论文验证的是指标的组成部分与放置层面的启示,具体到某一张网的电价、散热与设备折旧,仍要叠加本地参数才能得出运营结论。
FAQ:关于 agentic-eCAL 多智能体能耗你最可能关心的 3 个问题
0.25% 是不是说明网络能耗可以忽略?
只对「传输智能体之间的文本」这一项成立。论文明确指出,分布式的能耗主体是通信诱发的额外推理与上下文处理,而不是传输本身。可以省下的是优化带宽的焦虑,省不下的是优化回合数的功夫。
为什么要把预填充和解码分开建模?
因为两者的瓶颈不同:预填充阶段是计算受限,解码阶段是显存带宽受限。用单一速率模型会在长序列场景下显著偏估,两速率模型才能让不同批大小、不同序列长度下的能耗估算保持可用。
16 个模型与 8 种拓扑的结论能外推到闭源模型吗?
需要谨慎。论文的实测基础是 A100 与 H100 上的开源权重模型与开源编排拓扑,结论对硬件与编排结构敏感;闭源模型的推理栈与批处理策略不同,落地前建议按自己的拓扑重跑一遍画像。
小结
agentic-eCAL 把「多智能体到底耗多少电」从一句争论变成了可计算的量。它给出的最重要提醒是:在边云连续体上做智能体放置时,别盯着链路预算,要盯着回合预算。减少一次无谓的智能体间沟通,往往比把网络升级一档更省电。
消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://arxiv.org/abs/2609.18283
