智谱披露了一个把「模型优化运行自己的那套系统」落到生产环境的案例:GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上作业,不到两周把端到端吞吐提升到初始基线的 3.2 倍,并定位出 GIL 并发阻塞与 KDA 内核性能两类问题。
数据来源:量子位报道,集群超 10 万张国产芯片,周期不到两周,吞吐为初始基线的 3.2 倍。
什么是「模型优化运行自己的系统」
过去我们说 AI 提效,指的是模型帮人写代码、写文档。这里的层次更高一级:被优化的对象不再是某个业务脚本,而是承载模型自身服务的那套基础设施——调度策略、并发参数、内核调用路径。模型在优化自己赖以运行的系统,这类结构常被称为递归自改进(Recursive Self-Improvement)的落地形态。
从辅助写代码到直接动参数
两者差别很大。写业务代码错了可以回滚、可以在测试里暴露;动基础设施参数则直接影响线上吞吐与稳定性,任何改动都需要可度量、可复现、可撤回,这也是这类案例此前多停留在论文和实验室里的原因。
为什么推理系统是最合适的试验场
推理系统具备三个特点:指标天然可量化(吞吐、延迟、利用率),反馈回路短(改完立刻能测),变更还可以灰度与回滚。相比之下,训练系统反馈周期长、代价高,不适合让 Agent 反复试探。
10 万张芯片的规模意味着什么
在超过 10 万张国产芯片组成的集群上做优化,难点早已不是「某个参数该调大还是调小」。规模上去之后,瓶颈会从一个点扩散成一条链:调度器的排队策略、通信库的等待、单机的并发模型、内核态与用户态的切换开销,任何一环卡住都会拖慢整体,而且这些因素互相耦合,人工调优往往只能凭经验逐个假设、逐个验证。
国产芯片集群还叠加了异构与生态适配的复杂度,可参考的公开调优经验相对少,专家经验的稀缺性被放大,这正是自动化探索能补位的地方。
Infra Agent 找到的两类问题
GIL 并发阻塞
GIL(Global Interpreter Lock,全局解释器锁)是 Python 解释器里限制同一进程内多线程并行执行的机制。在推理服务的控制面上,如果大量逻辑跑在被 GIL 约束的线程里,CPU 核数再多也用不满,表现为请求排队、利用率上不去。这类问题的典型特征是「资源看起来很闲,吞吐却卡住」,靠常规 CPU 监控不易一眼看出。
KDA 内核性能问题
另一类被定位到的是 KDA 相关的内核性能瓶颈。内核态的问题往往需要跨层分析:从上层调用一路追到内核实现,再判断是参数配置不当还是实现路径本身有优化空间。人工排查这一步非常依赖经验,而 Agent 的优势在于可以系统性遍历与对比。
优化前后的关键差异
下表按披露信息整理优化前后的对比,用于理解这次作业的边界(非实验室基准测试参数)。
| 对比维度 | 优化前(初始基线) | 优化后(Agent 作业后) |
|---|---|---|
| 集群规模 | 超过 10 万张国产芯片 | 同一集群,未变更硬件 |
| 调优周期 | 以人工经验为主,逐项假设验证 | 不到两周完成本轮优化 |
| 端到端吞吐 | 初始基线(记为 1 倍) | 初始基线的 3.2 倍 |
| 问题发现方式 | 依赖专家经验与人工排查 | Agent 定位 GIL 并发阻塞、KDA 内核性能问题 |
| 工程师角色 | 直接改参数、盯指标 | 转向设计反馈环境 |
工程师的角色会怎么变
这次案例里最值得注意的表述是「工程师角色转向设计反馈环境」。它的分量在于:调优动作被自动化之后,人的工作变成定义什么叫好、怎样快速知道好不好、以及什么样的改动不允许发生——具体包括设定评价指标、搭建可复现的压测环境、划定变更的护栏与回滚条件。
换句话说,人从「操作者」变成「环境设计者与规则制定者」。技能要求也随之变化:对系统性能的理解要更深,因为你需要判断 Agent 给出的结论是否可信;同时要更擅长把模糊的目标翻译成可计算的信号。
FAQ:关于 GLM-5.3 自优化推理系统你最可能关心的 3 个问题
3.2 倍吞吐是怎么衡量出来的?
按披露口径,这是端到端吞吐相对初始基线的倍数,即在同样硬件条件下,单位时间内完成的请求量与优化前的对比。它不等同于单卡算力提升,也不等同于某一项微基准测试的加速比,比较时需先确认基线定义一致。
这套做法能直接照搬到自己的集群吗?
关键前提是三件事:指标可量化、反馈回路足够快、变更可回滚。如果自己的环境连稳定的压测基线和灰度回滚机制都还没有,直接让 Agent 改线上参数风险很高。建议先在离线环境跑通闭环,再逐步放开权限。
Auto 调优会不会失控?
风险确实存在,尤其当评价指标设计得不够全面时,系统可能为提升单一指标而牺牲稳定性或成本。防护手段包括多目标约束、变更留痕与审计、设定改动边界、保留一键回滚能力。人的价值恰恰体现在这些护栏的设计上。
小结
把 3.2 倍单独看,是一次亮眼的性能优化;但放回语境里,更重要的信号是「模型优化运行自己的服务系统」已在超过 10 万张芯片的生产集群上跑通。它说明这类递归自改进不再是概念演示,而是有边界条件的工程实践。对基础设施团队来说,当下更实际的准备不是等待同类工具成熟,而是先把指标体系、压测环境和回滚机制建起来——这才是 Agent 能否安全发挥作用的前提。
消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 量子位
