8月14日,智谱正式发布 GLM-5.3。这个版本有个很反直觉的地方,基座模型和 GLM-5.2 完全一样,7430 亿参数的底座动都没动,所有的提升全部来自后训练。
智谱把这套打法叫后训练 Scaling。数十倍规模的长程任务环境、更丰富的环境类型、超长的后训练时间,硬是在同一个基座上把智能上界又抬高了一截。公司内部自建的体感评测里,GLM-5.3 的编程能力比 5.2 提升了 50%,一跃成为当前编程能力最强的开源模型。
公开基准上的数字更直观。Terminal-Bench 3.0 从 4.6 直接跳到 28.3,DeepSWE v1.1 从 46.2 升到 66.9,Agents’ Last Exam 从 23.8 提到 28.5,覆盖 44 类职业的 GDPval-AA v2 拿到 1769 分。在 Terminal-Bench 3.0 和 Agents’ Last Exam(CLI)两项测试里,GLM-5.3 都是开源第一,编程与智能体能力已经接近 Claude Fable 5。
Token 效率是这次最亮眼的数据。智谱自研的 Z.ai Code Bench 把模型放进真实本地开发环境,模拟 Coding Agent 完整工作流。在 High 思考档位下,GLM-5.3 准确率 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%,而每项任务平均只输出约 5 万 tokens,Opus 4.8 要 12 万。用更短的执行路径拿到更高精度,这个差距对成本敏感的开发者来说很实在。
网络安全能力的涌现也值得注意。在白盒代码审计和漏洞识别任务里,GLM-5.3 的表现持平 Mythos 5,CyberGym 漏洞验证得分 84.5%,高于 5.2 的 77.2%,也压过 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。发布前两周智谱联合安全团队做了测试,发现 2404 个潜在漏洞,其中 1088 个中高危,还顺带挖出一个潜伏 40 多年的 DNS 协议级风险,攻击者用少量特殊请求就能把服务器压力放大近 8 万倍。智谱说安全能力是约束严格的编程能力的延伸,这个方向从 2025 年 9 月就开始投入了。
落地动作也很快。官方编程工具 ZCode、效率工具 AutoClaw 当天上线,GLM Coding Plan 全量用户额度在今天 13:00 重置。Trae、扣子、WorkBuddy、CodeBuddy、Qoder、CatPaw、JoyCode、OpenCode 等编码平台都开放了抢先体验,API 很快上线。完整模型权重将在两周后开源,不过要先完成安全评估和加固,尽量限制潜在攻击能力、保留防御价值。
这次发布还有一个信号意义。继 Kimi K3、DeepSeek V4 Pro 之后,国产开源模型的竞争从堆参数转向了练透底座。智谱自己都说了,可能还远未开发出这个基座的智能上界。下一阶段的较量,正从谁更会说话转向谁更会干活,Coding Agent、安全审计、企业服务这些高价值场景,会成为模型商业化的主战场。
