智谱发布 GLM-5.3-FlashX:推理提速 5 倍至 200 tokens/s,定价提升 2.5 倍

9 月 18 日,智谱正式上线 GLM-5.3-FlashX。新版本将推理速度提升至最高 200 tokens/s,较上一代 GLM-5.3-Flash 提速 5 倍,定价同步提升至原版的 2.5 倍。API 已全面开放,Model Key 为「GLM-5.3-FlashX」。同日智谱港股股价大涨 6.42%,报 787.5 港元/股。

前世「Ox Alpha」:匿名上线爆红后认领开源

GLM-5.3-FlashX 并非横空出世。8 月 20 日,一个名为「Ox Alpha」的匿名模型以「神秘模型」「牛来模型」的身份在 OpenRouter 平台上线测试,因来路不明但表现强劲,被国内开发者冠以「牛来」称号。8 月 26 日,智谱正式认领并开源,彼时调用量已高达 62T,双平台登顶并刷新历史纪录。

值得注意的是,GLM-5.3-Flash 长期保持同尺寸模型中最强智能水平,同时具备较高毛利率。FlashX 版本的提价策略,被视为智谱在高速推理市场寻求更高利润率的主动选择。

国产算力底座:10 万张芯片支撑

此次新版本背后,是智谱大规模国产算力集群的支撑。据介绍,由10 万张国产芯片组成的推理集群上线即满负荷运行,面对持续超预期的市场需求,智谱再次扩大算力规模,推出速度更快、定价更高的 FlashX 版本。

在当前国产大模型竞争格局下,智谱、阿里等头部公司已从「抢算力」转向「拼效率」——推理速度、响应体验与单位成本正在成为新的核心竞争标尺。

定价策略:速度换利润

FlashX 将价格提升至 GLM-5.3-Flash 的 2.5 倍,对应的是 5 倍的推理速度提升。在保持同等智能水平的前提下,这一策略瞄准的是对响应延迟更敏感的企业级开发者——如客服实时对话、代码助手、交互式数据分析等场景。

不过,也有开发者反馈 FlashX 版本「额度消耗明显加快」,实际使用成本需结合业务场景仔细评估。

行业趋势:从拼参数到拼效率

GLM-5.3-FlashX 的发布,折射出国产大模型竞争逻辑的一次深层切换。今年下半年以来,阿里 Qwen3.8-Flash 训练成本骤降 90%、推理定价低至输入 0.8 元/百万 Tokens、输出 2.7 元/百万 Tokens;智谱则以「智能水平 + 推理速度」双轮驱动,走高价高速路线。

两条路线孰优孰劣,尚待市场检验。但可以确定的是,2026 年下半年的大模型战场,已经从「谁更强」转向「谁更快、更便宜、更省 token」。