全球大模型周调用量达 129 万亿 Token:DeepSeek V4.1-Flash 15.8 万亿登顶,环比涨 219%

OpenRouter 最新统计显示,2026 年 9 月 14 日至 20 日这一周,全球大模型总调用量达到 129 万亿 Token,环比增长 1.57%。其中中国大模型周调用量为 67.46 万亿 Token,环比增长 10.28%;美国大模型为 14.21 万亿 Token,环比下降 34.7%。个体排名上,DeepSeek V4.1-Flash 以 15.8 万亿 Token 跃居第一,环比大涨 219%,并且全球前五中有四款来自中国厂商。

结论先放在前面:这一周真正值得关注的不是总量微增,而是份额结构发生了剧烈重排——总量只涨了 1.57%,但头部模型的环比变动幅度普遍在两位数百分比以上,说明调用量正在从旧模型快速迁徙到新模型身上。

一周数据总览

口径 周调用量 环比变化
全球总量 129 万亿 Token +1.57%
中国大模型 67.46 万亿 Token +10.28%
美国大模型 14.21 万亿 Token -34.70%

按上述口径,中国大模型周调用量已连续 21 周超过美国。需要提醒的是,OpenRouter 是第三方模型路由平台,其数据反映的是该平台上的调用分布,而非全球全部流量的完整统计,更贴近开发者自由选择的市场份额,而非企业采购的整体盘子。

前五排名:四款来自中国厂商

排名 模型 周调用量 备注
1 DeepSeek V4.1-Flash 15.8 万亿 Token 环比 +219%,9 月 10 日发布
2 智谱 GLM-5.3-Flash 14.1 万亿 Token 高性价比推理主力
3 腾讯混元 Hy4 preview 12.5 万亿 Token 预览版本已进入前三
4 榜单未披露完整第五之外的顺位
5 DeepSeek-V4-Flash-0731 9.44 万亿 Token 上一代版本仍在榜上

一个耐人寻味的细节是:DeepSeek 的新旧两代模型同时进入前五。V4.1-Flash 冲到第一的同时,V4-Flash-0731 仍保有 9.44 万亿 Token 的量级。这说明迁移并不是瞬时完成的——大量生产环境下的调用依赖稳定的模型标识与已验证的输出风格,不会因为新版本发布就立刻切换。

DeepSeek V4.1-Flash 为什么能暴涨 219%

该模型于 9 月 10 日发布,重点提升 Coding、Agent 与多模态理解能力,架构上采用 Causal-Encoder-Decoder,全局 KV Cache 降至 V4-Flash 的约 四分之一。KV Cache 的压缩直接对应两件事:更长的可用上下文与更低的推理显存占用,这正是 Agent 场景最敏感的资源。

价格同步下调

在闲时档位,每百万 Token 的输入缓存命中、缓存未命中与输出价格分别为 0.02 元、1 元和 4 元,较前代分别下降 60%、33.3% 和 11.1%。对需要反复迭代代码、多轮调用工具的 Agent 应用而言,缓存命中价格从几分钱级别继续下探,意味着「让模型多试几次」的成本门槛被进一步抹平。

但单任务成本不一定真的降了

这里有一个容易被忽略的反向证据。Artificial Analysis 的测试显示,V4.1-Flash 平均每项任务使用约 8.9 万输出 Token,高于 V4-Flash-0731 的约 6.2 万 Token,并被评价为输出较为冗长。

模型 平均单任务输出 Token 评价
DeepSeek V4.1-Flash 约 8.9 万 输出较冗长
DeepSeek-V4-Flash-0731 约 6.2 万 相对紧凑

把两件事放在一起看:单价降了 60%,但输出量涨了约 43%。 Token 单价下降并不自动等于单任务综合成本下降。真正的账单取决于任务完成所需的总 Token 数乘以单价,而不是任何单一指标。

怎么读懂这份榜单

它是「开发者选择」的切片

OpenRouter 的调用结构由大量独立开发者和中小团队构成,他们没有采购约束,迁移成本几乎为零,因此对价格与能力的反应极快。这让它成为观察模型竞争力变化的高频指标,但并不能代表企业级市场的真实占比。

环比比绝对值更有信息量

129 万亿 Token 的周总量听起来庞大,但环比仅增 1.57%,意味着整体增长已进入平稳期。相反,头部模型的环比变动动辄超过 200%,增量主要来自存量重分配,而不是需求扩张——这是当前阶段最值得留意的结构特征。

新旧同榜说明迁移有惯性

新模型登顶往往需要一到两周完成流量爬坡,而旧模型会长期维持的长尾。对开发者来说,这也意味着短期不必急于迁移:除非新版在具体任务上有明显增益,否则保留稳定版本通常是更省心的选择。

常见问题

这份调用量数据能代表全球大模型真实使用率吗?

不能作此等同理解。它来自第三方模型路由平台 OpenRouter,统计的是该平台上的调用分布,偏重自由度高的开发者与中小团队流量,企业直连官方 API 或私有化部署的部分不计入其中。它更适合作为模型竞争力的趋势指标,而非绝对市占率。

DeepSeek V4.1-Flash 更便宜了,单任务成本是不是一定更低?

不一定。虽然闲时每百万 Token 输入缓存命中价降至 0.02 元、降幅 60%,但测试显示其平均单任务输出量约 8.9 万 Token,高于上一代的约 6.2 万 Token,且输出偏冗长。实际成本要看单价与总消耗量的乘积,需要按自己的任务类型实测才能判断。

为什么新模型发布后老模型的调用量没有快速归零?

因为生产环境的迁移存在惯性。业务方通常依赖固定的模型标识、已调优的提示词和验证过的输出风格,切换意味着重新评估成本。此外部分场景对新模型的冗长输出并不友好,保留旧版本反而是更稳妥的选择。

小结

把这一周的数据串起来看:大盘平稳、头部剧烈。129 万亿 Token 的总量环比只涨 1.57%,但 DeepSeek V4.1-Flash 一周内抢下 15.8 万亿 Token,靠的是架构层面 KV Cache 压缩到约四分之一加上激进降价;同时,它的单次任务输出量反而比上代高出四成以上。

这条组合信息其实指向同一个趋势——大模型竞争的重心已经从「每 Token 多少钱」转向「每完成一件事多少钱」。下一个值得盯的指标不再是价格表上的数字,而是各家在单位任务 Token 效率上的改进幅度。谁能把「话少办成事」做到位,谁才会在下一轮榜单里真正站稳。