LLM leaderboard 9月洗牌,Anthropic 包揽前四,Kimi K3 把开源模型顶到 1500 分大门口

9月15日,LMArena 更新了新一期文本榜。这次有个标志性变化,1500 分这条历史门槛,第一次被三个模型同时踩了过去。Claude Mythos 5 以 1531 排在第一,Claude Fable 5 拿到 1525,Claude Opus 5 是 1522。GPT-5.6 Sol 停在 1514,落后第一名 17 分。

如果你很久没看这个榜,简单交代下背景。它前身是 LMSys Chatbot Arena,UC Berkeley 的研究项目,玩法是盲测。你提交一个 prompt,两个匿名模型各答一遍,你投票选更好的那个,全网的票汇总成 Elo 分。现在每月有超过一百万张票进去,企业采购合同里也开始引用这个分数,算是目前争议最小的大模型横向参照。

前四名被 Anthropic 包了

9月这期,文本榜前四全是 Anthropic 的模型。Mythos 5 挂了一个 61.4 的 AAII 分,官方标了 coding 和 overall 双第一。Opus 4.8 以 1512 排第五,再往下是 GPT-5.5 Pro 的 1510 和 GPT-5.5 的 1506。Opus 4.7 和 Gemini 3.1 Pro 并列 1505。

OpenAI 最能打的是 GPT-5.6 Sol,1514,排在第四。这个差距说大不大,说小也不小。按 Elo 的换算,100 分差距意味着高分一方在正面对决里赢下大约 64% 的场次,而 25 分以内的波动基本可以当成噪声处理。

开源阵营贴到了天花板

这期榜单真正的故事在下半区。Kimi K3 正好落在 1500,这是开源模型第一次把文本榜摸到这条线。它在 Coding Arena 的前端榜单上更凶,1679 分直接拿了第一,也是开源模型第一次在单项榜上登顶。价格是每百万 tokens 输入 3 美元、输出 15 美元。

它后面还跟着两个。Qwen3.8 Max 拿了 1491,性价比分 24.0,托管价格每百万输入只要 2 美元。GLM-5.2 是 1483,出字 168 tokens 每秒,是可自托管里最快的,性价比分冲到 31.4。作为对比,闭源旗舰的性价比分普遍在 3 到 7 之间。MIT 协议的 DeepSeek V4 Pro 也守在 1462,输出价格低到每百万 0.87 美元。

开源与闭源的差距,从去年动辄上百分,压缩到现在 30 分上下。这个趋势比谁排第一更值得关注。

Elo 高不等于你的任务强

榜单有个容易踩的坑。Arena 量的是人类偏好,答题好不好读、详不详细都会影响票数,长度偏置一直被诟病。它测不了你的具体任务。

几个横向数据可以说明这件事。Gemini 3.1 Pro 文本榜 1505,出字速度却是前排最快的 131 tokens 每秒,长上下文和科学类任务另有一套成绩。跑生产路由的团队做法更直接,按任务分档选模型,而不是盯一个总分。有团队分享过教训,上季度死守某个旗舰,结果它在 coding 上悄悄滑了 30 分,任务完成率掉了 4 个点才发现。

看这份榜单的三条经验

第一,别只看总分,Coding、Reasoning、Hard Prompts 这些分榜跟实际使用关联更紧。第二,注意更新日期,Arena 大约每周重排一次,25 分以内的名次变化不用当真。第三,交叉验证,第三方榜单方向一致再下结论,比如 llm-stats 9月12日的数据里,Opus 5 在 coding arena 第一,GPT-6 Astra 在 GPQA 拿了 96%,Fable 5 在 SWE-Bench Verified 拿了 95%,三家的分榜各说各的故事,拼起来才是全貌。

相关的站内动态可以接着看,B站 AI 无限竞技场的首轮榜单里国产模型前五占了三席,Qwen 3.7 杀进 Arena 全球前 15是上个月的国产新高,开源侧的上一棒是MiniMax M2 冲到全球第五