AI benchmarks ranking 2026 还能打的没几个了,MMLU 退役,ARC-AGI-3 才刚开张

翻 2026 年的模型发布会,你会看到一个规律,厂商报分的清单一直在换。三年前人手一个 MMLU,现在主流发布页上它几乎绝迹。原因不复杂,前沿模型在 MMLU 上全部冲到 92% 以上,HumanEval 也早就被打穿,这两位老将已经分不出好坏,剩下的功能只有兜底,低于 90% 的模型直接出局。

所以现在看 AI benchmarks ranking,重点不是找一张全能榜,而是知道哪些测试还活着,各自量什么。

写代码,Verified 和 Pro 的落差比分数有用

SWE-bench Verified 让模型修真实 GitHub issue,是目前最接近真实软件工程的测试。9月的头部成绩,Claude Fable 5 拿了 95.0%,GPT-5.5 是 88.7%,DeepSeek V4 Pro 和 Gemini 3.1 Pro 都是 80.6%。

单看这个榜 Fable 5 遥遥领先,但更狠的信号在 SWE-bench Pro 上。Pro 收了 1865 道更难的多文件任务,Fable 5 从 95.0% 掉到 80.3%,只跌 15 个点。GPT-5.5 从 88.7% 掉到 58.6%,一口气跌 30 个点。两张榜对照着看,才看得出谁在简单题上刷分,谁是真稳。

推理,ARC-AGI-2 饱和了,ARC-AGI-3 接棒

ARC-AGI 系列测的是抽象图形推理,专门设计成没法靠背题解决。今年一季度它也被攻破了,GPT-5.5 在 3 月拿到 85%,过了大奖线,Confluence Lab 4 月更是推到 97.9%。一个基准从发布到饱和只用了两年。

于是 ARC-AGI-3 在 3 月上线。开局很残酷,Gemini 3.1 Pro 首测 0.37%,GPT-5.5 到 4 月也只有 1.8%,人类平均在 71% 附近。未来一两年,这条线上的每一次跳动都值得盯着。

HLE,还能打很多年的那一个

Humanity’s Last Exam 收了 2500 到 3000 道各领域专家出的题,设计目标就是让搜索引擎失效。人类 PhD 研究者的水平在 65% 上下,而最强模型 5 月的成绩在 38% 到 45% 区间徘徊。离人类基线还有 20 个点的差距,意味着这个榜还能有效区分模型好几年。

按任务挑榜,别按名气

科学家选 GPQA Diamond,研究生水平的理化生题,Gemini 3.1 Pro 以 94.1% 领先。数学看 FrontierMath,GPT-5.5 带工具 3 月拿到 53%,一年前这个数字接近 2。Agent 能力看 Terminal-Bench,考的是在真实 shell 里把活干完。LiveCodeBench 用训练截止之后的新赛题防背题。通用偏好还是回到 Arena 的盲测投票。

一句话总结,2026 年没有哪个模型横扫所有榜。Fable 5 拿下 MMLU-Pro、SWE-bench Verified、HLE 和 Arena 五个头名,Gemini 3.1 Pro 守住科学线,OpenAI 的强项在 agent 和重算力推理。你的任务是什么,就去看对应的分榜。

想看具体模型的表现,可以接着读Claude Fable 5.1 的发布解读,或者对照Qwen3.7 Max 的 Arena 成绩,开源阵营的排名变化在全球 LLM 每周用量排行里也能看出端倪。