后台隔三差五有人问,现在大模型这么多,到底该用哪个。这个问题没有标准答案,但可以有一个按场景的推荐顺序。下面这份榜单基于 9 月中旬的 LMArena 文本榜和各家公开价格,按使用场景拆开讲。
先看一眼分数盘
9月15日那期榜单,前四名被 Anthropic 包揽,Claude Mythos 5 拿 1531,Fable 5 是 1525,Opus 5 拿 1522。OpenAI 最强的是 GPT-5.6 Sol,1514。开源阵营里 Kimi K3 摸到 1500,Qwen3.8 Max 1491,GLM-5.2 1483。这条线往下还有 DeepSeek V4 Pro 的 1462。
写代码,Claude 优先,开源选 Kimi
预算充足就上 Claude Opus 5 或 Fable 5,SWE-bench Verified 95% 的成绩断崖领先,40 文件级别的大改动里对上下文和依赖链的把握,目前没有对手。预算敏感的话,Kimi K3 是这半年最大的惊喜,1500 的文本分,coding 分榜 1679 直接登顶,价格只有 Claude 的三成左右。
自托管场景看 GLM-5.2,MIT 协议,SWE Pro 的成绩压过 GPT-5.5,168 tokens 每秒的出字速度在可自部署的模型里最快。
省钱跑量,DeepSeek 依然是价格地板
DeepSeek V4 Pro 每百万 tokens 输入 0.435 美元、输出 0.87 美元,MIT 协议,这个价格在前 20 名里没有对手。更激进的 V4 Flash 把价格打到 0.14 和 0.28 美元,轻任务批量跑完全够用。阿里这边 Qwen3.8 Max 性价比分 24.0,每百万输入 2 美元,多模态和亚太访问是加分项。
中文日常,可及性优先
国内直连稳定的前提下,DeepSeek 和 Qwen 的官方入口、豆包这类 C 端产品都在第一梯队。中文语料的语感、时效数据的接入、价格补贴,国产模型在这几项上的综合体验依然好于绕出去用海外模型。写作场景单独提醒一句,Claude 的中文长文能力虽强,但最近有用户反馈文风出现「Claudeish」的痕迹,重要稿件建议自己把最后一道关。
长文档与科学,Gemini 的主场
丢几十页 PDF、合同、书籍进去梳理,Gemini 3.1 Pro 和 Claude 都称手,前者赢在 131 tokens 每秒的速度和百万级上下文,后者赢在结构化梳理的稳。科研文献问答,GPQA Diamond 94.1% 的成绩让 Gemini 3.1 Pro 单独一档。
我的实际选法
主力写代码用 Claude,批量数据处理丢给 DeepSeek,中文快问快答用豆包,跨模态资料整理交给 Gemini。这套组合每月的 API 开销控制得很低,任务覆盖也够。模型迭代太快,这份榜单的保质期大概一个季度,到时候分数盘洗一遍,选法可能就得跟着调。
延伸阅读,DeepSeek V4 全量上线识图模式,Qwen 音频系列五款模型降价,以及关于 Claude 文风退化的讨论。
延伸阅读
- 美团 LongCat-2.0 开源:1.6T 参数每 token 激活 33B–56B,首个五万卡国产集群推理的万亿模型3 天前
- 百度文库网盘 AI 办公出海:库库 AI 全球月活超 4000 万,海外版 Kooko 一年内用户破 1000 万3 天前
- Maxinsights 机器人数据集已达 150 万小时:采集良率 98%,目标冲 1000 万小时4 天前
- AI benchmarks ranking 2026 还能打的没几个了,MMLU 退役,ARC-AGI-3 才刚开张2 小时前
