结论先行:B 站正式上线”AI 无限竞技场“大模型测评榜,并放出首轮结果:在 10 位 UP 主的实测中,GPT-6 Astra 登顶并击败 GLM-5.3 拿下”榜首次数冠军”;榜单前五名里,国产大模型占据三席。和动辄刷分跑分的传统榜单不同,这个榜靠的是 UP 主用真实工作流去”同题 PK”。
一、它到底是什么榜
据 B 站介绍,”AI 无限竞技场”是一个汇集 UP 主大模型测评的竞技广场,由各领域 UP 主对上百个大模型做真实场景实测,覆盖代码、推理、协作、知识等多种主题。榜单涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型,排名实时更新,并持续面向全站 UP 主开放报名。
二、首轮结果:GPT-6 Astra 居首,国产占三席
| 观察项 | 首轮表现 |
|---|---|
| 登顶模型 | GPT-6 Astra(10 位 UP 主测评中居首) |
| 亚军 | GLM-5.3 |
| 前五席位 | 国产大模型占三席 |
| 测评方式 | 不设命题,真实工作流同题 PK |
这种”不固定命题”的设计,让测评更贴近真实使用:同一道题,模型之间的差异会被工作流、专业应用甚至趣味脑洞直接放大,比单纯的实验室跑分更有参考价值。
三、为什么 B 站能做这件事
公开信息显示,过去一年 B 站 AI 知识内容消费时长同比增长 72%,月均观看 AI 内容的用户超过 1.9 亿。平台已经沉淀了大量覆盖不同领域、维度的测评内容,形成了”发布—讨论—测评—使用—求助—共建”的内容生态,这恰是”无限竞技场”能跑起来的土壤。
常见问题(FAQ)
Q1:AI 无限竞技场和传统跑分榜有什么区别?
A1:传统榜多依赖标准化试题与固定维度,而 B 站这个榜由 UP 主自主命题,用真实工作流说话,更强调模型在实际任务里的表现差异。
Q2:普通用户能参与吗?
A2:榜单持续面向全站 UP 主开放报名,任何分区创作者都可以用真实场景命题参与测评。
Q3:GPT-6 Astra 登顶说明什么?
A3:在真实工作流的多维实测里,它在登顶次数上领先,但前五国产占三席也说明国产模型已能与海外头部贴身竞争。
小结
B 站 AI 无限竞技场把”谁更强”的回答权交还给真实场景。对想选模型的自学者来说,这种来自创作者一线的横向对比,比任何单一分数都更值得收藏。
