FrontierMath 上有一道挂了九年的难题,最近被解开了。解题方不是纯人类团队,而是 GPT-6 Astra 加三位人类研究员。榜单为此专门新增了 Human+AI 这个状态标签。
题目本身就很反直觉
这道题原本是要找一个核为空的反例。结果模型反过来证明了反例根本不存在,一个看起来要证伪的方向,最后变成了一次正向证明。
这类反转在数学里并不罕见,但由模型主导完成,还是第一次被记到 FrontierMath 的榜单上。
比解题更有价值的部分
GPT-6 Astra 顺手提出了一个基于调和熵的投票规则,并给出多项式时间算法。这部分的价值可能比解出单道题更高,因为投票规则可以迁移到其他推理任务上,而单道题的答案只对这道题有效。
榜单为什么新增 Human+AI 标签
新增这个状态标签,等于承认人机协作的成果需要单独归类。它既不完全是模型的独立成绩,也不该算作人类的成绩。这个分类动作本身,说明评审方已经认为人机联名会变成常态。
常见问题
这道题的难度级别是什么
按素材里的说法,它属于重大进展级,且在 FrontierMath 上悬置了九年。
人类研究员做了什么
素材没有展开三位研究员的具體分工,只能确认解题是以人机联名的方式完成。
小结
这件事的信号意义大于单题结果。当榜单开始为人类与 AI 的合作成果单独设标签,说明评估体系已经在为这类成果让路。
相关阅读
这条线上还有几篇站内文章可以接着看:
延伸阅读
- DeepSeek V4 Pro 正式版突袭上线,Agent 跑分直逼 Fable 5,API 价格一分没涨1 月前
- Runway 发布 Solaris:把软件界面当视频实时生成,不用一行代码3 周前
- Anthropic 12 个月留存 22.5%,高于 OpenAI2 天前
- 蓝虫具身发布模块化人形机器人「小白」:0.98 万元起售,22 自由度单臂负载 7kg2 天前
AI 自学笔记 每天更新 AI 前沿动态,订阅 RSS,或按 Ctrl/⌘+D 收藏本站,明天见。
