结论先行:在 AI 数学基准 FrontierMath 上,一道自 2017 年悬置九年的”重大进展”(Frontier)级开放难题,被 GPT-6 Astra 与三位人类研究员的人机组合拿下。更关键的是,模型没有照着”找反例”的剧本走,而是反过来证明了反例根本不存在——在批准式委员会选举中,绝对公平的委员会在任何情况下都必定存在。这是大模型第一次摘下该级别的数学桂冠,也把它从”解题机器”往前推成了”规律发现者”。
一、九年悬题,被人机组合终结
这次被攻克的是批准式委员会选举(approval committee election)里的经典问题:所谓”核”(core)是否为空。出题者的本意,是寻找一个”核为空”的反例,用来说明某些情形下公平委员会并不存在。据 aibase 2026 年 9 月 20 日报道,GPT-6 Astra 与三位研究员协作后,给出的答案却相反——这样的反例根本不存在,也就是说,绝对公平的委员会在任意参数下都必然存在。
从协作方式看,人类负责定方向、把关逻辑链条;AI 则顶起知识库检索、大规模计算演练,以及那些跳跃式的灵感生成。分工像极了一个配合默契的研究组,而非”人提问、机器答”的单向流水线。
二、模型顺手给出了新投票规则
真正让人意外的,是模型在证明过程中顺手提出了一套基于“调和熵”(harmonic entropy)的全新投票规则,并给出多项式时间的算法,证明局部最优解就已经满足”核”的要求。这意味着它不只是”验证了一个旧结论”,而是贡献了可复用的新方法。
| 维度 | 传统数学解题 | GPT-6 Astra 人机协作 |
|---|---|---|
| 角色 | 单人主导,查阅文献 | 人定方向、AI 供灵感与计算 |
| 产出 | 单一证明 | 证明 + 新投票规则 + 算法 |
| 瓶颈 | 人力与时间 | 人类对逻辑的最终把关 |
三、为什么这件事值得写
这是 AI 头一回摘下 FrontierMath 的”重大进展”级难题。维护该榜单的 Epoch AI 为此新增了”Human + AI”状态标签,专门给这种人机联名的研究成果留了位置。当数学家开始扮演”提示词工具人”的角色,科研协作的写法正在被悄悄改写:未来的突破,很可能来自”人会提问、AI 会跳步”的闭环,而不是任何一方单打独斗。
常见问题(FAQ)
Q1:FrontierMath 是什么?
A1:FrontierMath 是由 Epoch AI 维护的顶级 AI 数学基准,题目多为尚未被解决的开放难题,按难度分为多个等级,”重大进展”级是其中最高的一档,此前几乎只有顶尖人类数学家能够触及。
Q2:”Human + AI”标签意味着什么?
A2:它是榜单为”人类与模型联合完成”的成果新增的状态标记,承认 AI 已不再是单纯的验证工具,而是能参与发现数学规律的研究合作者。
Q3:这次证明对普通人有什么用?
A3:短期看是方法论突破,长期看,基于调和熵的投票规则若被采纳,可能影响委员会、评审、分配等需要”公平合议”的场景设计。
小结
GPT-6 Astra 联手人类攻克九年悬题,意义不只是多解了一道题,而是把大模型正式推入”规律发现者”的行列。对关注 AI 能力边界的学习者来说,这是一个清晰的信号:下一代突破,会越来越依赖”人机联名”。
