OpenAI o3 与 o4-mini 推理模型解析:MMMU 82.9% 超越 o1,图像直接接入推理链

结论先行:2025 年 4 月 16 日,OpenAI 发布了 o 系列的两款新推理模型——o3 与 o4-mini。真正值得关注的不是”又涨了几个点”,而是 o3 做出了一个此前没有过的动作:把图像直接放進思维链,让模型不只是”看见”图,而是”用图思考”。官方给出的 MMMU 大学级视觉解题任务准确率达到 82.9%,高于前代 o1 的 77.6%。同一天开放的还有大小搭档 o4-mini,面向高吞吐、低成本的推理场景。

为什么 o 系列要单独分一类

推理模型和通用对话模型的差别,在于回答前多了一段内部思考。通用模型倾向于”直接给答案”,推理模型会先生成一条较长的中间推导,再做收敛输出。这个差别在数学证明、多步代码修改、需要规划的任务上会被显著放大——因为这些任务的难点从来不是最后一句话,而是中间那十几步。

o 系列正是沿着这条路线迭代:从第一代强调”慢思考”,到 o3/o4-mini 把工具调用与视觉感知也纳入推理过程,模型的能力边界从”文本推演”扩展到了”边查边算边看”。

o3:把图像放进推理链意味着什么

从”看到图”到”用图思考”

过往的多模态模型处理图片,通常是先单独抽特征,再把特征塞进文本对话里。o3 的做法不同:图像直接进入思维链,且与网页浏览、Python 执行、图像理解与生成等工具一同被模型自主调度。官方表述是这在行业中尚属首次。

带来的实际变化是,模型可以在推理过程中反复”回头看图”——例如核对一张图纸里的标注、对照一道几何题的辅助线、检查表格里的某一列数值。这类操作以前需要用户手动多轮追问才能补齐。

工具自主调用

o3 能够自行决定是否调用 ChatGPT 的全部工具,而不是等待用户指定。对使用者来说,最直观的体感是一次提问可以闭环:需要数据时自己去查,需要计算时自己跑代码,需要示意时自己生成图。当然,自主调用也意味着要留意它的执行路径是否合理,尤其在购买、下单这类不可逆操作上。

MMMU 82.9%:这个分数该怎么读

MMMU 考察的是大学学科级别的视觉理解——图表、公式、乐谱、化学结构、医学影像都可能出现,题目本身也需要专业背景。官方数据显示 o3 在该基准上的准确率为 82.9%,前代 o1 为 77.6%。

需要提醒的是,榜单分数与真实业务表现不是一回事。MMMU 提升说明的是”跨模态的学科级理解”这块短板在被补齐;如果你的任务集中在业务流程而非学科题解,更靠谱的做法是拿自己的样例集跑一遍回归。

o4-mini:为吞吐和成本而生的那一档

o4-mini 是一款更小型的推理模型,设计目标明确:快、省、够用。官方称它在数学、编程与视觉任务上表现突出,是 2024 与 2025 两届 AIME 数学竞赛中表现最好的模型,整体优于前代 o3-mini,尤其在高吞吐场景中占优。

AIME 这类竞赛题的价值在于不存在记忆性取巧——题目每年都换,考的是现场推导。因此这个成绩可以作为”推理链是否扎实”的一个侧面参考。选型时可以粗略按以下思路切分:

  • o3:适合难题、跨模态题、需要自主调用多工具一次闭环的任务,愿意为质量支付更高延迟与成本。
  • o4-mini:适合批量、格式固定、对延迟敏感的任务,例如大量题目批改、样本级代码审查、常规模板化分析。

可用范围与模型替换关系

项目 说明
发布时间 2025 年 4 月 16 日
可用人群 ChatGPT Plus / Pro / Team 当日可见;Enterprise 与 Edu 一周内开放
被替换模型 o1 与 o3-mini 从模型选择器中退场
同期发布 开源编程智能体 CodeX CLI
关键评测 o3 在 MMMU 上 82.9%,o1 为 77.6%
o4-mini 定位 高吞吐、低成本,AIME 竞赛表现最佳

这里有个容易被忽视的细节:旧模型从选择器消失,意味着依赖 o1 或 o3-mini 提示词的项目需要重新校准。推理模型对提示词的敏感度通常低于通用模型,但输出长度、思考时长和工具调用习惯仍有差异,迁移时应重新做一轮效果对比。

同期开源 CodeX CLI 的意义

OpenAI 在同一时间发布了开源命令行编程智能体 CodeX CLI。它的价值不在于”又一个终端助手”,而在于把 Agent 的调度过程本身开放出来:用户可以观察一个成熟的编程 Agent 究竟如何拆解任务、调用工具与回滚错误,也为本地代码库的智能化提供了可改造的底座。配合 o 系列的推理能力,编程任务的形态正在从”补全建议”转向”任务托管”。

常见问题(FAQ)

Q1:o3 和 o4-mini 该怎么选?

按任务性质划分:需要跨模态理解、自主多工具调用、追求最高质量的复杂任务选 o3;需要批量处理、对响应速度与成本敏感、格式相对固定的任务选 o4-mini。官方也明确 o4-mini 面向高吞吐场景。

Q2:”图像进入推理链”和我平时传图问问题有什么区别?

区别在推理过程中能否反复参照图像。以往图片多为一次性输入特征,o3 则把图像维持在思维链里,配合工具自主调用,可以在推导中间持续回看、对照,因此官方称这在行业内尚属首次。

Q3:原来的 o1 和 o3-mini 还能用吗?

按照发布时的安排,o3 与 o4-mini 会取代此前的选择器中的 o1 与 o3-mini。既有工作流需要同步做回归测试,尤其是依赖旧模型输出格式的下游解析逻辑。

小结

o3 与 o4-mini 的组合,本质上是把推理模型分成”质量优先”与”吞吐优先”两条产品线:前者用图像入链和工具自主调用去攻克复杂任务,后者用更小体积去覆盖批量场景。对开发者来说,更实际的做法不是追问谁是当下最强,而是把自己手上的任务集拆开——少量难题交给 o3,大量常规题交给 o4-mini,再按真实通过率调整比例。