ChatGPT Images 2.0 发布:gpt-image-2 攻克文字渲染与多语言,Thinking 一次出 8 张

直接说结果:2026 年 4 月 21 日发布的新一代图像模型 ChatGPT Images 2.0(底层模型名为 gpt-image-2),最硬的升级是文字渲染达到生产可用水平非拉丁语种大幅改善,以及新增的 Thinking 推理模式——单次提示最多产出 8 张保持角色与物件一致性的连续图像。它通过 ChatGPT、Codex 与 API 三个渠道开放,基础版对所有 ChatGPT 与 Codex 用户(含免费用户)开放。

三个真正影响生产的能力点

文字渲染:小字、UI 元素与密集排版终于能用

文字扭曲、乱码是此前图像模型的通病,导致海报、包装、界面稿只能”先看效果、再回设计软件重排”。gpt-image-2 能够清晰准确地呈现小字、UI 元素、图标和密集排版,把这一步从”参考”推到了”可用”。

多语言:中文、日语、韩语、印地语、孟加拉语质变的价值

非拉丁文字的可用性,直接决定了本地化营销与出海广告能否跳过二次排版。实测方向的改善意味着文字可以作为设计的一部分被直接生成,而不是贴上去的装饰。

输出规格:3:1 到 1:3 全范围宽高比,API 最高 2K

模型支持从 3:1 超宽到 1:3 超长的宽高比区间,API 通道最高可输出 2K 分辨率(2K 以上仍处于 beta 阶段),基本覆盖了信息流竖版、横幅、方图等主流投放素材规格。

Thinking 模式:先思考,再作画

Thinking 模式把文本模型上已被验证的推理机制搬到了图像侧。开启后,模型会先推理布局逻辑、按需调用网络搜索获取实时信息、分析用户上传的参考材料,再开始生成图像。单次提示在该模式下最多产出 8 张连续图像,并保持角色与物件的一致性,适合漫画分镜、角色设定表、系列营销素材这类需要”成套输出”的任务。该模式下模型的知识截止时间更新至 2025 年 12 月。

开放策略与价格

档位 权益 价格参考
免费 / ChatGPT 基础版 基础版 Images 2.0 可用 免费开放
Plus Thinking 模式、批量连续生成、更高质量输出 20 美元 / 月
Pro 同上,更高配额 100 或 200 美元 / 月
Business 同上,按席位 25 美元 / 席位 / 月起
Enterprise 同上,定制 议价

API 侧按 token 计费:图像输入 8 美元 / 百万 tokens、图像输出 30 美元 / 百万 tokens、文本输入 5 美元 / 百万 tokens、文本输出 10 美元 / 百万 tokens。

折算到单张更直观,而且结论并不一致:大尺寸场景反而更便宜——1024×1536 高质量输出约 0.165 美元/张;但 1024×1024 标准高质量输出约 0.211 美元/张,比前代的 0.133 美元更贵。做批量生成时,尺寸选择会直接影响账单。

为什么它对标的是 Nano Banana Pro

OpenAI 这次选定的对照对象很明确:谷歌在 2026 年 2 月发布的 Nano Banana Pro(Gemini 3 Pro Image)率先推出了”图中密集文字”能力,Images 2.0 正是对着这一点正面对位。OpenAI 官方披露,ChatGPT 平台上每周有数亿用户生成超过 10 亿张图像,图像生成已成为 ChatGPT 最核心的多模态能力之一——这也是为何它把这次发布定位为”战略性设计系统”,而不是一个孤立的创意工具。

官方给出的目标应用场景包括本地化广告、信息图、教育内容、设计工具与创意平台。需要注意的是,该系列后续又有新版本迭代,选型时应按当前可用版本重新核对能力与价格。

常见问题 FAQ

Q1:免费用户能用Thinking 模式吗?

不能。基础版 Images 2.0 面向所有 ChatGPT 与 Codex 用户开放,Thinking 推理模式、批量连续生成与更高质量输出属于付费档权益。

Q2:2K 输出要额外付费吗?

2K 分辨率通过 API 可直接输出;2K 以上分辨率当时处于 beta 阶段。费用仍按 tokens 计算,建议使用前先小批量试跑核算成本。

Q3:相比 gpt-image-1.5 是变贵还是变便宜?

分尺寸看:1024×1536 这类大尺寸高质量输出约 0.165 美元/张,比前代更便宜;1024×1024 标准高质量约 0.211 美元/张,反而高于前代的 0.133 美元。

小结

Images 2.0 的意义在于把 AI 图像从”灵感生成器”推进到”交付工具”:文字可用、多语言可用、成套输出一致。真正决定你是否能用它省下设计工时的,是 2K 规格下的密集排版效果与多图角色一致性的实际表现——建议先用自己业务里最常见的几个版式跑一轮验证,再决定是否规模化替换原有流程。