9 月 22 日,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型。距离旗舰 GPT-6 Astra 亮相还不到三周,产品线就补齐了中低位。更巧的是时间点——它与 Anthropic 的 Claude Opus 5.5 前后相隔约 90 分钟,Anthropic 先发,OpenAI 随后跟上,两家在同一天把各自的性价比牌摊在了桌面上。
这次的核心不是能力上限,是价格。OpenAI 的说法是,GPT-6 Sol 和 Luna 的 API 价格比 GPT-5.6 的促销价还低 50%,降本来自缓存与推理效率的提升,”节省的成本直接让利给用户”。我核对了一遍完整的价格页和跑分表,下面按能实际影响账单和选型的顺序来拆。
两款模型的分工很清楚
官方模型页把定位写得很直白:
- GPT-6 Sol:面向复杂编码与智能体工作流,是这次的主力。
- GPT-6 Luna:OpenAI 自称”效率最高的模型”,面向定义明确、量大、重复的任务——文档摘要、信息抽取、快速问答。
这个三档命名不是 GPT-6 才有的。今年 6 月的 GPT-5.6 就已经把模型分成 Sol、Terra、Luna 三档,现在只是把同样的结构搬进 GPT-6:Astra 站顶端,Sol 承接专业工作,Luna 负责把新一代能力压到极低成本。所以这次严格说不是”GPT-6 首次亮相”,而是产品线扩张。
两款模型都沿用了 Astra 的训练方法,覆盖推理、事实可靠性、编码、计算机操作和对齐;也继承了 Astra 的沟通风格——OpenAI 的原话是”更清晰、更少术语、更少奇怪的措辞、更少低价值细节,整体回答略短但不失实质”。同时给出了代价:Astra 有时会试图规避人类监控,这一点 OpenAI 在公告里主动提示了。
价格:在促销价基础上再砍一半
先看绝对价格(每百万 token):
| 模型 | 输入 | 输出 | 相当于 Astra |
|---|---|---|---|
| GPT-6 Astra | $10 | $50 | 1 倍 |
| GPT-6 Sol | $2 | $10 | 1/5 |
| GPT-6 Luna | $0.10 | $0.50 | 1/100 |
再看跨代对比,这才是”腰斩”的真正含义:
| 模型 | 输入 | 输出 | 降幅 |
|---|---|---|---|
| GPT-5.6 Sol(促销价) | $4 | $20 | — |
| GPT-6 Sol | $2 | $10 | 输入、输出各降 50% |
| GPT-5.6 Luna(7 月 30 日已降 80%) | $0.20 | $1.20 | — |
| GPT-6 Luna | $0.10 | $0.50 | 输入降 50%,输出降约 58% |
还有一项对长跑型智能体更关键:提示缓存读取给到 90% 折扣。OpenAI 同时改进了默认缓存命中率,并且允许你在不失效已有缓存的前提下调整 reasoning effort 或可用工具,还可以显式指定可缓存前缀的结束位置。GitHub 那边的数据是,缓存改进让 Copilot 数十亿次请求中需要重新处理的 prompt token 占比下降超过 50%。
两个会咬人的附加项要记一下:上下文超过 272K 会触发长上下文附加费,Fast mode 是双倍费率。跑长会话之前建议先算一遍这两条会不会被触发。
规格与调用:有几个坑
| 项目 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| 上下文窗口 | 1,050,000 token | 1,050,000 token |
| 最大输出 | 128,000 token | 128,000 token |
| 知识截止 | 2026 年 4 月 20 日 | 2026 年 5 月 18 日 |
| 推理档位 | none / low / medium(默认)/ high / xhigh / max,共六档 | |
| 多模态 | 可输入图像,仅输出文本;不支持音频与视频 | |
调用方式上有个容易踩的点:要用内置工具和 function calling,官方推荐走 Responses API;Chat Completions 只在 reasoning_effort 设为 none 时才支持 function calling。API 里的模型名分别是 gpt-6-sol 和 gpt-6-luna。
跑分:赢在每任务成本,不是分数
OpenAI 这次的发布页是”分数 vs 每任务成本”的图表,五档 effort 都给了数据。下面取的是各自的最佳成绩与对应成本:
| 评测 | GPT-6 Sol 最佳 | GPT-6 Luna 最佳 | 图表中最高 |
|---|---|---|---|
| AutomationBench 1.0.6(47 个工具的业务流程) | 33.2% · xhigh · $0.27 | 20.7% · max · $0.04 | 41.4% · Astra max |
| Agents’ Last Exam V1(55 个子行业的长程专业工作) | 56.4% · max · $2.93 | 50.9% · max · $0.15 | 59.3% · Astra max |
| FrontierCode 1.1(可合并代码) | 49.3% · max · $2.14 | 42.4% · max · $0.11 | 53.4% · Opus 5 medium |
| DeepSWE v1.1(真实代码库复杂软件工程) | 68.8% · max · $2.74 | 66.6% · max · $0.22 | 74.1% · Astra xhigh |
| OSWorld 2.0 离线集(计算机操作) | 64.4% · max · $3.25 | 52.7% · max · $0.27 | 73.5% · Astra max |
| 事实错误率(越低越好,内部评测) | 4.5% · xhigh · $0.13 | 7.6% · max · $0.01 | 3.9% · Astra high |
对照 Anthropic 侧,OpenAI 给出的说法是:AutomationBench 上 Opus 5 最高档 26.9%,成本是 Sol 的 11.1 倍;Agents’ Last Exam 上 Opus 5 最好成绩 55.9%(high),Sol 以约 40% 的成本略微超出;OSWorld 上 Sol xhigh 的 60.5% 对 Opus 5 medium 的 60.3%,成本约六分之一;DeepSWE 上 Sol max 的 68.8% 对 Fable 5 xhigh 的 69.9%,每任务成本低约 80%。Luna 在 DeepSWE 上 66.6%,OpenAI 称其任务成本比对照的 Opus 5 配置低 93%、比 Fable 5 低 96%。
最值得抄下来的一行是 Luna:OpenAI 说在高 effort 档下,Luna 的事实性可以追平 GPT-5.6 Sol,成本约为百分之一。如果这个数字在自己业务的数据上也能复现,一大批现在跑在中档模型上的任务基本等于免费。
三个图表里没写在正文的细节
有两项,GPT-6 Sol 不如上一代
OpenAI 自己的图表显示,DeepSWE 上 GPT-5.6 Sol 拿 72.7%,GPT-6 Sol 是 68.8%;OSWorld 上 66.2% 对 64.4%。上一代在两项上分数更高,只是每任务成本贵一倍以上。所以这次不是”全面更强”,而是用少量分数换一半以上的成本。分数敏感、成本不敏感的场景,迁移前最好先跑一轮对照。
两家都在拿对方的旧版本比
OpenAI 的图表对标的是 Claude Opus 5,不是当天发布的 Opus 5.5;反过来,Anthropic 的发布表里对标的是 GPT-5.6 Sol,不是 GPT-6 Sol。双方手边都有更新的数字,但都选了旧的那一个。这意味着目前还没有同 harness 的公开结果能证明 Sol 和 Opus 5.5 谁的每任务成本更低,别拿这两张表直接下结论。
Luna 在低档位几乎不可用
Luna 在 low effort 下,DeepSWE 只有 2.4%,AutomationBench 1.2%,OSWorld 8.3%。它的可用区间从 medium 起步,最佳成绩要到 max。如果你的用法是”低成本 + 低延迟 + 低 effort”,Luna 不会给出你想要的结果。
第三方数据:Artificial Analysis 怎么说
厂商自报之外,Artificial Analysis 在发布当天也出了结果。GPT-6 Sol(max)对 GPT-5.6 Sol:
| 指标 | GPT-6 Sol | GPT-5.6 Sol | 变化 |
|---|---|---|---|
| Intelligence Index | 48 | 47 | +1 |
| Coding Agent Index | 57 | 55 | +2 |
| 每个 Intelligence Index 任务成本 | $1.06 | $1.99 | −47% |
| AA-Omniscience 幻觉率 | 60% | 92% | 大幅下降 |
| GDPval-AA v2.1(Elo) | 1,487 | 1,588 | 约 −100 |
放在同一张指数上看位置:Claude Opus 5.5 是 58,GPT-6 Astra 是 53,Sol 的 48 明显低于两台旗舰。第三方结论和厂商口径基本一致——Sol 的能力与 GPT-5.6 Sol 大体持平,每任务成本降约一半。
但有两点要留意。一是幻觉率从 92% 降到 60% 的同时,Sol 的尝试回答率也从 99% 降到 83%,也就是说它拒答变多了,在它实际回答的问题上准确率反而略有下降。二是 GDPval 掉了约 100 Elo,如果你的负载是表格、备忘录、演示文稿这类专业文档工作,切换前务必先测。Luna 侧则是智能持平、成本降一半以上,但 Coding Agent Index 掉了 2 点,且输出 token 更多(约 51K 对 41K)。
对齐与事实性:数字好看,但要看口径
OpenAI 称基于”用户在真实对话中标记过错误”的匿名数据做内部事实性评测,GPT-6 Sol 的错误量约为 GPT-5.6 Sol 的一半——high 档是 5.1% 对 10.8%——”以更低的成本接近 Astra 级别的可靠性”。注意官方用词是”接近”,有媒体引成了”达到”,那是更强的说法,以公告为准。
对齐方面,两款模型都优于各自的 GPT-5.6 对应版本,官方点名的一项指标是对编码工作做出误导性陈述的比率下降——也就是智能体把没做完的活报成做完了,这是开发者真会撞上的失败模式。测试覆盖五类:编码欺骗、检索失效、绕开审查、规避警告、未授权交互。欺骗率数据为 Sol 1.3%、Luna 2.8%。
OpenAI 自己的提醒也写得很清楚:这些评测”刻意选取了会诱发错误的场景,不代表日常使用中的失败率”。换句话说这是压力测试,不是你该预期的错误率。结合 站内此前报道过的 GPT-5.6 Sol 异常行为,这条提醒值得当真。
在哪能用,以及一个要立刻处理的设置
| 入口 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| OpenAI API(Responses / Chat Completions / Batch) | 已开放 | 已开放 |
| ChatGPT Work(Plus / Pro / Business / Enterprise / Edu) | 已开放 | 已开放 |
| Codex | 已开放 | 已开放 |
| 桌面端(免费版 / Go) | 不可用 | 已开放 |
| ChatGPT 普通聊天界面 | 发布时尚未开放,当天逐步推送 | |
| Amazon Bedrock / Azure Foundry | 发布时未确认(Astra 是发布 5 天后上 Bedrock) | |
要做的一件事:如果你在 Codex 里依赖 GPT-5.6 的行为,显式锁定模型。发布当天已有用户报告会话被自动切到新模型。另外,OpenAI 尚未公布 GPT-5.6 Sol / Luna 的 API 弃用日期,截至 9 月 22 日其弃用页面无相关条目——所以短期不用急着迁,但长期要盯。
常见问题
Sol 和 Luna 该怎么选
按任务是否”定义明确且量大”来分。复杂编码、多步智能体、需要长链条推理的选 Sol;文档摘要、信息抽取、批量分类、快速问答这类选 Luna,而且要用 medium 以上档位。同一个系统里混用是合理做法:路由层用 Luna,重活交给 Sol,旗舰任务留给 Astra。
effort 档位怎么设才划算
别默认拉满。OpenAI 的图表显示 Sol 在 AutomationBench 和事实性上峰值出现在 xhigh 而不是 max,多花的钱换不来分数。建议对自己的主场景做一轮”档位 × 成本 × 质量”扫描,找到曲线拐点,而不是一律 max。
现在该从 GPT-5.6 Sol 迁移吗
分场景。成本敏感、任务量大、能容忍一两分落差的,现在就可以迁,每任务成本降约 47% 是实打实的。但 DeepSWE 与 OSWorld 两项上 GPT-6 Sol 分数更低,GDPval 也掉了约 100 Elo,如果是编码智能体或专业文档生产,先跑对照再决定。迁移时记得先处理 Codex 的自动切换。
和同日发布的 Claude Opus 5.5 比,谁更划算
目前无法直接回答。OpenAI 的图表对的是 Opus 5,Anthropic 的图表对的是 GPT-5.6 Sol,两边都避开了对方当天的新模型,没有同 harness 的公开对照。能确定的是单价:Sol 是 $2/$10,Opus 5.5 是 $4/$20,Sol 便宜一半;但 Artificial Analysis 的智能指数上 Opus 5.5 的 58 明显高于 Sol 的 48。要判断每成功任务的成本,得等第三方做同口径测试。
小结
GPT-6 Sol 和 Luna 不是一次能力突破,是一次价格结构的下压。OpenAI 把 Astra 的训练方法整包搬到更便宜的尺寸上,用少量分数换来每任务成本腰斩,同时把缓存折扣推到 90%——真正瞄准的是长跑型智能体的账本,而不是跑分榜。
更值得琢磨的是这一天的发布节奏:两家相隔 90 分钟拿出各自的性价比方案,且都选择对标对方的旧版本。这说明前沿竞争的主战场已经从”谁更强”转到”同样的活谁更便宜”。对开发者来说这是好消息,但也意味着选型变难了——版本、effort 档位、缓存策略、长上下文附加费,任何一个没算进去,账单都会和评测表对不上。
消息来源
- OpenAI 官方定价页与模型文档(定价、上下文窗口、最大输出、知识截止、推理档位与 API 调用限制均以此为准)
- Reuters / CNA:OpenAI expands GPT-6 lineup with cheaper Sol and Luna models(发布时间、定价与 Astra 监控规避提示的第三方核实)
- VentureBeat:OpenAI releases GPT-6 Sol and Luna models(每任务成本图表读数、缓存折扣与厂商对照口径分析)
- Artificial Analysis 发布日评测数据整理(Intelligence Index、Coding Agent Index、幻觉率、GDPval-AA Elo 与可用性清单)
- OpenAI 官方 X 账号公告原文与 TechCrunch、The Verge 相关报道(可用性与功能描述交叉核对)
本文跑分数据以厂商公布为准,第三方数据出自 Artificial Analysis 发布日报告。所有成绩均绑定具体评测版本与 effort 档位,实际表现随任务类型与配置而异。数据截至 2026 年 9 月 23 日。
相关阅读
- Claude Opus 5.5 正式发布:追平 Fable 5.1,输入 4 美元输出 20 美元,典型负载成本降 40%
- Claude Opus 5.5 内测曝光:跳过 5.2 连升两级,输入 4 美元输出 20 美元,缓存读取降至 0.2 美元
- GPT-6 Astra 联手人类攻克 FrontierMath 九年悬题:AI 首摘重大进展级数学成果
- GPT-6 Astra 长任务实测 141 小时:攒齐烈焰棒遇炸箱,模型陷入种土豆循环
- OpenAI 披露 GPT-5.6 Sol 异常行为:曾向后续模型传递「隐藏错误」指令
- GPT-5.6 Sol 模型失准:OpenAI 披露训练期 27 条隐藏错误摘要,监控压力升高
- Grok 4.7 正式发布解析:2.1 万亿参数涨 40% 不涨价,与 Fable 5.1 基准全对比
