Claude Opus 5.5 正式发布:追平 Fable 5.1,输入 4 美元输出 20 美元,典型负载成本降 40%

9 月 22 日,Anthropic 正式发布 Claude Opus 5.5。这是 Claude 5.5 家族的第一款模型,也是 昨天内测信息曝光之后落地的正式版本。三个数字可以先记下来:多数任务达到 Fable 5.1 的水平,典型工作负载下成本比 Opus 5 低 40%,输出速度快 30% 以上。API 定价降到输入 4 美元、输出 20 美元每百万 token,缓存读取降到 0.20 美元。

有意思的是时间点。十天前 Amodei 刚公开呼吁放慢前沿模型的推进节奏,十天后 Anthropic 就拿出了它迄今最强的公开模型,还顺手降了价。这两件事看着矛盾,但看完这次的做法会发现,它们其实指向同一个方向。

先把基本盘摆清楚

价格:降 20%,但大刀砍在缓存上

输入从 5 美元降到 4 美元,输出从 25 美元降到 20 美元,各降 20%。真正影响账单的是缓存,读取从 0.50 美元降到 0.20 美元,降幅 60%,写入从 6.25 美元降到 5 美元。对长会话的智能体来说,缓存读取才是成本大头,这一项的杀伤力远大于输入输出那 20%。

另外还有一个 fast mode,在 Claude Code 和 Claude Platform 里可用,速度最高 2.5 倍,代价是输入 8 美元、输出 40 美元每百万 token。

规格与档位

上下文窗口 100 万 token,最大输出 12.8 万 token,知识截止 2026 年 6 月,这几项和 Fable 5.1 一致。变化在思考模式:Opus 5.5 采用自适应思考,而且不再允许关闭,effort 档位从 low 到 max,默认停在 medium。

上线平台

Claude 应用、Claude Code,以及 API 的 claude-opus-5-5。同时同步上线 AWS、Google Cloud 和 Microsoft Azure,三家互为竞争对手的云同一天拿到模型。Sonnet 5.5 和 Haiku 5.5 会在未来几周跟进,同样的降幅会沿产品线向下传导。

跑分:领先,但不是横扫

下面这组数据来自 Anthropic 的发布表,除特别说明外,Opus 5.5 的成绩都在 max effort 最高档、且开启生产安全防护的情况下测得。

评测 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Terminal-Bench 4.0(智能体编码) 66.4% 55.8% 52.3% 57.9%
FrontierCode v1.1(可合并代码) 54.4% 50.3% 48.0% 53.3%
CursorBench 4.0(多文件编码) 57.8% 51.8% 46.6%
GDPval-AA v2.1(知识工作,Elo) 1846 1735 1708 1542
AutomationBench(业务流程) 40.0% 31.4% 26.9% 41.4%
Humanity’s Last Exam(带工具) 67.7% 65.6% 63.6% 57.2%
Terminal-Bench-Science 0.1 58.7% 52.6% 29.0% 64.6%
OSWorld 2.0(电脑操作,部分分) 81.8% 80.7% 74.0%
Chartography(图表识别) 89.0% 88.4% 83.4%

有三点我核对后觉得需要单独说明。

第一,它没有全赢。GPT-6 Astra 在 Terminal-Bench-Science(64.6% 对 58.7%)和 AutomationBench(41.4% 对 40.0%)上仍然领先。科研类任务目前还是 OpenAI 的主场,这一点和 Grok 4.7 与 Fable 5.1 的全对比里看到的格局一致。

第二,Anthropic 自己给这组数字泼了冷水。官方原话是”在我们自己的实际使用中,Opus 5.5 和 Fable 5.1 的差距比这些分数显示的要小”。而且几乎所有 Opus 5.5 的成绩都跑在最贵的 max effort 档,默认档是 medium,实际使用体验会更接近而不是更拉开。

第三,电脑操作的进步很小。OSWorld 从 80.7% 到 81.8%,Chartography 从 88.4% 到 89.0%,都只有一个点。如果你主要拿模型当桌面操作员用,这次升级的体感会明显弱于写代码的人。

独立第三方的口径也差不多:发布当天 Artificial Analysis 智能指数给 Opus 5.5 打了 58 分,领先 Fable 5.1 和 GPT-6 Astra 的 53 分五分。

真正的主角是每任务成本,不是每 token 价格

降价 20% 只是表面。Anthropic 敢说”典型负载成本降 40%”,靠的是两件事叠加:单价更低,加上完成同一个任务消耗的 token 更少。

最能说明问题的是这组对照。在默认 medium 档下,Opus 5.5 在 FrontierCode 上拿 54.4%,已经超过 GPT-6 Astra 最高档的 53.3%,而单题成本只有后者约五分之一。在 CursorBench 上,medium 档拿 52.5%,比 GPT-5.6 Sol 的最好成绩高 11 分,成本约为三分之一。换句话说,对手要开满算力才勉强追得上它的默认档。

现场数据比跑分更直观:

  • 有测试者完成了一次 68 万行代码迁移,不到一天;
  • 另一位审计并修复 20 万行代码库,用了不到 3 小时,Opus 5 做同样的事需要 20 小时以上,消耗 2.5 倍 token;
  • Anthropic 内部把 HAProxy 从 C 移植到 Rust,Opus 5.5 用 9.5 小时,Fable 5.1 用 12 小时,两者都几乎通过了全部回归测试,而 Opus 5.5 成本低 51%。这个类别的工程难度可以参照 GitHub Copilot 运行时移植 Rust 的实录,43 万行 TS 变 80 万行那种量级,之前是很难交给模型自己跑完的;
  • Deloitte 报告称,Opus 5.5 在最低 effort 档抓到 72% 的已知审查缺陷,Opus 5 在高档位只抓到 56%;
  • Box AI 用 Opus 5.5 干同样的活,token 消耗约为原来的三分之一。

安全:重点不是更听话,而是会分流

作为 pacing call 之后的第一个模型,安全被摆在了前所未有的位置。Anthropic 称 Opus 5.5 在其迄今最全面的内部对齐评估中拿到历史最好成绩,在一项新的越界遏制测试中,尝试绕过既定边界的频率比 Opus 5 低约 85%。发布前 METR 和 Frontier Design 参与了外部评估——Anthropic 这两年在外部评估上的投入不小,此前还承诺过五年投 10 亿美元做外部安全评估

不过官方也坦诚提了一句:这个模型经常能察觉自己正在被评估。这让真实世界行为的判断变得更难,读安全数据时需要把这个变量算进去。

模型路由:本次最需要工程关注的变化

因为 Opus 5.5 在生物学和网络安全上的能力已经接近受限的 Mythos 5.1 层级,它启用了与 Fable 5.1 同级的安全防护,而防护的方式不是简单拒绝,是转交给旧模型

触发类型 实际处理模型
常规代码 bug 定位与修复 Opus 5.5 正常处理
多数网络安全任务 转交 Opus 4.8
生物学 / 前沿 LLM 开发相关 转交 Opus 5

这意味着你发给 claude-opus-5-5 的请求,实际可能是由 Opus 4.8 或 Opus 5 完成的。在多轮 agent 工作流里,不同步骤之间的模型能力会不一致,而这种不一致很可能不会出现在”假设每次调用都是同一个模型”的评测里。这是我认为这次发布里最容易被忽略、但工程上最需要处理的一点。

Anthropic 给了两条申请通道。网络安全方向,Cyber Verification Program 将扩展到 Opus 5.5,分三个信任等级,最高档可访问 Claude Mythos 系列;生物方向新设 Life Sciences Verification Program,面向学术实验室、初创公司和药企,通过审核后可解除生物学分类器限制。

另外三项会影响集成的变更

  • preserved thinking:阻止 API 用户通过编辑历史上下文套取模型推理过程,用于对抗规模化蒸馏攻击。适用于 2026 年 8 月 31 日及之后创建的 API 账户,依赖编辑历史上下文的集成需要改造;
  • 思考模式不再允许关闭
  • 输出加水印,用于满足欧盟 AI 法案合规要求。零数据保留仍可用。

放慢与发布,矛盾吗

不矛盾,但它们之间的缝隙藏着这次发布的真实意图。Amodei 的 pacing 倡议针对的是一类更窄的系统,那些可能自动化 AI 研发本身、从而跑赢人类监督者的模型。Opus 5.5 提供的是一条更便宜更快地去完成 Fable 5.1 已经能做到的事的路径,它的安全边界反而比前代更紧。

换句话说,突破性能力在 9 月 1 日随 Fable 5.1 和 Mythos 5.1 已经放出来了,Opus 5.5 做的是把这些能力的单位成本压下来,然后推给尽可能多的开发者。对比 Opus 5 发布时”价格仅为 Fable 5 一半”的打法,这次是同一套思路的延续,只是力度更大。

节奏上也印证了这一点。4 月 Opus 4.7,7 月下旬 Opus 5 传闻,9 月 22 日 Opus 5.5,迭代周期已经压进一个季度以内。三云同发则是渠道选择而非技术选择——对上市前夜的 Anthropic 而言,把推理调用铺开、把营收曲线推陡,比绑定任何单一云更重要。至于价格战的战场,也已经从每百万 token 的单价,转移到了每任务的总消耗。这个维度上,闭源模型反而不怕开源模型的价格优势。

常见问题

现在该换到 Opus 5.5 吗

如果你在跑编码或知识工作类任务,值得换。Anthropic 的模型指引已经把 Opus 5.5 设为多数场景的起点,只有在更高 effort 下 Opus 5.5 仍不够用时才建议上 Fable 5.1。如果你的主要场景是桌面操作自动化,提升只有一个点,可以先观望。

为什么我的请求被降级到旧模型

触发了安全分类器。网络安全类任务多数会转交 Opus 4.8,生物学和前沿 LLM 开发相关会转交 Opus 5。常规代码 bug 定位与修复不受影响。如果需要完整能力,可以申请 Cyber Verification Program 或 Life Sciences Verification Program。

思考模式还能关吗

不能。Opus 5.5 不支持关闭 thinking,只能调 effort 档位,从 low 到 max,默认 medium。想在成本和速度上做取舍,调档位是现在唯一的旋钮。

思考模式的 effort 该怎么选

默认 medium 是新的性价比甜点。官方自己的数据显示,medium 档在 FrontierCode 上拿 54.4%,已经压过 GPT-6 Astra 最高档的 53.3%,成本只有约五分之一。Deloitte 的案例也说明,代码审查这类任务在最低档就能拿到比前代最高档更好的结果(72% 对 56%)。建议对自己的主场景做一轮档位-成本-质量扫描,而不是一律拉满。

Sonnet 5.5 和 Haiku 5.5 什么时候来

官方说法是”未来几周”,同样的降幅会沿产品线向下传导。这意味着 5.5 是一次完整的产品线换血,Opus 5.5 只是开场。订阅侧同步有变化,Pro、Max、Team 及席位制 Enterprise 的 5 小时额度上调约 20%,用户还获得一次速率限制重置,可在 10 月 22 日前任意时刻使用。

小结

Opus 5.5 不是一次能力上限的跃迁,而是一次成本结构的重做。它把 Fable 5.1 级别的能力压到了四美元输入、二十美元输出的价格上,同时给敏感能力套上了可路由的安全笼子。真正值得追问的问题不是它跑分多少,而是当顶级能力被压到这个价格之后,”前沿模型”这个词还剩下多少稀缺性。Anthropic 用一次降价 40% 的发布给出了自己的答案:它现在卖的不是能力上限,而是能力的可负担性。


消息来源

本文跑分数据以厂商公布为准,实际表现随任务类型与 effort 档位设置而异。数据截至 2026 年 9 月 23 日。

相关阅读