Claude Sonnet 5.5 正式发布:比 Sonnet 5 快 30%、便宜 30%,API 字符串 claude-sonnet-5-5

Anthropic 把 Sonnet 5.5 推上了正式版。

昨天灰度配置项才被逆向出 Claude Sonnet 5.5 灰度现身(输入 2 美元输出 10 美元),不到 24 小时官方就把定价、客户案例、API 字符串完整公布。Sonnet 5.5 是 Claude 5.5 系列的第二款,上一款是 9 月 22 日发布的 Opus 5.5(输入 4 美元输出 20 美元,成本比 Opus 5 低 40%)。Anthropic 给 Sonnet 5.5 的定位是 Opus 5.5 的更快、更低成本版本。

5.5 系列第二款 补足 Opus 5.5 的成本空白

Sonnet 5.5 是给高频工作负载做的补充,Opus 5.5 留给最难的推理任务。两个模型在不同 cost/quality 区间分工,从属关系比较弱。官方公告里写明 “Sonnet 5.5 is a faster, lower-cost complement to Opus 5.5”,适用面是 well-scoped everyday tasks across coding, agents, and knowledge work。

118 个真实 app 构建的客户案例可以参考。在相同质量条线下,Sonnet 5.5 与 Opus 5 持平,平均 3.6 次迭代完成构建,Opus 5 需要 7.7 次。Sonnet 5.5 在质量上没比 Opus 5 强,只是在同样质量线下 token 用得更少。另一位跑了 2,441 个金融任务的 Senior AI Engineer Joe Poirier 给出了更具体的数字:Sonnet 5.5 平均 121k tokens per answer,Sonnet 5 是 497k tokens per answer,七个候选模型里 Sonnet 5.5 的 quality-to-cost 比例最高。

价格 $2/$10 per million tokens,比 Sonnet 5 便宜 30%

官方给出的标准价如下。

  • 输入 $2 per million input tokens
  • 输出 $10 per million output tokens
  • Prompt caching 最高 90% 折扣
  • Batch processing 50% 折扣
  • US-only 推理 input/output 统一 1.1x 加价

对照 Sonnet 5 的 $3/$15 per million tokens,表面上便宜 30%。叠加 prompt caching 后最高可以做到原价的 10% 左右,前提是请求结构允许缓存命中。一个 90% 的折扣听上去很夸张,但 Anthropic 的 prompt caching 命中率在实际工作里很少跑到 90%,50%-70% 是更现实的预估区间。Batch processing 50% 折扣适用于异步、不要求实时回应的批量任务,通常用于离线数据清洗、夜间回填、向量化预生成这类工作。

Anthropic 没在公告里给出 Sonnet 5.5 的 context window 与 max output 数字。截至 9/29,platform.claude.com 还没把 Sonnet 5.5 独立建模条目列出来,按惯例可能是 Sonnet 5 同档(200K context、8K output),但这一点需要确认。

Sonnet 5.5 vs Opus 5.5 vs Sonnet 5 三档对比

把这次新发布的两款 5.5 系列与上一档 Sonnet 5 放在一起看,定位差异更清楚。

维度 Sonnet 5 Sonnet 5.5 Opus 5.5
输入 $/M tokens 3 2 4
输出 $/M tokens 15 10 20
相对 Sonnet 5 速度 基准 快 30% 未公开(慢于 Sonnet 5.5)
CursorBench 4.0 未公开 55.5% 领先 Sonnet 5.5
Slack 14% token 节省 基准 14% 减少 未公开
典型负载成本 基准 便宜 30% 比 Opus 5 低 40%
主线场景 通用编码/agent 高频长链路编码 最难推理/复杂规划

三档关系可以这么理解:Sonnet 5 是上一代的 default,Opus 5.5 是上限,Sonnet 5.5 是把高频批量负载从 Opus 5.5 接过来的中间档。Anthropic 这次选择先发 Opus 5.5、再发 Sonnet 5.5 的顺序,本身就是承认 Sonnet 5.5 是给 Opus 5.5 让出空间后留下的 cost-sensitive 客户。

编码与长程任务 Cursor 55.5%、Slack 14% 减负、118 app 3.6 迭代

官方没发 SWE-bench 这种公开基准的成绩,但客户案例给出的数据足够判断使用面。

  • Cursor CursorBench 4.0 拿到 55.5%,仅次 Opus 5.5(Cursor 自己的 Director of ML Sualeh Asif 数据)
  • Slack 不改动 prompt 的情况下,Sonnet 5.5 在几乎所有离线 Slackbot 评估上都优于 Sonnet 5,输出 token 减少约 14%
  • Unity 90% 任务在多步 Unity Editor 与编码基准上完成
  • 金融公司 2,441 个金融任务中,Sonnet 5.5 平均 121k tokens/answer,Sonnet 5 是 497k tokens/answer。同样质量下 token 节省约 75%
  • 客服场景 工单处理比当前生产 Claude 模型快 20%
  • 未具名编码用户 完成同一任务的 tool call 比 Sonnet 5 少 1/3,shell 执行约半数

其中 Slack 的 “14% 减负” 是这次发布里最被低估的一个数据点。Slack 的 Principal Engineer Curtis Allen 强调这 14% 是在不改动任何 prompt 的前提下拿到的,意味着迁移成本是零。”Sonnet 5’s tendency to reach for web search too often and its high token use are both gone” 是另一家未具名公司的评价,这指向 Sonnet 5 在 agent 场景里有一种过度调用 web search 的倾向,Sonnet 5.5 已经修了。Unity 的 90% 任务完成率建立在他们的内部多步 Unity Editor + coding benchmark 上,适合做游戏引擎层的工具集成参考。

工作负载是编码 + agent 长链路时,Sonnet 5.5 是目前 Sonnet 系列里 token 效率最高的一档。

Agent、设计、办公 四个场景的实际表现

Anthropic 这次把 Sonnet 5.5 的卖点拆成四块,每块都有具体动作描述。

Coding 代码库快速上手,scope 改动前先做边界控制,edit 保持小颗粒可 review。日常开发、bug 修复、code review 三类场景都能接住。

Agents 长期任务上 Sonnet 系列最强,token 用得少,适合反复跑。一位跑过数百万次 AI 动作的客户说 teams can run their agents up to 30% faster than they could with Sonnet 5。

Design and visual work UI polish、结构化图表、user flow 生成都能干,按模板做 slides 也只需要最少编辑。

Enterprise workflows 知识工作与办公任务(分析、文档、slides)写作更直接、初稿需要的清理更少。这块和之前讨论过的 Claude 写作退化真相:训练写给 AI 看,Opus 5.5 找回平衡 是同一脉络,Sonnet 5.5 也沾了 Opus 5.5 的写作升级。一位 Designer Tyler Nishida 的评价是 “got some of Opus 5.5’s natural writing upgrades”,意思是 Sonnet 5.5 在写作上不再像 Sonnet 5 那种过度优化 AI-detection 分数的语感。

四个场景里客户被引用最多的是 Slack、Cursor、Unity 三家,剩下的是金融、客服、医疗这类强约束行业。Anthropic 这次没公开 SaaS 行业客户的引用,理由大概率是金融医疗这类强监管行业的 Sonnet 5.5 用例更能说明 model alignment 进度,SaaS 客户的引用留到下次发布会。

迁移注意 5 类 break 与 thinking effort 调整

代码本来是给 Sonnet 5 写的,换到 Sonnet 5.5 可能以 5 种方式出问题(来自 Anthropic platform release notes)。

  1. 关掉 “提前思考” 要用 thinking: {"type": "between_tools"} 而不是 "disabled",仅在 effort high 或更低时支持
  2. forced tool use 在 tool_choice 为 any 或 tool 时返回 400
  3. 思考块(thinking blocks)与模型 + 会话绑定,跨模型传递会被丢弃
  4. 旧的 computer_20251124 工具在 Claude API 与 Google Cloud 上不再被接受
  5. advisor 工具拒绝把 Opus 4.8、Opus 4.7、Sonnet 5 当作 advisor

Sonnet 5 → 5.5 特有的 break 主要是上面 5 条;跨 4.x → 5.x 迁移列表请单独查 release notes。第 1 条最容易踩坑:很多生产代码用 thinking: "disabled" 关掉 thinking 来省成本,5.5 上必须改成 between_tools,否则 thinking 不会被禁反而默认开启,token 用量会反向上涨。第 3 条对多模型协作场景影响最大,如果你的工作流里同时存在 Sonnet 5 与 Sonnet 5.5 的 thinking block,跨模型传递时 Sonnet 5.5 的 thinking block 会被丢弃,需要在前置流程里就分开存储。

怎么用 API 名 claude-sonnet-5-5,平台覆盖五个云

接入信息很直白。

  • API 字符串 claude-sonnet-5-5
  • 平台 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud、Microsoft Foundry
  • 终端用户 Claude.ai 网页、iOS、Android 都能直接聊天
  • 文档 模型页 + Prompting 指南 + System Card 都在 anthropic.com

需要 US-only 推理的工作负载(医疗、政府、金融合规)需要显式开启 1.1x 定价,这一项在 Anthropic API 的 header 里加一个字段,不开启默认走多区域推理。

常见问题

Sonnet 5.5 是不是直接替换 Sonnet 5? 不是替换,是补充。Sonnet 5 仍在 Claude API 中提供,Sonnet 5.5 是给 cost-sensitive 高频场景的额外选项。如果现有工作流稳定、不在意 30% 的成本节省,可以继续用 Sonnet 5。

什么时候升级最划算? 三个信号同时出现时建议升级:agent 工作流 token 成本占比超过 30%、prompt caching 命中率能稳定跑到 50% 以上、当前工作负载里有大量 well-scoped 编码任务。任何一条不满足,升级的 ROI 都不明显。

Sonnet 5.5 与 Sonnet 4.5 怎么选? 4.5 是 2025 年 9 月发布的上一代,SWE-bench Verified 当时领先,长链路 30+ 小时自主编码是它的招牌。Sonnet 5.5 没有公开 SWE-bench 数据,客户案例里的长链路数据是 118 app builds(数小时级别)。如果你的工作流依赖长程自主编码 30+ 小时这种极端任务,Sonnet 4.5 仍是 reference;如果是日均数百次的中等长度 agent 调用,Sonnet 5.5 在 token 成本上优势明显。

消息来源 Introducing Claude Sonnet 5.5(Anthropic 官方公告)

深度报道 Anthropic 招股书曝光 2025 年净亏 420 亿美元,招股书披露 Anthropic 2025 年净亏 420 亿美元、未来一年规划投入 5180 亿美元。

相关阅读