Anthropic Opus 5.5发布:追平Fable 5.1,成本比上代低40%

Anthropic于2026年9月22日发布Claude Opus 5.5,这是Claude 5.5系列的第一款模型。与前代Opus 5相比,Opus 5.5在大多数工作上达到了Claude Fable 5.1的水平,而运行成本却降低了40%,输出速度快了30%以上。这是Anthropic CEO Dario Amodei发表”必须控制前沿发展”文章后发布的首款模型,也被视为该公司真正践行”效率优先”理念的开端。

一句话结论:Opus 5.5是目前最强大的企业级AI模型之一,用比前代低40%的成本实现了Fable级别的性能,适合处理最复杂的代理任务和长程工作流。

真实案例:68万行代码迁移,一天完成

基准测试数字固然重要,但更令人震撼的是Opus 5.5在真实企业工作流中的表现。Anthropic公布的案例显示,Opus 5.5在不到一天内完成了一个68万行代码库的整体迁移——这在传统开发模式下通常需要工程团队数周的时间。

在Web应用性能优化测试中,Opus 5.5在40次测试中成功优化了39次(97.5%成功率)。代码审计任务同样惊艳:将一个20万行代码库的问题修复,Opus 5.5在不到3小时内完成,而Opus 5花费了超过20小时。

甚至在艺术创作领域,Opus 5.5也展现了独特价值:它在游戏开发中的图形质量和打磨评分均高于Anthropic测试过的所有其他模型。

基准测试:全面超越前代,与Fable并肩

Opus 5.5的核心定位是”以Fable 5.1的性能、比Opus 5低40%的价格”服务企业用户。基准测试数据验证了这一承诺。

Opus 5.5关键基准测试对比
基准测试 Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
Terminal-Bench 4.0 66.4% 55.8% 52.3% 57.9% 37.3%
FrontierCode v1.1 54.4% 50.3% 48.0% 53.3% 47.5%
Humanity’s Last Exam 67.7% 65.6% 63.6% 57.2% —
GDPval-AA v2.1 1846 1735 1708 1542 1588
OSWorld 2.1 81.8% 80.7% 74.0% — —
AutomationBench 40.0% — 26.9% 41.4% 28.8%

值得注意的是,Opus 5.5在Terminal-Bench-Science 0.1(代理科学研究)测试中以58.7%输给GPT-6 Astra的64.6%,说明在最前沿的科学研究代理任务上,GPT-6 Astra仍有优势。

企业级采用:首批用户的量化反馈

多家头部企业已经将Opus 5.5投入生产环境。

GitHub的测试结果显示,Opus 5.5在Visual Studio Code中以不到一半的操作步骤解决了更多的终端任务。Clio用Opus 5.5完成了一次18小时不间断运行,跨6个代码仓库处理复杂工程任务。

Quantium的案例极具代表性:一项需要38次提示、4天时间的复杂编码任务,使用Opus 5.5后仅需11次提示、3小时完成。Optiver的反馈是:代理编码任务质量与Opus 5持平,但Turn数量、时间消耗和Token使用量均减半,总体成本降低40%-50%。

Hebbia在端到端金融工作流测试中,Opus 5.5的任务覆盖率达到了86.6%,而Opus 5仅为60.3%。Kiro的量化数据是:在解决更多任务的同时,工具调用减少约40%,Token使用量减半。

在知识工作场景中,Deloitte的最低设置catch了72%的已知bug,而Opus 5的高设置只有56%。Rogo以最低设置击败了Opus 5的最高设置,输出Token减少60%。

定价:降幅最大的Claude Opus版本

Opus 5.5的定价调整幅度在Claude历史上极为罕见。

Claude Opus 5.5与Opus 5定价对比(每百万Token)
类别 Opus 5.5 Opus 5 降幅
缓存读取 $0.20 $0.50 60% ↓
输入Token $4.00 $5.00 20% ↓
输出Token $20.00 $25.00 20% ↓
缓存写入 $5.00 $6.25 20% ↓

Fast Mode下,Opus 5.5的输入Token价格为8美元/百万,输出Token为40美元/百万,速度最高提升2.5倍。

安全性:对齐测试史上最高分

Opus 5.5在Anthropic的近2000个场景自动化行为审计中获得了史上最高的对齐分数。它比近期所有模型都更不易采取难以逆转的行动,尝试绕过边界的行为比Opus 5或Claude Mythos 5.1减少85%。

在网络安全方面,Opus 5.5采用了与Fable 5.1相同的高级别安全防护机制,大多数高风险网络操作请求会自动回退至Opus 4.8处理。Anthropic还提供了Cyber Verification Program供网络安全防御者申请更高级别的访问权限。

FAQ

Opus 5.5和Fable 5.1哪个更强?

两者在不同维度各有优势。Opus 5.5在Terminal-Bench 4.0(66.4% vs 55.8%)、FrontierCode(54.4% vs 50.3%)和Humanity’s Last Exam(67.7% vs 65.6%)等基准测试中领先Fable 5.1。但Fable 5.1仍然是Anthropic专门的编程旗舰模型,适合需要极致编程能力的场景。两者都支持Preserved Thinking和完整的安全防护。

Opus 5.5适合哪些企业?

需要处理复杂、长程、跨系统工作的企业最适合Opus 5.5。从GitHub的编码助手到Quantium的金融分析,从Deloitte的审计到Hebbia的深度研究,Opus 5.5在多个行业的高难度任务中均表现出色。

Opus 5.5与GPT-6 Astra相比如何?

Opus 5.5在大多数知识工作和代理编码任务上领先GPT-6 Astra。但在代理科学研究(Terminal-Bench-Science)上,GPT-6 Astra(64.6%)仍领先Opus 5.5(58.7%)。定价方面,Opus 5.5比GPT-6 Astra低约33%(输入)和50%(输出)。

小结

Claude Opus 5.5的意义不仅在于一款旗舰模型的更新,更在于它展示了Anthropic在”降低前沿模型成本”这一课题上的突破。通过将运行成本降低40%同时提升性能,Opus 5.5让更多企业有机会以可承受的价格使用顶级AI能力。

Claude 5.5家族现已发布Opus和Sonnet两个型号,Haiku 5.5将在未来几周内推出。届时,Claude将形成覆盖从轻量到旗舰完整价格区间的五代同堂格局。

相关阅读