Anthropic 已经推出其最新的人工智能模型 Claude Opus 5.5。这个新版本是在上一次 Opus 模型升级约两个月后推出,符合 Anthropic 以往的升级节奏。Anthropic 目前提供几个不同的 AI 模型,主要包括 Haiku(最小且最便宜)、Sonnet(中等大小及价格)以及 Opus(最大且最昂贵的三个模型)。此外,还有 Fable/Mythos,这是更具能力和成本的高阶选择。
此次发布将 Claude 的 Opus 模型从版本 5 升级至版本 5.5。Anthropic 表示,Opus 5.5 是我们在呼吁前沿发展后的首款模型。与以往模型一样,它在发布前经过外部评估者测试,包括 METR 和 Frontier Design。在我们最全面的对齐测试中,它达到了迄今为止最强的分数。
Opus 5.5 在性能上显著提升
Anthropic 对 Opus 5.5 的性能表示,Opus 5.5 是一个显著的进步,相较于 Opus 5 提升了许多。这是全新的领先模型,早期测试者在其最复杂的工作中见证了性能的巨大飞跃。一位测试者在不到一天的时间内完成了一个 680,000 行的代码迁移,而这项工作通常需要一个工程团队数周的时间。它在寻找和修复软件中的低效率方面表现出色:当我们要求它减少一个网页应用程序的每个页面的加载时间时,Opus 5.5 成功了 39 次中的 40 次,而 Opus 5 的改进则较小,并且改变了应用程序的行为。
另外,一位不同的测试者让几个 Claude 模型从单一提示中建立一个游戏;Opus 5.5 在图形和外观的强度上比其他所有模型得分都高。
具体到编码方面,Anthropic 表示,Opus 5.5 对于长期和复杂的任务,如全代码库的迁移和审计特别擅长。一位早期测试者利用它在不到三小时内审核和修复了一个 200,000 行的代码库,而 Opus 5 则需要超过 20 小时并使用了 2.5 倍的标记。在一项内部测试中,我们要求 Opus 5.5 和 Fable 5.1 将广泛使用的软件 HAProxy 从 C 语言转译为 Rust。
两者的重写几乎都通过了 HAProxy 自身的回归测试,但 Opus 5.5 用时 9.5 小时,而 Fable 5.1 则用时 12 小时,成本低了 51%。Opus 5.5 在进行自主编码时以更低成本提供前沿成果。
Opus 5.5 的成本效益优于前版本
在其默认努力水平下,Opus 5.5 每项任务的成本约为 GPT-6 Astra 的 20%。在 Terminal Bench 4.0 测试中,它的表现与 Astra 相当,但成本约为 40%,而在 CursorBench 测试中,它比 GPT-5.6 Sol 高出 11 分,成本约为三分之一。此外,Opus 5.5 的定价较 Opus 5 调整后更具优势:Opus 5.5 所需计算资源少于 Opus 5,其定价亦反映了这一点。
我们的测试显示,在默认设置下,Opus 5.5 在典型工作负载上成本低于 Opus 5 的 40%。输入和输出标记的费用分别为每百万 $4 和 $20,较 Opus 5 低 20%。缓存读取(占据大部分自主和编码工作的费用)为每百万 $0.20,较 Opus 5 低 60%。Opus 5.5 的输出生成速度也比 Opus 5 快了 30% 以上。
除了价格下降外,我们将在 Pro、Max 和 Team 计划中提高五小时的使用限制。我们还为订阅用户提供了速率限制重置,现在可以随时保存和使用。新的 Claude Opus 5.5 模型现已推出。展望未来,Anthropic 表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 模型将在接下来的几周内推出,并具备许多相同的性能、效率和安全性改进。
项目 规格 代码迁移能力 680,000 行代码在不到一天内完成 代码库审计时间 200,000 行代码在不到三小时内完成 HAProxy 转译时间 9.5 小时(低于 Fable 5.1 的 12 小时)
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

