跳到文章正文
anthropic-Claude 编辑推荐

Claude Opus 5.5 重磅发布:性能比肩 Fable 5.1,成本直降 40%

核心看点性能飞跃:Claude Opus 5.5 在大多数工作上达到 Claude Fable …

核心看点

  • 性能飞跃:Claude Opus 5.5 在大多数工作上达到 Claude Fable 5.1 的水平,成为新一代领先模型
  • 成本大幅降低:运行成本比 Opus 5 便宜 40%,输出速度快 30%
  • 安全升级:在 Anthropic 最全面的对齐测试中取得历史最佳成绩
  • 价格下调:输入 $4/百万 token,输出 $20/百万 token,缓存读取降至 $0.20

详细解析

性能表现:编程能力的巨大跃升

Opus 5.5 是 Claude 5.5 家族的首个模型,在多个关键基准测试中表现突出:

  • Terminal-Bench 4.0:66.4%,超越 Opus 5 的 55.8%
  • OSWorld 2.1(电脑使用):81.8%,达到业界领先水平
  • Humanity’s Last Exam:67.7%(使用工具),展现多学科推理能力

早期测试者的反馈尤为惊人:一位测试者在不到一天内完成了需要工程团队数周的 68 万行代码迁移;在优化网页加载速度的任务中,Opus 5.5 在 40 次测试中有 39 次成功,而 Opus 5 不仅改进幅度更小,还会改变应用行为。

效率与成本的双重优化

Opus 5.5 不仅单 token 成本更低,完成任务所需的 token 也更少,综合成本下降 40%。具体价格对比:

价格项 Opus 5.5 Opus 5
输入 token $4/百万 $5/百万
输出 token $20/百万 $25/百万
缓存读取 $0.20/百万 $0.50/百万

此外,Pro、Max、Team 和企业版计划的 5 小时使用限额也得到提升,订阅用户还可获得可随时使用的速率限制重置。

安全性:对齐测试历史最佳

Opus 5.5 在 Anthropic 的自动化行为审计(最全面的对齐测试)中取得了有史以来最好的成绩。它更不可能采取难以逆转的行动或越界操作,对提示注入攻击的抵抗力也比 Opus 5 更强。

由于 Opus 5.5 在生物学和网络安全领域的能力与 Claude Mythos 5.1 相当,Anthropic 为其部署了与 Fable 5.1 类似的保护措施。通过审核的组织可申请生命科学验证计划,网络安全从业者也将获得扩展访问权限。

更自然的沟通风格

早期测试者发现 Opus 5.5 的写作更清晰、更易读,会把最重要的信息放在前面。正如一位测试者所说:”它写东西的方式就像我自己写的一样。”这种改进不仅提升了实用性,也增强了安全性——让 AI 的工作更容易被检查和验证。

总结

Claude Opus 5.5 的发布标志着 Anthropic 在”放慢前沿节奏”理念下的首次实践。它在保持顶级性能的同时大幅降低成本,并在安全性上取得突破性进展。Sonnet 5.5 和 Haiku 5.5 也将在未来几周内跟进,带来更多性能、效率和安全的改进。

对于开发者而言,这意味着可以用更低的成本获得更强大的 AI 能力;对于整个行业而言,这展示了高性能与负责任 AI 发展可以并行不悖。

本文地址:https://www.163264.com/16299