核心看点
- Claude Opus 5 正式发布,性能接近 Fable 5,但价格只有一半
- 在 Frontier-Bench、CursorBench 等基准测试中全面领先
- ARC-AGI 3 得分是第二名的三倍
- 安全性大幅提升,对齐性评分创 Anthropic 历史新高
- 定价与 Opus 4.8 持平:输入 5美元/百万 token,输出 25美元/百万 token
详细解析
Anthropic 在 7 月 24 日正式发布了 Claude Opus 5,这是 Opus 系列的又一次重大升级。官方将其定位为"日常使用的默认模型"——既有接近 Fable 5 的智能水平,又保持了 Opus 系列的速度和成本优势。
性能表现
Opus 5 在多个关键基准测试中表现亮眼:
- Frontier-Bench v0.1:超越所有竞品,以更低的成本将 Opus 4.8 的性能提升了一倍以上
- CursorBench 3.2:在最高 effort 设置下,性能接近 Fable 5 的峰值,但成本只有一半
- ARC-AGI 3:解决新问题的能力得分是第二名的三倍
- Zapier AutomationBench:端到端完成业务流程的通过率是竞品的 1.5 倍
- OSWorld 2.0:计算机使用基准测试中,以 Fable 5 三分之一出头的成本超越了 Fable 5 的最佳成绩
实际应用案例
Opus 5 的主动性和验证能力大幅提升。几个典型场景:
- 自主视觉处理:拿到一张机械零件图纸,在无法直接查看的情况下,自己写了个计算机视觉管道从像素中提取几何信息,成功重建了 3D 模型
- 根因分析:发现一个流行开源包管理器的真实 bug,不仅修复了表面症状,还找到了社区补丁遗漏的底层原因
- 自主测试:为交易所构建市场数据流时,找不到实时数据验证,就自己写了个测试框架来验证代码正确性
安全性与对齐性
Opus 5 是 Anthropic 迄今为止最对齐的模型:
- 自动行为审计中,整体不对齐行为评分 2.3,为近期模型最低
- 欺骗行为率最低
- 最不容易被诱导滥用
- 在网络安全方面,能发现漏洞但开发利用能力远低于 Mythos 5,降低了恶意使用风险
企业反馈
多家早期试用企业给出了积极评价:
- Cognition(Devin):"在 FrontierCode 1.1 上接近 Fable 水平,调试和根因分析特别强"
- Cursor:"以 Opus 的速度和成本提供接近 Fable 5 的智能"
- Zapier:"端到端自动化通过率 100%,之前模型都没通过"
- Lovable:"内部评测中最强 Opus 模型, hardest agentic coding 任务提升 22%"
定价与可用性
Opus 5 已全面上线:
- 输入:5美元/百万 token
- 输出:25美元/百万 token
- Fast 模式:2.5 倍速度,价格翻倍
- Claude Max 默认模型,Claude Pro 最强模型
同时 API 还新增了两个 beta 功能:对话中切换工具(不破坏 prompt cache)和自动 fallback(被安全分类器标记的请求自动路由到其他模型)。
总结
Claude Opus 5 是一次务实的升级——没有追求最极端的性能,而是在"足够聪明"和"足够便宜"之间找到了最佳平衡点。对于日常开发、知识工作和自动化任务来说,它可能是目前性价比最高的选择。特别是其出色的验证能力和自主性,让它在长周期、多步骤任务中表现尤为突出。
本文地址:https://www.163264.com/14406


微信扫一扫,鼓励一下~