跳到文章正文
anthropic-Claude 编辑推荐

Claude Haiku 5.5 发布:最便宜的小模型,跑分反超 GPT-6 Luna

大模型的竞争,从来不只在“最强”这一条赛道上。当各家旗舰模型的价格战打得难解难分时,Anthro…

大模型的竞争,从来不只在“最强”这一条赛道上。当各家旗舰模型的价格战打得难解难分时,Anthropic 选择把战场挪到“小模型”——10 月 8 日,它正式推出 Claude Haiku 5.5,并直言这是公司有史以来最便宜、最快、也最强大的小模型。

一分钟速览

  • Claude Haiku 5.5 平均运行成本比上一代 Haiku 4.5 下降约 75%;
  • 在 GDPval-AA v2.1、OSWorld 2.1 等评测中,全面领先 OpenAI 的 GPT-6 Luna;
  • Haiku 系列首次引入从 low 到 max 的五档 effort 调节,把“思考预算”交给用户;
  • 同步将 Sonnet 5.5 的缓存读取价格减半,并向 Max、Team 订阅用户发放每月 API 额度。

冲着 GPT-6 Luna 来的“守门员”

从官方跑分看,Haiku 5.5 的目标非常明确。它以 GPT-6 Luna 为主要对标对象,并在多项指标上逐项取胜:知识工作评测 GDPval-AA v2.1 中,Haiku 5.5 拿到 1620 分,而 GPT-6 Luna 为 1437 分;计算机操作评测 OSWorld 2.1 中,Haiku 5.5 达到 72.4%,GPT-6 Luna 为 48.9%。相比上一代 Haiku 4.5 在同类测试中仅 15.7% 的水平,提升幅度堪称跃迁。

价格同样是重头戏。Anthropic 表示,Haiku 5.5 平均比 Haiku 4.5 便宜约 75%;对于提示词在 10 万 token 以内的请求——这部分约占上一代请求量的九成——输入输出价格直接砍掉九成,超出部分也减半。在保持缓存命中一项之外,其价格甚至低于部分竞品的轻量版本。

小杯仍是小杯:能力边界很清楚

不过,Anthropic 自己也没有把话说满。在 Terminal-Bench 4.0 上,Haiku 5.5 仅得 39.2%,而同门 Sonnet 5.5 高达 70.6%。复杂多步编码、跨文件重构、长周期自主规划,依然是 Haiku 的短板。官方建议,复杂 agent 编码任务优先使用 Sonnet 5.5 或 Opus 5.5。

Haiku 5.5 真正的价值在执行层:当任务已经被拆解、验收标准明确、可以并行下发时,它是最具性价比的“跑量选手”。官方给出的案例是,Cognition 的 Devin 用 Opus 5.5 做主模型、Haiku 5.5 做子智能体,组合方案在 FrontierCode 上跑出 66.2%,高于两个模型各自单跑的成绩。

升级不是改个名字那么简单

对开发者而言,这次切换需要动代码。Haiku 5.5 取消了 budget_tokens 手动思考配置,改以自适应思考搭配 effort 参数;temperature、top_p、top_k 全部锁定默认值;助手消息预填充被移除;计算机操作工具也从旧版本更新到 computer_toolset_20260801。任何一处未同步,都可能直接报错或返回非预期结构。Anthropic 为此专门提供了迁移指南。

趋势洞察:模型分层正在固化

Haiku 5.5 的出现,让 Anthropic 的产品矩阵更清晰:Opus 5.5 管复杂推理,Sonnet 5.5 管通用执行,Haiku 5.5 管跑量与速度。这种“大中小分工”的思路,正成为整个行业的共识。对用户来说,模型竞争的红利正在从“谁最强”转向“谁更划算”。当小模型在特定任务上足够好用、成本又只有旗舰的几分之一时,企业会越来越多地采用“旗舰加小模型”的组合架构,而不是一味堆叠最大参数。这或许才是这一轮模型迭代真正改变的地方。

本文地址:https://www.163264.com/16443