
作者丨郑佳美
编辑丨岑 峰
刚刚,Anthropic 发布了 Claude Haiku 5.5。
这次升级的幅度不小,尤其是在计算机操作方面,OSWorld 2.1 评测成绩从上一代的 15.7% 提升到了 72.4%。知识工作和复杂推理能力也有明显改善,而按照 Anthropic 公布的数据,新模型的平均运行成本还下降了约 75%。
除此之外,Haiku 5.5 还加入了自适应推理机制,并支持 100 万 Token 上下文。过去,Haiku 主要用来处理摘要、分类、信息提取这些高频任务,优势一直是速度快、成本低。

再看这次更新的推理机制和价格规则,Haiku 5.5 在不同任务中的表现与实际使用成本,其实还有不少细节需要拆开来看。
01
复杂编程仍有差距
Haiku 5.5 的性能增长主要体现在计算机操作、知识工作和多学科推理几个方向,其中计算机操作的变化尤其明显。雷峰网
在 OSWorld 2.1 离线子集上,Haiku 5.5 取得 72.4%,上一代只有 15.7%,Sonnet 5.5 则达到 83.9%。OSWorld 测试的是模型通过计算机界面完成长链路任务的能力,涉及界面理解、操作执行以及根据环境反馈继续完成任务。
与普通文本问答相比,计算机操作存在更多状态依赖。模型完成一次点击或者输入后,页面可能发生变化,后续动作需要根据新的界面状态决定。

但 72.4% 对应的是特定测试集中的完成率,不能直接代表所有浏览器或桌面任务的实际成功率。真实业务中的动态页面、权限限制和异常状态,仍然需要在对应环境中单独测试。
知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 上获得 1620 分,Haiku 4.5 为 735 分,Sonnet 5.5 为 1840 分。该评测涵盖 44 类职业的实际工作任务,涉及材料分析、信息整合和工作成果生成。

这些评测涉及的任务比普通信息提取更加复杂。模型需要理解多个信息来源之间的关系,处理材料中的限制条件,并根据已有内容形成结果。工具的引入还增加了信息获取和结果整合的环节。
不过,编程评测呈现出不同的情况。在 FrontierCode 1.1 主测试中,Haiku 5.5 得分为 46.4%,与 Sonnet 5.5 的 52.1% 差距较小。但在 Terminal-Bench 4.0 中,Haiku 5.5 得分为 39.2%,Sonnet 5.5 达到 70.6%。

Anthropic 也在发布材料中明确指出,Sonnet 5.5 和 Opus 5.5 仍然更适合复杂智能体编程任务,Haiku 5.5 则主要面向范围明确的子任务、摘要和上下文压缩等工作。
企业早期测试提供了更多具体数据。Asana 报告,在 AI Teammates 相关测试中,Haiku 5.5 的任务完成延迟相比其现用模型降低超过 30%,单轮推理速度提高至多 2.5 倍。

这些结果来自不同企业的内部测试,各自采用不同的任务与评估标准,适合用于了解特定业务场景中的表现,无法直接作为统一的模型能力排名。

自适应推理加入 Haiku
除了性能变化,Haiku 5.5 还成为首个支持可调节推理强度的 Haiku 模型。雷峰网
此前 Haiku 4.5 使用扩展思考功能时,开发者需要提前设置固定的内部推理预算。无论任务是简单的信息查找,还是涉及多个条件的复杂分析,模型可以使用的推理空间都受到预先设置的数值限制。
Haiku 5.5 改用 Adaptive Thinking。模型能够根据任务内容决定是否使用内部推理以及投入多少计算,开发者则通过 Effort 设置整体推理强度。

这一机制也涉及推理时计算资源的分配。对于复杂任务,增加内部推理可以让模型处理更多中间步骤,但更长的推理过程也会增加 Token 消耗和响应时间。对于简单任务,减少内部推理能够降低不必要的计算开销。
Anthropic 在发布页面展示了不同推理强度下,Haiku 5.5 在 OSWorld、GDPval-AA 和 Humanity's Last Exam 中的成本与性能关系。不过,不同任务对额外推理计算的反应并不一致,不能把提高推理档位直接等同于固定幅度的性能提升。

另外,启用自适应推理后,模型响应可能包含独立的思考数据块。应用需要正确区分内部推理内容和最终输出,不能继续假设返回内容的开头一定是答案。
对于持续使用工具的智能体,推理数据与对话历史之间还存在一致性要求。开发者如果在后续请求中修改了已有的历史消息,可能影响原有推理状态的有效性。
Haiku 5.5 对部分采样参数也增加了限制,原先依靠这些参数调整输出行为的应用,需要检查接口兼容性。这些变化主要影响已经使用 Haiku 4.5 扩展思考功能的项目。迁移时除了替换模型版本,还需要重新检查推理预算、响应解析和多轮消息处理方式。
03
百万上下文没有统一低价
Haiku 5.5 支持 100 万 Token 上下文和 12.8 万 Token 输出,能够处理较长的文档、大型代码内容以及持续运行的工具记录。
不过,Anthropic 没有为整个上下文窗口设置统一的低价。对于不超过 10 万 Token 的提示词,每百万输入 Token 收费 0.10 美元,每百万输出 Token 收费 0.50 美元。当提示词超过 10 万 Token 后,输入价格提高至 0.50 美元,输出价格提高至 2.50 美元。

Anthropic 表示,Haiku 4.5 约 90% 的请求长度位于 10 万 Token 以内。这部分请求在新定价下获得了较大的价格降幅,但实际成本还受到 Token 使用量变化的影响。
Haiku 5.5 更新了分词器,相同内容对应的 Token 数量可能与上一代不同。因此,即使输入文本没有变化,升级后的实际计费数量也可能发生变化,需要重新测量。
对于长时间运行的智能体,上下文管理会进一步影响成本。例如,一个编程任务可能连续产生文件检索结果、代码分析记录和测试日志。
如果每次调用都携带完整历史,输入长度会随着任务推进持续增加。Prompt Caching 可以降低重复内容的读取费用,而 Compaction 可以将已经完成的操作整理成更短的任务状态,减少后续调用需要处理的历史信息。

Cognition 则将 Haiku 5.5 用作 Devin Fusion 的辅助模型,在 Opus 5.5 主导的配置下,FrontierCode 得分达到 66.2%,并报告成本与延迟有所下降。
这些案例采用了不同模型处理不同任务的方式,但发布材料没有提供完整的调用次数、Token 分布和成本明细,因此无法据此计算一般业务采用相同架构后的节省幅度。

这一调整仅涉及缓存读取费用,输入和输出 Token 的标准价格并未同步按相同比例下降。
04
迁移仍要检查实际任务表现
Claude Haiku 5.5 已经通过 Claude API、AWS、Google Cloud 和 Microsoft Azure 等平台提供,Anthropic 同时开始更新 Python 和 TypeScript SDK,为计算机操作与浏览器操作增加测试版支持。
从目前公布的数据看,Haiku 5.5 在计算机操作、知识工作和多学科推理评测中的成绩明显高于上一代,但复杂终端编程仍与 Sonnet 5.5 存在较大差距。价格方面,较短提示词能够获得更明显的成本优势,超过 10 万 Token 后则适用另一档收费标准。
对于已有的 Haiku 4.5 应用,迁移涉及推理配置、Token 计算和响应解析等具体修改。如果原来使用 Sonnet 处理部分高频任务,也可以依据相同测试集比较 Haiku 5.5 的完成率、响应时间和调用费用。
Anthropic 已经给出了模型能力、接口变化和定价信息,但实际业务中的成本改善仍需要通过对应工作负载验证。尤其在多轮工具调用场景中,模型单次请求的价格、任务失败后的重试次数以及上下文增长情况,需要放在同一次完整任务中核算。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。