Anthropic近日发布Claude Haiku 5.5,新模型在计算机操作、知识工作和多学科推理等方向实现显著性能提升,同时引入自适应推理机制并支持100万Token上下文。据Anthropic公布的数据,新模型平均运行成本下降约75%。
计算机操作能力的跃升是本次升级最突出的变化。在OSWorld 2.1离线子集评测中,Haiku 5.5取得72.4%的成绩,上一代Haiku 4.5仅为15.7%,Sonnet 5.5则达到83.9%。OSWorld测试的是模型通过计算机界面完成长链路任务的能力,涉及界面理解、操作执行以及根据环境反馈继续完成任务。与普通文本问答不同,计算机操作存在更多状态依赖——模型完成一次点击或输入后,页面可能发生变化,后续动作需要根据新的界面状态决定。如果操作失败,模型还需判断当前环境是否仍符合任务要求。72.4%对应的是特定测试集中的完成率,实际业务中的动态页面、权限限制和异常状态仍需在对应环境中单独测试。
知识工作方面,Haiku 5.5在GDPval-AA v2.1上获得1620分,Haiku 4.5为735分,Sonnet 5.5为1840分。该评测涵盖44类职业的实际工作任务,涉及材料分析、信息整合和工作成果生成。在AA-Briefcase v1.1评测中,Haiku 5.5从上一代的614分提高至1578分。多学科推理测试Humanity’s Last Exam的无工具成绩达到45.9%,接入工具后为57.4%,同样明显高于上一代。
编程评测则呈现不同局面。在FrontierCode 1.1主测试中,Haiku 5.5得分为46.4%,与Sonnet 5.5的52.1%差距较小。但在Terminal-Bench 4.0中,Haiku 5.5得分为39.2%,Sonnet 5.5达到70.6%。Terminal-Bench涉及命令行环境下的复杂多步骤任务,模型通常需要读取文件、执行命令、处理错误并根据测试反馈调整操作,对持续规划和执行状态维护的要求较高。Anthropic在发布材料中明确指出,Sonnet 5.5和Opus 5.5仍然更适合复杂智能体编程任务,Haiku 5.5主要面向范围明确的子任务、摘要和上下文压缩等工作。
企业早期测试提供了更多参考数据。Asana报告,在AI Teammates相关测试中,Haiku 5.5的任务完成延迟相比其现用模型降低超过30%,单轮推理速度提高至多2.5倍。HubSpot在模拟CRM环境中测得三次运行平均92.8%的成绩,AlphaSense在400次文档问答测试中测得Haiku 5.5得分为0.84,上一代为0.76。这些结果来自不同企业的内部测试,各自采用不同的任务与评估标准,适合用于了解特定业务场景中的表现,无法直接作为统一的模型能力排名。
Haiku 5.5成为首个支持可调节推理强度的Haiku模型。此前Haiku 4.5使用扩展思考功能时,开发者需要提前设置固定的内部推理预算,无论任务是简单信息查找还是涉及多个条件的复杂分析,模型可使用的推理空间都受到预先设置的数值限制。Haiku 5.5改用Adaptive Thinking,模型能够根据任务内容决定是否使用内部推理以及投入多少计算,开发者通过Effort设置整体推理强度。提取文档中的日期通常不需要长时间分析,而比较多个合同版本之间的条款差异需要同时处理更多条件和相互关联的信息,自适应推理允许模型在这两类任务中采用不同的计算投入。
API层面有几项需要处理的变化。Haiku 5.5不再沿用上一代手动指定固定思考Token数量的方式,旧有的推理配置需要调整。内部推理会占用模型的输出Token预算,如果原有程序只根据最终答案长度设置输出上限,升级后可能出现内部推理占用过多空间导致正文无法完整生成的情况。启用自适应推理后,模型响应可能包含独立的思考数据块,应用需要正确区分内部推理内容和最终输出。对于持续使用工具的智能体,推理数据与对话历史之间存在一致性要求,开发者如果在后续请求中修改已有历史消息,可能影响原有推理状态的有效性。Haiku 5.5对部分采样参数也增加了限制,原先依靠这些参数调整输出行为的应用需要检查接口兼容性。
定价方面,Haiku 5.5支持100万Token上下文和12.8万Token输出,但Anthropic没有为整个上下文窗口设置统一低价。对于不超过10万Token的提示词,每百万输入Token收费0.10美元,每百万输出Token收费0.50美元。当提示词超过10万Token后,输入价格提高至0.50美元,输出价格提高至2.50美元。缓存费用同样采用分层方式。这一价格结构意味着长上下文场景的实际使用成本需要根据具体Token规模单独核算。
从企业应用角度看,Haiku 5.5在保持成本优势的同时显著扩展了可处理任务的复杂度边界。对于需要高频调用、任务范围明确的场景,新模型提供了更具性价比的选择。但在复杂智能体编程和长链路终端操作等任务中,Sonnet 5.5和Opus 5.5仍是更合适的选择。开发者在迁移过程中需要重点关注推理预算配置、响应解析逻辑和多轮消息处理方式的兼容性调整。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。