Anthropic在Opus 5.5发布数日后配套上线了一份提示词指南,针对开发者反馈集中的Agent“半路停工”问题给出排查清单与解决方案。指南同时披露了从Opus 5迁移至Opus 5.5过程中涉及的多项API行为变更,其中四处改动会导致旧请求直接返回400错误。
据开发者反馈,Opus 5.5在无人值守的长任务场景中,常在汇报完进度后停止动作,需人工输入“继续”才能推进。Anthropic在指南中将原因归结为模型的汇报行为与旧版Agent程序判定逻辑之间的错配:Opus 5.5在长任务中会主动同步进度,部分汇报发出后不再调用工具,API返回的结束信号为end_turn,表示本轮对话结束;而不少沿用旧逻辑的Agent程序将“模型不再调用工具”等同于“任务完成”,一份进度汇报因此被误判为交差凭证。指南明确指出,纯文本的回合结束应视为汇报,不能作为任务完成的依据。
官方将这类停工归纳为四种典型情况:一是纸上谈兵,模型输出长篇总结并宣布下一步计划,但未调用任何工具;二是过分礼貌,模型停下来询问用户是否继续,随后原地等待;三是假装请示,列出并不影响后续执行的决策项;四是汇报强迫症,模型在完成小阶段或达到一定字数后主动停下做总结。值得注意的是,“沟通更主动、总结更清楚”恰是Opus 5.5官方宣传中的核心卖点。
针对上述问题,指南给出三招应对。第一招是任务清单:将大任务拆解为细项并交由待办工具或文本维护,回合结束时若清单仍有未完成项且模型未说明受阻原因,应用应自动发送续跑消息点名要求继续。官方示例为:“你的任务清单还有未完成项:迁移剩下两个端点,并更新它们的测试。继续做。如果哪项被卡住,说明卡在哪里。”第二招是引入更小的模型作为验收方,在每次回合结束后对照预设完成标准检查,未达标则将原因作为下一条消息返回要求返工。第三招是硬刹车:同一任务自动续跑两三次仍无进展时,强制停止并转交人工复查,避免API额度空转。此外,官方提供了一段可直接使用的系统提示词,明确禁止上述四种停工方式,并界定允许停止的条件,例如确需用户决策或触及受保护的核心资源。
API层面的改动更为直接。从Opus 5切换至Opus 5.5共有四处变更会导致旧请求被拒并返回400错误。其一,thinking参数不能再关闭,设置disabled或手工指定budget_tokens均会被拒绝,需不传thinking字段或设为adaptive,由effort参数控制思考深度。其二,tool_choice不能再强制调用工具,设为any或指定具体工具均报错,官方建议使用auto并配合严格工具调用或结构化输出。其三,thinking块与模型及上下文绑定,2026年8月31日之后创建的账户,若中途修改系统提示词、工具或历史消息后回放旧thinking块,默认报错,仅追加不改写的用法不受影响。其四,旧版电脑操作工具下线,Claude API和Google Cloud上需更换为computer_toolset_20260801,Amazon Bedrock上旧的computer_20251124仍可继续使用。
除报错项外,还有若干不报错的隐性变化。在Opus 5上,模型在两次工具调用之间输出的进度文字属于普通正文,Opus 5.5将其移入thinking块,而thinking块默认不显示内容,返回为空。若界面仅展示正文,长任务运行期间将无任何可见输出,请求未失败但用户会误判为卡死。解法是将display设为updates(beta)仅获取进度摘要,或设为summarized同时返回进度与推理摘要。此外,max_tokens管控思考与正文的总量,按旧有上限配置可能导致回答截断;思考内容即使不返回也按输出token计费。处理返回结果时,需区分thinking与正文类型,且在多轮工具调用中,模型的思考记录必须原封不动回传,删改或调整顺序均会被拒。上述清单针对自行调用Messages API的开发者,使用Claude Managed Agents的用户仅需修改模型名。
成本调控方面,由于thinking无法关闭,effort参数成为唯一旋钮,Opus 5.5支持low至max五档。官方称medium档可追平甚至超越Opus 5的high档,low档处理简单任务成本更低。但官方同时提示,同一档位下Opus 5.5每回合思考量显著大于Opus 5,高档位尤为明显,直接沿用旧项目high档配置将导致回合变长、输出token数上升。官方建议从medium档起步,基于自身数据评估后再决定是否上调。
此次指南反映出大模型能力升级与既有Agent框架之间的适配成本正在上升。模型行为越接近人类协作习惯,对上层调度逻辑的判定精度要求就越高,简单以“是否调用工具”判断任务状态的旧范式已难以适用。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。