2026年9月26日,Anthropic正式发布Claude Sonnet 5.5。该模型在Artificial Analysis智能水平评分榜上超越GPT-6 Astra以及Anthropic自家旗舰模型Claude Fable 5.1,而API定价仅为Opus 5.5的一半——每百万输入、输出token分别为2美元和10美元。
从跑分数据看,Sonnet 5.5与前代产品之间的性能跨度显著。在Terminal-Bench 4.0上,Sonnet 5.5的成绩为70.6%,而上一代Sonnet 5仅为10.3%。在GDPval-AA v2.1评测中,Sonnet 5.5拿到1844分,距离Opus 5.5的1846分仅差2分。CursorBench 4.0的成绩为55.5%,同样接近Opus 5.5的57.8%。Anthropic方面表示,Sonnet 5.5在需要持续判断、目标不够明确的复杂工作上仍不及Opus 5.5,但在日常任务如修bug、迭代功能、制作文档和表格等场景中表现更为适配。
性能跃升的核心驱动力并非知识储备的增加,而是任务执行能力的强化。Anthropic自Sonnet 5起便着重提升推理、工具调用和编程能力,到Sonnet 5.5阶段,提升集中体现在智能体编程、电脑操作和视觉理解等需要连续行动的环节。具体而言,Sonnet 5.5在OSWorld 2.1上的得分从上代的57.0%提升至80.1%,在不使用工具的图表识别测试Chartography上从15.6%提升至61.6%。这意味着模型已具备从屏幕中收集信息并据此推进任务的能力。
以修bug为例,模型需要读懂代码、定位相关文件、判断改动影响范围、调用工具执行修改并确认问题是否解决,任何一步出错都可能导致任务失败。Sonnet 5.5在Terminal-Bench上的大幅提升,反映的正是这种全链条任务完成能力的增强,而非单纯的代码生成水平提高。
值得注意的是,测试过程中发现Sonnet 5.5会输出Opus 5.5特有的口头禅,例如“You are right!”。Anthropic在发布Opus 5.5时曾明确表示改进了写作与沟通方式,而Fable 5.1从不会使用这一表达。这一现象引发外界对Sonnet 5.5可能蒸馏自Opus 5.5的推测。
定价方面,Sonnet 5.5每百万输入、输出token分别为2美元和10美元,5分钟缓存写入为2.50美元对5美元,缓存读取均为0.20美元。Anthropic同时表示,得益于完成任务通常消耗更少token,每项任务最高可便宜30%。早期测试者观察到,Sonnet 5.5比Sonnet 5更倾向于将工具调用成批处理,从而减少整体步骤并节省token。在FrontierCode的High档位上,Sonnet 5.5比上代同档位高约10%,单任务成本却约为后者的十五分之一。部分评测中,Sonnet 5.5使用Low或Medium档位即可用约十分之一的任务成本超过Sonnet 5的最好成绩。此外,Sonnet 5.5的输出速度也比Sonnet 5提升30%以上。
在模型能力之外,Anthropic将工程与安全机制的升级作为此次发布的另一重点。Fable 5.1曾引入防止提取推理内容的Preserved Thinking机制,如今该机制进入Sonnet 5.5并进一步扩展。Anthropic为Sonnet 5.5增加了防止推理提取的安全分类器,并将模型产生的思考块绑定到创建它的账户或关联账户。若使用不关联的账户重放,API将丢弃该思考块,模型无法看到先前的推理内容。思考块的签名还与对话历史绑定,若开发者改动已发生的系统提示、工具定义或历史消息后再塞回旧思考块,新账户默认可能收到400错误。正常追加对话通常不受影响,但习惯在后台改写历史的智能体框架需要重新处理会话逻辑。
安全护栏的设计思路也发生变化,从判断是否拒绝用户请求,转向决定将问题交由哪个模型回答。Sonnet 5.5的网络安全能力有所提升,高风险网络安全请求可能触发分类器并被回退给Sonnet 5处理,而正常的找bug和修bug仍可使用Sonnet 5.5。Claude API上的服务端自动回退功能目前处于测试阶段,需要开发者主动启用。当Sonnet 5.5遇到被安全系统拦下的请求时,若开发者已开启自动回退,系统将尝试改用Sonnet 5来回答。
Sonnet 5.5的发布反映出Anthropic在模型能力、成本效率与安全治理三个维度上的同步推进。在行业普遍讨论AI发展是否应当减速的背景下,头部厂商的产品迭代节奏并未放缓,竞争焦点正从单纯的性能比拼转向性价比、工程可靠性与安全可控性的综合较量。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。