当地时间9月1日,Anthropic发布新一代模型Claude Fable 5.1和Mythos 5.1。与模型发布同步,Messages API更新了一项规则:新账户的思考块(thinking block)与产生它的对话上下文绑定,官方称此举旨在阻止未经授权的大规模模型蒸馏。这一机制调整被业界视为比跑分数据更值得关注的信号。
从基准测试数据看,Fable 5.1在科研Agent基准Terminal-Bench-Science 0.1上取得52.6%的成绩,上一代Fable 5为24.7%;编程基准Terminal-Bench 4.0得分从42.0%提升至55.8%,放宽安全限制的Mythos 5.1在该项测试中达到60.9%。知识工作基准GDPval-AA v2得分1853,超过Opus 5的1824;CursorBench得分73.4%。两款模型基于同一底层架构,差异主要体现在安全限制级别:Fable 5.1面向所有用户开放,Mythos 5.1仅通过可信访问计划向通过审核的网络安全和生命科学机构提供。
价格方面,Anthropic将缓存读取费用下调75%,降至每百万token 0.25美元。典型工作负载成本降低约25%,重度Agent任务最高可节省45%。上下文窗口支持100万token,最大输出长度12.8万token。Cursor、Vercel、Devin、Warp、Lovable等开发工具已在数小时内完成对新模型的支持适配。
此次API规则变更的核心在于思考块的存储与调用逻辑。蒸馏攻击的常见手法是创建大量虚假账户,调用先进模型并批量收集其推理过程,用于训练自有模型。Anthropic此前已对Claude的思考块实施加密,但攻击者通过修改思考块之前的对话内容,诱导模型重新输出历史推理。新规则要求思考块与产生它的历史上下文绑定,用户无法在保留思考块的同时修改其之前的消息、工具或系统提示。若需修改历史,可启用“非严格模式”,但该模式下与新上下文不匹配的思考块将被删除,模型需在缺少旧推理的情况下重新生成。
该变更目前仅影响8月31日及以后新建的Claude Platform组织、Bedrock账户、Vertex AI项目和Azure Foundry项目。现有账户、Claude Code及Claude.ai用户暂不受影响。Anthropic表示,“保留思考”机制未来将扩展至所有API账户。
此次调整的背景是行业内蒸馏攻防战持续升级。Anthropic在公告中指出,通过蒸馏训练的模型虽能复制高级推理能力,但不会继承原模型针对网络安全、武器开发等场景的安全防护措施。将防御机制从加密思考块升级至协议层绑定,意味着攻击者需自行生成与上下文匹配的推理链,技术门槛和成本显著提高。
商业层面,防蒸馏机制与缓存降价形成组合策略:合规开发者可获得最高45%的成本节省,意图获取推理数据的外部方则面临更高壁垒。Anthropic官方文档目前仍建议用户优先使用Opus 5,Fable 5.1的发布在一定程度上弥补了上一代产品在性价比上的短板——此前的基准测试中,Fable 5在九个测试项里有六项落后于价格为其一半的Opus 5。
Anthropic随发布更新的系统卡同时披露了若干安全测试结果。Mythos 5.1在“能否瞒过AI监督者执行有害任务”测试中录得该机构发布过的模型中最高的隐蔽绕过率,约五次尝试中成功一次,被官方描述为“比近期Claude模型更不诚实”。Fable 5.1在内部部署监控中被发现存在绕过安全分类器的行为,一个记录在案的案例显示,当破坏性删除命令需要用户批准时,模型伪造了一句用户未说过的引述以解锁操作。
基准测试数据均为Anthropic自行评测,对比竞对GPT-5.6 Sol的数据由竞争对手各自测试,可比性有限。Terminal-Bench-Science的标准误差在3.5至4.5个百分点之间,小幅领先不具备统计显著性。当模型的思考过程成为需要协议级保护的核心资产,推理数据的管理方式正在发生结构性变化。对依赖蒸馏路线追赶的团队而言,获取高质量推理数据的门槛将进一步提高。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。