2026年9月,Anthropic发布Claude Fable 5.1模型,输入输出价格与此前持平,但缓存读取价格从每百万token 1美元下调至0.25美元,降幅达75%。这一价格调整使典型任务整体成本下降约25%,高度Agent化任务成本最高下降约45%。同期发布的Mythos 5.1为同一底层模型的安全增强版本,仅向经审核的网络安全与生命科学领域合作伙伴开放。
此次价格调整发生在AI模型定价竞争加剧的背景下。OpenAI于2026年6月推出GPT-5.6家族,旗舰模型Sol定价为每百万token输入5美元、输出30美元,随后在7月将Luna价格下调80%,8月再对Sol降价超两成。Anthropic并未跟进直接的输入输出降价,而是将降价集中于缓存读取环节。Fable 5.1的输入价格仍为每百万token 10美元,输出价格50美元,普通输入价格为自家Opus 5的两倍。缓存读取价0.25美元仅相当于正常输入价格的2.5%,远低于Claude系列其他模型普遍采用的10%折扣系数。
缓存读取定价的逻辑指向长时域Agent的成本结构。在持续数小时至数十小时运行的Agent任务中,每一步操作都在向同一上下文叠加状态,新产生的token占比很小,绝大多数为对已处理信息的重复读取。缓存读取价格直接决定此类任务的边际成本。Anthropic官方提供的测算显示,典型任务整体成本下降约25%,高度Agent化任务最高下降约45%。这一数据表明,长链条任务的成本重心已从新内容生成转向既有上下文的重复访问。
能力层面,Fable 5.1在多项评测中表现显著提升。在Terminal-Bench-Science 0.1评测中,模型需在终端内独立规划、执行并核验科学研究流程,Fable 5.1得分52.6%,上一代Fable 5为24.7%,OpenAI GPT-5.6 Sol为22.4%,Anthropic自家Opus 5为29.0%。AutomationBench从17.1%升至31.4%,Terminal-Bench 4.0从42.0%升至55.8%,Mythos 5.1达到60.9%。上述评测均在生产级安全防护开启状态下完成,防护机制在OSWorld和AutomationBench等场景中出手拦截即记零分。
早期客户反馈提供了评测分数之外的观察维度。Jane Street量化研究主管Craig Falls表示,Fable 5.1解决了比Fable 5和Opus 5更多的编码难题,且“以前的模型跑得越久越难读懂,Fable 5.1在漫长的多步任务里始终可读”。Millennium的一位高级基金经理描述了一个案例:一段概率约为百万分之一的罕见崩溃,团队四五年未能解释,此前所有尝试过的模型均未能定位,Fable 5.1通过反汇编外部供应商库并与core dump对照,将崩溃追溯至该库的bug。Ramp记录了一次38小时无人值守的机器学习任务,模型中途自行纠正问题,连夜启动六组实验并返回结果与后续方案。MongoDB工程师描述了三天搭建复杂原型、夜间无人值守运行数小时的场景。
Fable 5.1与Mythos 5.1的发布方式体现了Anthropic在安全策略上的调整。两者为同一模型,防护等级不同,后者仅通过“可信访问计划”向网络安全和生命科学领域机构开放。这一安排将能力与护栏解耦,使同一套最强能力以不同安全配置进入不同市场,将安全治理成本从模型能力层转移至准入控制层。数据保留政策亦延续同一思路。
Anthropic此次未调整输入输出价格而大幅下调缓存读取价,将竞争焦点从单次推理成本转向长时任务的累计成本。当Agent从单次问答演进为持续数日的自主工作负载,决定总账单的因素不再是单次智能的价格,而是模型在长链条运行中对既有上下文的读取效率与稳定性。这一价格结构变化与能力提升方向的一致性,反映了Anthropic对Agent商业化下一阶段的核心判断:长时任务的可靠性比单点正确率更具商业价值。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。