Anthropic于今日凌晨悄然发布新一代旗舰模型Fable 5.1及面向特定机构的Mythos 5.1。这是继Fable 5成为行业标杆后,该公司在不到半年内对旗舰产品线的又一次迭代。两款模型同步上线,其中Fable 5.1面向普通用户与企业市场,Mythos 5.1则将相同的前沿能力开放给经过验证的网络安全和生命科学机构。基础定价维持不变,输入Token每百万10美元、输出Token每百万50美元,但缓存读取价格从每百万Token 1美元大幅下调至0.25美元,降幅达75%。性能提升则明显集中于长时间、多步骤的Agent任务场景。
从规格参数看,Fable 5.1延续了Fable 5的100万Token上下文窗口和128K最大输出,基础价格也未调整。在当前旗舰模型价格体系中,Fable 5.1仍属于明显偏贵的一档:按100万输入加100万输出计算,其成本约为GPT-5.6 Sol当前价格的2.5倍,是GLM-5.3的10倍以上。Anthropic官方依然建议,大多数任务应优先使用价格仅为一半的Opus 5,仅在高难度推理、长时间Agent任务或Opus 5在高effort模式下仍显不足时,再考虑升级至Fable 5.1。
此次更新的核心变化体现在Agent持续运行的成本结构上。Fable 5.1的5分钟和1小时缓存写入价格仍分别为12.5美元和20美元每百万Token,但缓存读取价格从Fable 5的1美元每百万Token降至0.25美元,降幅达75%。缓存读取机制允许模型在已处理过的上下文基础上,后续请求无需按完整输入价格重新计算。对于单次问答场景,该部分成本占比有限;但对于连续运行数小时的Agent,系统提示词、代码库、工具定义及历史上下文会被反复读取,任务时长越长、工具调用越频繁,缓存读取在总成本中的占比就越高。
Anthropic基于今年8月四周的实际使用数据进行了测算。在按Token计费的场景下,相同任务从Fable 5迁移至Fable 5.1,典型工作负载的整体成本预计下降约25%;对于上下文更重、工具调用更频繁的复杂编码和高度Agent化任务,降幅最高可达约45%。这一调整实质上降低了模型长时间运行的经济门槛,而非单纯降低模型本身的售价。不过,有开发者在发布评论区指出,即使缓存命中率较高,真实复杂编码任务的成本仍可能迅速累积,单次任务花费20至50美元的情况并不罕见。
性能方面,Fable 5.1的Benchmark提升集中在需要连续调用工具、处理多步骤流程并动态调整策略的任务上。Terminal-Bench-Science 0.1得分从24.7%跃升至52.6%,实现翻倍增长;测试终端环境Agent能力的Terminal-Bench 4.0从42.0%提升至55.8%;面向复杂商业工作流的AutomationBench则从17.1%上升至31.4%。相比之下,传统推理与编码Benchmark的提升幅度较为温和:Humanity’s Last Exam在不使用工具时从57.8%升至60.9%,使用工具后从63.8%升至65.0%;CursorBench 3.2.0从70.5%升至73.4%,GDPval-AA v2从1723升至1853。
早期企业测试结果与Benchmark趋势一致。Browserbase在其难度最高的浏览器Agent基准测试中,Fable 5.1完成了82%的任务,而Opus 5为74%,Fable 5为57%。Ramp的一次测试中,Fable 5.1在无人干预的情况下连续运行38小时:它首先发现此前一个机器学习实验的结果受到标签伪影影响,随后自行修正问题,同时启动6组并行实验运行一整夜,最后带回新的实验结果与下一步建议。在另一次开放式任务中,该模型被要求寻找“没人负责但最值得解决的问题”,它自行定位了一个与生产事故相关且尚未处理的告警,调取日志并给出修复方案。Canva的反馈则集中于生成质量,其测试认为Fable 5.1的文字表达更易理解,也更符合写作规范,在与Fable 5的盲测中更偏好5.1的输出。
此次发布的时间节点亦引发市场关注。据The Information此前披露,已秘密提交IPO文件的Anthropic可能在9月7日美国劳动节之后正式公开招股书,并于9月中旬举行投资者日,最快于9月底至10月初上市。Fable 5.1很可能是该公司在公开递表前的最后一次重量级模型发布。与此同时,Anthropic此前关于额度的调整余波也出现在新模型发布的评论区。8月29日,Anthropic宣布自9月14日起将Claude Code的“标准周额度”永久提高25%,但该数字是基于5月以前的旧标准计算,与用户当前使用的临时额度相比实际下降了约17%。用户在Fable 5.1发布后继续追问,希望获得更透明、更慷慨的会话和每周额度。
从模型定位与定价策略来看,Anthropic正将Fable 5.1塑造为面向长时程、高强度Agent任务的专用旗舰。缓存读取价格的大幅下调,配合性能在Agent场景的显著提升,反映出该公司对AI从单次问答向持续性工作负载迁移的判断。随着IPO进程推进,这一代模型的市场表现将成为衡量其商业化能力的重要参考。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。