Anthropic发布Claude Fable 5.1与Mythos 5.1,下调长任务推理成本

Anthropic想降低企业使用Claude的门槛,同时减少领先能力被快速复制的可能。

9月1日凌晨,Anthropic正式发布Claude Fable 5.1和Claude Mythos 5.1两款旗舰模型。与上一代产品类似,两款模型共享同一套底层模型,区别主要在安全权限和开放范围。Fable 5.1面向普通用户和企业,已上线Claude、Claude Code和API;Mythos 5.1则继续走专业版路线,仅向经过审核的美国机构的网络安全与生命科学专业人士开放,在部分敏感任务上的限制更少。

从官方公布的测试数据看,新模型在多项评测中全面超过上一代。在科研Agent、终端编程、企业工作流和计算机操作等长链条任务上,Fable 5.1的提升幅度较为明显。在第三方机构Artificial Analysis最新综合智能指数中,Fable 5.1 Max档位获得66分,超过Opus 5的63分,排名第一。

价格方面,两款模型保持一致,每百万Token输入和输出价格分别为10美元和50美元,与上一代Fable 5持平。Max会员和部分企业高级席位可在套餐额度内使用Fable 5.1,Pro等部分用户则需要额外购买积分按量调用。

在具体能力提升上,科研Agent是进步最明显的方向之一。在Terminal-Bench-Science 0.1评测中,Fable 5.1的得分从上一代的24.7%提升至52.6%,成绩翻倍。在AutomationBench中,Fable 5.1从17.1%提升至31.4%;Terminal-Bench 4.0则从42%提升到55.8%。这些数据显示,新模型在处理步骤多、持续时间长,且需要根据环境变化不断调整的任务时,执行能力有显著增强。

Anthropic给出的一个案例展示了这一变化。在Ramp测试中,让Fable 5.1处理一项机器学习任务,模型连续自主运行38小时。过程中,它发现原有实验受到标签问题影响,随后自行修正方案、重新启动实验,并继续根据结果推进任务。

Mythos 5.1方面,在蛋白质设计任务中,其生成的结合蛋白方案经外部实验验证,在12个目标测试中的命中率接近50%,高于行业常见的10%至15%。在计算生物学场景中,它优化了7个开源模型的GPU Kernel,使推理速度最高提升2.5倍,并降低30%至60%的GPU成本。

在降低成本方面,Anthropic此次选择下调长任务中更关键的Cache Read成本。模型重复读取已处理上下文的价格从每百万Token 1美元降至0.25美元。按照官方测算,Fable 5.1在典型工作负载中的整体成本可下降约25%,在高频调用工具的Agent任务中最高下降约45%。这一调整针对的是Agent任务中的实际使用成本——此类任务通常需要持续读取此前上下文,Cache Read成本会随任务长度增加而上升。

与此同时,Anthropic也在提高模型能力被复制的门槛。从Fable 5.1开始,对于8月31日之后创建的新API账户,模型生成的thinking block会与产生它的整段对话绑定。如果开发者修改此前的系统提示词、工具列表或历史消息,再将原推理内容放回新请求中,API默认会直接拒绝,或根据设置丢弃已失效的推理块。Anthropic解释,该机制主要用于防止模型推理过程被大规模提取并用于训练其他模型。

这一举措反映出头部模型公司正在面对的平衡问题:一方面需要开放模型能力以扩大调用量和商业收入,另一方面也需要保护高成本训练形成的技术优势。Anthropic试图通过降低使用门槛扩大调用规模,同时减少领先能力被快速复制的可能性。

Anthropic目前已进入上市前的关键阶段。5月28日,公司完成650亿美元H轮融资,投后估值达9650亿美元。四天后,公司向美国证券交易委员会秘密提交S-1文件,进入IPO筹备流程。8月底,有消息称Anthropic计划在9月初公开招股书。在旗舰模型能力差距逐渐缩小的行业背景下,Anthropic能否将当前的模型领先优势转化为足以支撑IPO的收入和利润,将是其面临的核心考验。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Gemini 3.8 Flash上线:部分基准接近Opus 5,单任务成本上涨约40%
上一篇 3小时前
谷歌Look up应用短暂上架Play Store,聚焦桌面端上下文搜索与航班追踪
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部