企服科学:Claude价格暴降90%,被改写的其实是自动化任务的成本门槛

谁先把执行层的Token单价打到低位,谁就掌握了高频自动化时代的成本定价权。

Anthropic于近日发布Claude Haiku 5.5,并同步下调多款模型的调用价格。据钛媒体报道,在10万Token以内,Haiku 5.5每百万Token输入0.1美元、输出0.5美元、缓存读取0.01美元,上一代Haiku 4.5对应为1美元、5美元、0.1美元,短上下文单价降幅约90%;Anthropic估算,大多数典型工作负载的实际成本约降低75%。这是它继9月22日Opus 5.5、9月28日Sonnet 5.5之后,在半个月内补齐的第三款5.5版本模型,目前已进入Claude的Free、Pro、Max、Team和Enterprise套餐,覆盖Web、iOS与Android平台,开发者可通过Claude API、Claude Code以及AWS、Google Cloud和Microsoft Foundry调用。对一家即将接受资本市场审视的公司来说,价格表上的数字变化,往往比发布会上的形容词更能说明它想抢占的位置。

先分清一件事:“降90%”是标题口径,不是账单口径。90%说的是10万Token以内的单价降幅;一旦Prompt超过10万Token,Haiku 5.5的整档价格立刻变为短上下文的5倍,即输入0.5美元、输出2.5美元、缓存读取0.05美元。也就是说,便宜是有边界的,而且边界划得相当清楚——它奖励短平快,惩罚滥用。再把镜头拉远,这次降价的真正含义不在于某一档价格打了骨折,而在于Anthropic第一次把一款具备百万级上下文、能操作浏览器、能做推理的模型,放进了“高频自动化”可以负担的成本区间。只看幅度容易误判形势,看清它被允许出现在哪些任务、以什么代价出现,才读得懂这步棋。厂商之间的价格表从来不是单个数字的比拼,而是“什么任务配什么价”的分层设计,标题上的百分比只是最外层的包装。

拆开看第一本账,是技术账,也是这轮升级里被“降价”两个字盖住的部分。Haiku 5.5的上下文窗口从上一代的20万Token提升至100万Token,最大输出从6.4万Token翻倍至12.8万Token,这两项参数恰好与OpenAI近期发布的GPT-6 Luna同位,后者同样是约100万Token上下文、12.8万Token最大输出。参数拉平意味着,短上下文的低价不再是谁的独家卖点,而会变成行业的起步线。更值得注意的是能力结构的变化:Haiku 5.5首次加入Adaptive Thinking和可调节的effort,让模型自己决定复杂问题要不要深想,这等于把“算多深”从一个固定档位变成可调变量;新增Browser Use,可以径直操作网页;安全机制也更新为新的分类器拒答。浏览器操作一度是Agent落地最难的一环,如今它被下放到最便宜的一档模型上,意味着过去因单价太贵而只能小范围试点的自动化,第一次有了大规模铺开的可能。可调effort的价值也在于此:开发者可以在“想得深”和“花得少”之间手动加权,把成本控制变成一道可以调参的工程题,而不是听天由命的固定开销。Anthropic把它定位为家族中标准模式下最快的模型,面向低延迟、大量调用的场景,包括实时聊天、客服、语音助手、信息提取、文件整理以及浏览器和电脑操作。它甚至明确把“Opus与Sonnet之下的Subagent”写进核心用途——翻译成商业语言,就是给这款模型的任务定了性:跑腿。工具属性一旦确立,考核它的就不再是智商,而是每单位成本能完成多少动作。

换一个角度看第二本账,是商业账,也是我认为最关键的一本。参数与价格只是表层,真正的动作是分工:复杂任务里,Opus或Sonnet负责整体结构与判断,Haiku负责查询数据、整理资料、网页操作与信息分类。而子任务恰恰是Agent运行时消耗Token最凶的部分——一个长任务里,主模型只发号令,反复执刀的恰恰是下层。把执行层的单价压下来,等于把“Agent能跑多久”的定价权,从上游挪回自己手里。这不是简单的降价促销,而是把成本压力重新分配到最容易膨胀的那一层。另一手同样关键:Sonnet 5.5的缓存读取价格从每百万Token 0.2美元降至0.1美元,Anthropic估算,由于Agent长时间运行会反复读取系统提示词、工具定义与历史上下文,缓存读取在Token消耗中占比很高,此举可使多数Agent任务运行Sonnet 5.5的总体成本再降约20%。缓存读取往往是长任务里最容易被忽视的隐性成本,它不出现在对话里,却随运行时长线性累积;把它砍半,收益直接落在那些一跑就是几十分钟的重度Agent上,而不只是demo阶段的一次性调用。再叠加Max 5x每月100美元、Max 20x每月200美元、Team最多共享500美元的API配额,它压低的不只是单次调用价,而是整个开发者的试错成本。当试错变便宜,尝试的频次就会上去,需求也就被自己养了出来——这是把成本让利,直接转化为使用惯性的做法。

第三本账是格局账。对位已经很清楚:GPT-6 Luna在短上下文区间同样是输入0.1美元、输出0.5美元、缓存读取0.01美元,定价几乎贴身,这说明短上下文的低价已是两家的共识而非差异。真正的分野在长上下文。Haiku 5.5超过10万Token即整档跳至5倍,而Luna要到Prompt超过27.2万输入Token才启动涨价,幅度是输入与缓存翻倍、输出涨至1.5倍,即输入0.2美元、输出0.75美元、缓存读取0.02美元。这是一次路线选择:Anthropic把便宜锁在短上下文与高频子任务,把长上下文的溢价留给复杂推理;OpenAI则把“便宜区”撑得更靠后。两种切法各有算盘,短期内谈不上谁更高明:Anthropic赌的是高频子任务的规模,OpenAI赌的是长文档处理的深度,谁押中的场景更多,要等真实用量说话。性能上,按Anthropic公布的数据,Haiku 5.5在OSWorld 2.1得72.4%、Luna为48.9%,在Terminal-Bench 4.0为39.2%对16.4%,在FrontierCode 1.1为46.4%对42.4%,知识工作上GDPval-AA v2.1为1620分对1437分、AA-Briefcase v1.1为1578分对1336分,Artificial Analysis的Intelligence Index上最高档得43分、Luna为38分;但同一机构的AutomationBench-AA里,Luna以53.2%反超Haiku的35.4%。谁更强,取决于任务类型,而不是厂商自己的评测表;一份总分领先的榜单,撑不起一个场景里的真实胜负。

风险与边界同样要说清。其一,上述成本降幅多来自厂商自估,75%与20%都建立在“典型工作负载”的假设之上,真实账单取决于输入输出配比、缓存命中率与长上下文占比,未必能照搬。其二,性能数据是厂商公布的评测,第三方结果已经出现交叉,AutomationBench-AA上Luna明显领先,说明在自动化这类场景里,Haiku的优势并非无差别,选型不能只看总分。其三,长上下文5倍的阶梯会惩罚那些把整份文档、整段历史一股脑塞进去的粗暴用法,模型便宜了,滥用反而更贵,工程上的上下文管理与缓存设计重新变成必修课。其四,价格是可以被跟随的,今天的地板价明天可能就是别人的起售价,单点价格优势的保质期很短,真正能沉淀下来的,是围绕它搭起来的工作流与生态。把这些边界划清,才能避免把一次定价动作,误读成一次能力碾压。

所以,这件事该怎么定性?不是“某款模型变便宜了”,而是Token经济学正在改写下游的成本结构。当一款能操作浏览器、能做推理的模型,把执行层单价打到输入0.1美元、输出0.5美元,过去因成本被搁置的高频自动化任务——实时客服、信息提取、文件整理、网页操作——就具备了被规模化的条件。对SaaS而言,这既是机会也是压力:谁先把Token单价锁在低位,谁就有资格承接这些高频、长时间、可放大的任务,谁的成本曲线就更抗压;反过来看,如果一家产品的毛利建立在“模型很贵、客户用得少”之上,那么当执行层突然变得廉价,它的护城河会被重新丈量。价格从来不只是价格,它是产品边界的定价。真正的信号不是那个百分比,而是Anthropic开始公开承认:未来的模型体系会像组织一样分层,上层做决策、做判断,下层做执行、做跑腿,而决定商业胜负的,常常是下层那笔不起眼的单价。谁先把执行层的Token单价打到低位,谁就掌握了高频自动化时代的成本定价权。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
企服科学:谷歌Gemini把智能体派去上班,企业买的不再是软件而是人头
上一篇 1小时前
企服科学:Cloudflare裁员两成营收反增36%,云计算的估值逻辑正在重写
下一篇 34分钟前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部