Anthropic手把手教你省钱:Claude Code六大技巧,别再当冤大头烧token了 [企业追踪]

200个token的回复就是200次独立运算

Anthropic刚发了一篇博客,核心就一句话:各位开发者,别再拿token当柴火烧了。官方甚至亲自下场,列了六条省钱心法。这事有意思,厂商主动教用户怎么少花钱,在AI圈可不多见。

先看这笔账怎么算的。开发者日均烧13美元的token,月均150到250美元。订阅制从20美元到200美元分三档,但API按量走,实际花销完全看你怎么用。同样修一个bug,问法不同,花费能差出好几倍。就问你,这钱花得冤不冤?

token计价逻辑,藏着最大的坑

每次请求背后有两笔钱:预填充和解码。预填充是并行读入所有输入token,解码是串行一个字一个字往外吐。200个token的回复就是200次独立运算,所以输出token比输入贵5倍。Opus 5输出25美元/百万token,Sonnet 5是10美元,Haiku 4.5只要5美元。模型选错,成本翻倍。更关键的是推理强度,max和low之间思考token能差好几倍。牛刀杀鸡的钱,花得最冤。

提示缓存,才是薅羊毛的大杠杆

缓存读取只要正常输入价的0.1倍,直接省90%。但缓存有个致命弱点:必须从请求第一个字节开始连续匹配,中间任何变化全部作废。切模型、切推理强度、开关Fast mode、/compact压缩、超时过期、恢复旧会话——六种情况随便中一个,整个对话历史从0.1倍打回原价。更坑的是opusplan模式,每次进出plan都切模型,缓存失效一次,来回跳就是全价prefill来回烧。

会话膨胀,是比缓存失效更隐蔽的杀手

每轮对话都在拖着前面所有轮的内容重新发送,第40轮对话在重新发送第1到39轮的全部累积,增长接近O(n²)。Claude Code有个兜底:命令输出超30000字符就写临时文件,但30000以下没人管。一个测试框架跑完打印400行通过记录,就原封不动留在历史里,后面每轮都跟着重新发送。

Anthropic给的招很实用:用@引用文件省掉读取操作,给noisy命令加quiet flag,大输出任务扔给子Agent隔离。但最重要的一条,是任务做完就/clear。修完一个bug就清掉对话,别让上一个任务的垃圾拖进下一个。记住,省钱不是抠门,是别让无效token吃掉你的利润。这年头,AI工具用得省,才是真本事。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OpenAI企业业务收入反超消费者业务,SaaS老炮儿怎么看这盘棋? [企业追踪]
上一篇 1小时前
华胜天成如何在数字时代开启第二曲线?
下一篇 2022年8月5日 下午7:35

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部