Anthropic刚发了一篇博客,核心就一句话:各位开发者,别再拿token当柴火烧了。官方甚至亲自下场,列了六条省钱心法。这事有意思,厂商主动教用户怎么少花钱,在AI圈可不多见。
先看这笔账怎么算的。开发者日均烧13美元的token,月均150到250美元。订阅制从20美元到200美元分三档,但API按量走,实际花销完全看你怎么用。同样修一个bug,问法不同,花费能差出好几倍。就问你,这钱花得冤不冤?
token计价逻辑,藏着最大的坑
每次请求背后有两笔钱:预填充和解码。预填充是并行读入所有输入token,解码是串行一个字一个字往外吐。200个token的回复就是200次独立运算,所以输出token比输入贵5倍。Opus 5输出25美元/百万token,Sonnet 5是10美元,Haiku 4.5只要5美元。模型选错,成本翻倍。更关键的是推理强度,max和low之间思考token能差好几倍。牛刀杀鸡的钱,花得最冤。
提示缓存,才是薅羊毛的大杠杆
缓存读取只要正常输入价的0.1倍,直接省90%。但缓存有个致命弱点:必须从请求第一个字节开始连续匹配,中间任何变化全部作废。切模型、切推理强度、开关Fast mode、/compact压缩、超时过期、恢复旧会话——六种情况随便中一个,整个对话历史从0.1倍打回原价。更坑的是opusplan模式,每次进出plan都切模型,缓存失效一次,来回跳就是全价prefill来回烧。
会话膨胀,是比缓存失效更隐蔽的杀手
每轮对话都在拖着前面所有轮的内容重新发送,第40轮对话在重新发送第1到39轮的全部累积,增长接近O(n²)。Claude Code有个兜底:命令输出超30000字符就写临时文件,但30000以下没人管。一个测试框架跑完打印400行通过记录,就原封不动留在历史里,后面每轮都跟着重新发送。
Anthropic给的招很实用:用@引用文件省掉读取操作,给noisy命令加quiet flag,大输出任务扔给子Agent隔离。但最重要的一条,是任务做完就/clear。修完一个bug就清掉对话,别让上一个任务的垃圾拖进下一个。记住,省钱不是抠门,是别让无效token吃掉你的利润。这年头,AI工具用得省,才是真本事。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。