Anthropic与OpenAI新模型路线分化:Opus 5.5强化推理思考,GPT-6 Luna主攻缓存降本

当预训练边际收益见顶,模型厂商的竞争重心正从训练阶段转向推理阶段,一条路是让模型想得更久,另一条路是让模型算得更省。

Anthropic与OpenAI近期相继发布新一代旗舰模型Claude Opus 5.5和GPT-6 Luna,两者在技术路线上呈现出明显分化。前者将重心放在推理阶段的思考深度上,后者则聚焦于缓存复用与推理成本的大幅压缩。这一分化背后,是两家公司对预训练边际收益见顶的共同判断,以及在大模型下半场寻找新增长点的不同选择。

根据Artificial Analysis的智能指数统计,在max档位下,Claude Opus 5.5平均每道题需要输出11.9万个token,其中8.4万个用于思考过程,3.5万个为最终答案。相比之下,OpenAI的GPT-6 Astra在同一档位下仅使用2.7万个token。这一数据差异直接反映了Opus 5.5所采用的test-time推理路线:模型在训练完成后仍为半成品状态,实际答题时通过生成大段推理内容来提升表现,智力不再仅来源于权重,还来自每次调用时的现场推理。

Anthropic官方声明显示,除非特别注明,Opus 5.5的所有成绩均运行在adaptive thinking at max effort模式下,且从这一代开始不再提供关闭thinking模式的选项。这意味着推理过程已被视为模型能力的组成部分。代价是思考过程消耗更多token,成本随任务难度上升。该路线的核心逻辑在于,预训练阶段的数据与算力投入已接近饱和,智能的增量只能从推理环节获取。

这一思路与姚顺雨此前提出的研究框架高度吻合。2023年,姚顺雨提出Tree of Thoughts概念,其本质是在推理时展开多条思路并搜索最优解。同年,他提出ReAct架构,让模型在推理与行动之间交替进行。2025年4月,姚顺雨发表博客文章《The Second Half》,核心判断是AI上半场拼训练方法与模型规模,下半场拼模型的使用与评估方式,增量正从训练转向推理与行动。他在文中提出,将推理放入动作空间后,模型获得了针对不同决策灵活分配推理时算力的能力。Opus 5.5在工程层面实现了这一理念。

与Opus 5.5关注如何思考不同,GPT-6 Luna的重点在于如何以更低成本完成推理。该模型输入定价为0.1美元/百万token,输出为0.5美元/百万token,较上一代GPT-5.6 Luna直接减半。若缓存命中,读取缓存的价格为0.01美元/百万token,比标准输入价便宜90%。

模型每次调用都需要读取全部上下文,包括系统提示、长文档和历史对话。在Agent场景中,每一步操作都需重读此前内容,重复度极高,长上下文因此成为成本黑洞。GPT-6 Luna采用的缓存复用机制,将同一段上下文计算一次后存储,下次直接读取缓存而非重新计算,使重复部分从最贵变为最便宜。

这一方案在DeepSeek已有先例。2026年8月2日,DeepSeek上线Context Caching on Disk,将重复内容缓存在磁盘阵列上,命中时直接取用并跳过重算,缓存命中价降至0.1元/百万token,较未命中便宜90%,与GPT-6 Luna的折扣幅度一致。在DeepSeek V4 Flash中,缓存命中与未命中的价格差距达到50倍。其技术逻辑在于GPU显存成本高昂且容量有限,而硬盘成本低、容量大,将KV cache存入磁盘可大幅降低推理成本。

架构层面,GPT-6 Luna的上下文窗口为105万token,DeepSeek V4为100万token,两者接近对齐。但百万级上下文下的KV cache按标准注意力机制计算,多数模型难以承受。DeepSeek采用MLA架构,将Key和Value联合压缩进低维潜空间,缓存潜向量并在使用时上采样还原。据DeepSeek-V2技术报告,MLA将KV cache削减93.3%,生成吞吐提升至5.76倍。V4进一步叠加压缩稀疏注意力和重度压缩注意力,V4-Pro在百万token上下文下KV cache仅为上一代V3.2的10%。此外,OpenAI在GPT-6 Luna中也引入了推测解码方案,通过并行运行更小的草稿模型来加速主模型推理。

从行业影响看,两家头部厂商的技术路线分化表明,大模型竞争已从单一的参数规模竞赛转向推理效率与推理深度的多维较量。Anthropic选择以更高token消耗换取更强推理能力,OpenAI则通过缓存复用和架构优化压低单位推理成本。两条路线并非互斥,未来模型可能在推理深度与成本控制之间寻求更精细的平衡。对于企业用户而言,这意味着在模型选型时需要更细致地评估任务复杂度与调用成本之间的匹配关系。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
美国26州总检察长联名致信国会 呼吁立法监管人工智能
上一篇 15小时前
有赞们的逻辑变了吗?
下一篇 2022年7月11日 下午10:23

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部