过去两周,Anthropic、谷歌和OpenAI三家前沿模型厂商均未为下一代模型举办发布会,也未发布任何官方说明。但多个开发者社区的信息显示,Anthropic已将两个尚未命名的模型接入生产接口,谷歌为下一代旗舰沿用旧版本号投放至第三方盲测平台,OpenAI在Astra之后未再公开发声。多数用户并未意识到,自己已在为尚未发布的模型提供测试样本。
9月17日晚,Anthropic切断了灰度通道,一批原本被路由至新模型的账号归零,在开发者社区引发集中讨论。一天后通道恢复,覆盖范围从Claude Code扩大至Chat和Cowork。有开发者将这段经历称为“午夜惊魂”。同日晚间,谷歌的新模型也在第三方盲测平台Arena上被发现。该平台出现了一个代号为gemini-3.8-flash的模型,抽到该模型的用户很快注意到异常:它绘制的鹈鹕带有完整的蹬踏动作,生成一张PS5矢量图需十分钟、输出数千行代码,搭建的体素宝塔可在浏览器中实时旋转。3.8 Flash是早已上线的轻量模型,不具备这样的能力。社区随后判断,这是谷歌下一代旗舰Gemini 4 Pro,内部代号Argon。被发现后,该名称又被改为gemini-3.7-flash。
再往前三天,有开发者发现,Claude Code界面调用的模型标注为Opus 5,返回结果却来自另一个模型。对接口请求的抓取显示,后端模型标识已指向5.2。Opus 5发布于7月24日,其间没有5.1,版本号直接跳至5.2。此后Fable 5.2灰测的消息一并传出,一部分原本调用Fable 5.1的请求被后台路由至新的检查点。没有模型卡,没有API标识,也没有定价表,Anthropic未作任何说明。
三家厂商的做法并不相同。Anthropic采用后端路由,前端仍显示旧名称,普通用户无从察觉;谷歌的方式更简单,在第三方盲测平台上沿用旧版本号;OpenAI则在Astra发布之后未再公开发声,公开议题转到了对手之间的对比上。对厂商而言,这样做的收益相当直接,模型在尚未正式命名的阶段即可获得真实负载下的表现数据,一旦出现问题可以随时回退,无需承担公开发布失败的风险。
一个前沿模型正式发布,意味着需要提前配置足以承接瞬时峰值的算力。GPT-6 Astra动用得州Stargate基地超过10万张GPU完成训练,API定价为每百万输入10美元、每百万输出50美元,是上一代Sol的2.5倍。灰度路由的算力投入远低于此:新模型混入旧模型流量,厂商可以控制被路由至新模型的请求比例,在观察真实表现的同时逐步提高占比。
比成本更难处理的是容错。6月9日,Fable 5与Mythos 5发布;三天后的6月12日,美国商务部下发出口管制指令,要求暂停向任何外籍人士提供这两个模型。由于无法实时核验用户国籍,Anthropic将模型对全球用户下线,直到7月1日Fable 5才恢复访问。一次全量发布,换来一次全量下架。此后,团队再做发布,都会倾向先小范围释放、观察反馈。口碑的影响则更难量化:用户调用的是Opus 5,实际得到的是5.2,体验改善明显,却难以归因。等到开发者社区开始流传“Claude Code最近变强了”,传播已经完成,而官方未作任何说明。
就在Opus 5.2被发现的两天前,Anthropic CEO达里奥·阿莫代伊发表长文,主张全行业主动放慢前沿模型的迭代速度。他的理由是,模型能力增长过快,安全与对齐工作已经难以跟上;若能放慢一至两年,并将这段时间用于安全研究,风险将明显下降。文章发出后,马斯克与OpenAI的奥特曼均公开表示支持。奥特曼还提到一项具体安排:出于安全考虑,OpenAI今年不会上市。市场的反应很快,随后的第一个交易日,费城半导体指数下挫5.86%,英伟达下跌3.36%,全球半导体与AI算力硬件产业链当日市值蒸发超过5000亿美元。
三家的处境并不相同。OpenAI月初发布的GPT-6 Astra目前占据约13%的企业AI支出,Anthropic的Fable系列约为8%。Anthropic正在筹备上市,6月已秘密提交申请,目标估值最高2万亿美元,时间窗口定在11月中期选举之前。在这一节点上,一次体验不佳的主力模型发布会,会成为路演材料中的不利因素,而Opus 5的市场口碑本就偏弱。谷歌的处境更为被动:旗舰Pro系列已空缺数月,3.5 Pro被搁置,算力集中投向Gemini 4,产品线暂时只能由Flash系列支撑。
灰测期间流传较广的一种说法,是“Fable 5.2在最高推理档位下碾压了GPT-6 Astra”。这一说法需要分两层看。它来自一位开发者的个人对比测试,原话是“输出看起来明显优于Astra”,且该开发者同时指出代价是更慢、更贵。另一层背景是,Anthropic上一代模型本已领先:在Artificial Analysis的综合智能指数中,Fable 5.1为66,Astra为61;编码智能体指数则为70比67。因此“5.2碾压Astra”未必是误判,但差距的一部分来自Astra自身的基准设置。OpenAI发布Astra时主推的一项成绩,是ARC-AGI-3得分99.9%。但该成绩取自OpenAI自行配置的harness;换用行业标准harness测同一个模型,得分降至62.7%,相差37个百分点。
三个时间点之间的间隔只有十四天:9月3日GPT-6 Astra发布,9月14日Anthropic将下一代模型接入接口,9月17日谷歌跟进。接下来有三个时间节点可供确认:Opus 5.2最快9月底、最晚10月底全面开放;Gemini 4 Pro预计10月正式发布;以及OpenAI是否会推出新模型,回应这一次“被灰测超越”。预测市场上,9月30日前发布新Opus的概率一度超过八成。截至目前,Opus 5.2与Gemini 4 Pro均无模型卡、API标识和定价信息,三家公司都尚未正式表态。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。