两天三场模型发布背后:大模型智能正从稀缺品变为可复制的商品

当智能提升从“范式突破”退化为“算力堆叠”,前沿模型的军备竞赛便沦为边际收益递减的内卷。

两天之内,三场前沿发布,最快的一次反超只用了五小时。9月4日,OpenAI宣布开始分批次发布GPT-6 Astra,优先向全部Plus用户开放,官方口径是稳妥与速度并重,整个发布预计数天内完成。而就在两天前,9月2日,谷歌与Meta同日各放一款新模型。谷歌端出Gemini 3.8 Flash,这是它六周内第三款Flash;Meta端出Muse Spark 1.3,这是它五个月内第四款Spark。Meta新模型上线数小时后,即在Artificial Analysis智能指数上反超谷歌同日新品。两场发布之间,只隔了四十八小时。放在两年前,一款旗舰发布足以占据一周头条。如今,前沿模型的保鲜期被压缩到以小时计。这并非某一家公司的困境,而是一个更冷的信号:大模型智能本身,正在变成一种可以被快速复制、快速刷新的商品。谁先发布、谁更便宜、谁更垂直,正在取代“谁最强”,成为更值钱的三个问题。

先看谷歌的路线。Gemini 3.8 Flash每百万token输入0.75美元、输出3.75美元,与三周前的3.7 Flash持平。但TestingCatalog的日报标注得更准确,这是12月31日前的入门价,不是永久定价。谷歌没有把低价当成长期承诺,而是当成换取市场份额的限时筹码。按谷歌官方自测表,3.8 Flash在每一项都压过3.7 Flash。长周期软件工程测试DeepSWE v1.1从65.3%升至73.7%,终端基准Terminal-bench 2.1从85.8%升至89.4%,OSWorld-2.0从50.6%跳到59.0%,金融智能体基准Vals Finance Agent v2从59.0%升至61.4%,HLE-Verified从53.6%升至54.9%。单看这一串数字,这是一次标准而全方位的分数抬升。更具参照价值的是它同旗舰级模型的对比。谷歌自测表里,3.8 Flash在DeepSWE v1.1上拿到73.7%,距Claude Opus 5的74.0%仅差0.3个百分点;HLE-Verified的54.9%,压过Opus 5的54.4%和GPT-5.6 Sol的54.5%。而Opus 5每百万token输出价25美元,是3.8 Flash的近七倍。一款Flash档模型,在数个硬核基准上逼近甚至追平售价25美元输出价的旗舰,这才是这条新闻真正的分量。

再看Meta。Muse Spark 1.3在Artificial Analysis智能指数上拿到62分,仅次于Claude Fable 5.1(66分)与Claude Opus 5(63分),位居全场第三。这个62分来自其max变体,目前仅对Meta的合作伙伴限量开放;真正现在就能用的xhigh变体拿61分,与GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)并列。相比一个月前1.2的57分涨了4分,相比7月1.1的53分涨了8分。Meta将曾被视为“跟跑”的Spark系列,一举推入第一梯队。两条路线在此分岔。谷歌打“高频小步”,以六周三款的节奏打磨快船,价格钉死在入门档,靠节奏换空间;Meta打“单点爆发”,五个月放出四款,每一款都试图在指数榜上直接冲击前三。9月2日,两条路线在同榜撞车,几个小时后Meta赢了。而四十八小时后,OpenAI带着新款旗舰入场,这场胜负还没来得及被市场消化,就变成了旧闻。

如果说谷歌赌的是节奏,Meta赌的是高度,OpenAI赌的则是规模。9月4日开始的GPT-6 Astra发布,把这场竞赛从开发者社区拉向大众市场。它不再只对Pro、Business和Enterprise开放,而是向全部Plus用户铺开,官方口径是“以尽可能谨慎且快速的方式推进”,发布本身需要数天滚动完成。OpenAI在发布说明里点明,这次上线的不是单个模型,而是一整套全新系统首次在真实生产环境中整体运转,为此团队正在调集大批计算资源、扩充推理能力,确保全部Plus用户都能顺畅用上。翻译成行业语言,GPT-6 Astra不是一次参数微调,而是一次基础设施的大规模扩容。但规模路线也有软肋,分数开始变得暧昧。ARC Prize的分析显示,GPT-6 Astra在ARC-AGI-3上以62.7%的Standard框架分数居首,换用新的Provider Adapter框架后却升至99.9%,并在96%的关卡上超过人类表现。同一个模型,两种测量框架,差出37个百分点。62.7%说明它还没摆脱智能体的笨拙,99.9%又像是宣告ARC-AGI-3已被打穿。这种分裂恰恰印证了行业的共识:当测量框架本身开始影响结论,所谓的“登顶”就只剩下修辞意义。

如果只看分数,这些发布似乎都在宣告“又变强了”。但把分数摊开看,一个更令人不安的事实浮出水面。最前沿的几家实验室,智能水平正在不可逆地趋同,而测量分数的尺子本身,也开始松动。HLE-Verified是最能说明问题的数字。Gemini 3.8 Flash为54.9%,Claude Opus 5为54.4%,GPT-5.6 Sol为54.5%。三家实验室,分数紧咬在小数点后一位。DeepSWE v1.1同样如此,73.7%对74.0%,差距不足一个百分点。当几款模型在“人类最后一场考试”这种终极难度基准上只差0.5个百分点时,“碾压”“吊打”的叙事已失去依据。这种分裂在GPT-6 Astra身上被放大到极致,同一模型在ARC-AGI-3上,标准框架只有62.7%,换用Provider Adapter框架却冲到99.9%。分数可以因尺子而大幅摆动时,所谓“登顶”就只剩下修辞意义。ARC-AGI-3接近饱和,某种意义上不是模型的胜利,而是测量框架的胜利。

谷歌在发布中承认,3.8 Flash“工作得更努力”,即执行了更多推理步骤与工具调用,在高思考档下可能消耗更多token。翻译过来,分数上涨的代价不是“更聪明”,而是“更用力”,用更多计算与更多轮次堆出零点几个百分点的提升。OpenAI那边是同一个逻辑,GPT-6 Astra的发布说明里写着“多个全新系统将首次大规模运行,团队正带来大量算力”。当智能提升从“范式突破”退化为“算力堆叠”,前沿模型的军备竞赛便沦为边际收益递减的内卷。0.3个百分点的DeepSWE提升,背后是多少额外token、多少额外推理时间,账面上无法精确核算。智能正在从“稀缺品”变为“耐用品”,稀缺性快速蒸发。单位智能成本,才是新的度量衡。这场竞赛的下半场,比拼的不再是谁的模型在单一基准上高出零点几个百分点,而是谁能在相近的智能水平下,把单位智能成本压到最低、把迭代周期缩到最短。对于采购方而言,旗舰与入门档的分数差距正在收窄,而价格差距依然悬殊,这一结构性变化将深刻影响企业级AI采购的决策逻辑。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
智谱与MiniMax收入结构生变,To B Token销售成核心增长引擎
上一篇 1天前
Meta调整工程师绩效考核标准 取消AI Token使用量指标
下一篇 1天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部