9月2日,谷歌发布Gemini 3.8 Flash,延续了Flash系列的高频迭代节奏。该模型输入每百万token定价0.75美元、输出3.75美元,与上一代持平。但第三方评测机构Artificial Analysis当天的实测数据显示,完成同一任务的输出token消耗增加了约30%,折算单任务总成本上升约40%。价格表未动,账单金额却出现明显变化,这一矛盾背后折射出大模型成本竞争口径的迁移。
Gemini 3.8 Flash是谷歌43天内发布的第三款Flash系列模型:3.6于七月下旬推出,3.7在八月十三日发布,3.8紧随其后。谷歌CEO皮查伊此前在财报电话会上表示,Flash系列的目标是尽量接近月更节奏。模型现已进入Gemini App、AI Studio和Antigravity编程平台,Cursor、Vercel等开发工具在发布当天完成接入。
基准测试成绩集中在四类任务上。DeepSWE v1.1长周期软件工程得分73.7%,距离Claude Opus 5的74.0%仅差0.3分;HLE-Verified综合推理得分54.9%,高于Opus 5的54.4%和GPT-5.6 Sol的54.5%;Vals金融智能体得分61.4%位列第一;生成速度约305 token/秒,是独立机构测过最快的商用模型。定价方面,当前优惠价有效期至12月31日,作为参照,Opus 5定价为输入5美元、输出25美元每百万token,GPT-5.6 Sol为输入4美元、输出20美元每百万token。
这次升级的核心设计,谷歌官方的表述是模型会“更努力地完成任务”,具体而言是agentic推理深度的提升。面对复杂任务,模型执行更多推理步骤、更频繁地迭代调用工具,每一步都跑测试、查输出,最终答案的错误率被压下去——DeepSWE能追平旗舰模型依靠的正是这一机制。但每一轮“推理-工具-验证”循环都要消耗输出token,步骤翻倍,token消耗自然上升。高算力模式下,这一放大效应更为明显。Artificial Analysis测出的数据链条显示,单任务输出token增加约30%,折算单任务总成本上升约40%。即便成本上涨,单任务约0.58美元的总花费仍处于“智能-成本”性价比前沿,高推理档综合智能指数59分,比上一代提高3分。
另一层价格变化发生在明年:优惠价到期后,单价将翻倍至输入1.50美元、输出7.50美元每百万token。用量上涨与单价上调两波叠加,构成完整的价格路径。谷歌同时保留Gemini 3.7 Flash作为低成本选项,并承诺继续提供支持。
Flash系列的高频升级节奏,指向开发者入口的争夺。编程Agent和自动化工作流是当前token消耗增长最快的场景,也是各家API收入的主战场。该场景的采购逻辑以单位智能成本为核心,迁移成本极低。Gemini 3.8 Flash在DeepSWE上追至与Opus 5仅差0.3分、价格不到对方六分之一,相当于将旗舰级编程能力的商品价格打穿了一个量级。
同日发布的Gemini 3.8 Flash Cyber则布局网络安全赛道:CWE-Bench漏洞修复得分47.2%,与领跑的Fable 5基本持平;Chrome安全团队实测其有效补丁产出是更大商业模型的2.6倍;Wiz内部渗透测试召回率高出7.5至9.7个百分点,同等成绩花费仅为竞对的1/2.3到1/5.2。该版本不公开售卖,仅通过Fairwind计划向约650家受信机构开放,与Anthropic将Mythos 5.1锁进可信访问计划的门控逻辑一致。前沿网络安全能力正演变为需要资质审核的战略资源。
从产品策略推演,谷歌的算盘打在规模上:Flash承担开发者生态的走量任务,将使用习惯和工具链锁定在自家平台,Pro级别的利润款可以等能力差距真正拉开再发布。这也解释了六月预告的Gemini 3.5 Pro至今未发布的原因——Flash能力过强,Pro的价格锚点难以确立。
需要指出的是,基准口径存在边界。官方主打的四个基准全部领先,但第三方核对完整榜单后发现画面并不均匀。开放式Agent任务是明显短板:Terminal-Bench 4.0上Opus 5得分51.8%,3.8 Flash仅为19.1%;OSWorld电脑操作得分75.4%对59.0%。Harvey法律基准上10.0%的“领先”,实际是全榜模型集体不及格下的相对值。规律大致为:边界清晰、终点明确的专业任务,Flash能贴近旗舰水平;需要自主规划下一步的开放任务,差距会被拉开。沃顿商学院教授Ethan Mollick的初步评价是“一个很好的Flash模型,但并不等于前沿模型”。
所有对比数据均为厂商自测口径,发布日基准与生产环境表现历来存在差距。成本侧的实际影响也取决于任务结构:短问答场景几乎不受token放大影响,长链路Agent任务才是成本上升的主要区域。社区有传闻称部分团队已在评估回迁至3.7 Flash以控制预算,目前尚无官方数据印证。
这次发布可以确认的产品事实是:Flash系列的迭代周期压缩至三周级别,能力触及旗舰边缘,网络安全版本进入资质门控。更值得注意的是成本竞争口径的迁移——当各家每token单价逐渐咬平,“完成一个任务烧多少token”就成为新的定价杠杆。Anthropic两天前将缓存读取价格下调75%,打的也是同一本账。对开发者而言,选型时盯住单任务成本而非单价,将成为价格战第二阶段的核心策略。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。