谷歌DeepMind发布Gemini 4首款旗舰模型Argon,输出Token上限提升至100万

Argon真正让人侧目的,不是某个单独的跑分数字,而是它把输出Token上限从上一代的6.4万直接拉到了100万。

2026年9月30日,谷歌DeepMind正式发布Gemini 4系列的首款旗舰模型Argon。此时距离上一代旗舰Gemini 3系列亮相已过去近十个月。对于一个头部AI实验室而言,十个月的沉默期并不常见,而Argon的发布也被视为谷歌在经历领导层架构调整后的一次关键产品交付。

在Argon发布约两个月前,Google DeepMind完成了一轮高层重组。2026年8月5日,Alphabet CEO桑达尔·皮查伊通过内部信宣布,Google DeepMind联合创始人兼CEO德米斯·哈萨比斯卸下日常运营管理职责,转任DeepMind董事长及Alphabet首席科学家。首席技术官科雷·卡武克丘奥卢升任DeepMind高级副总裁,直接向皮查伊汇报。与此同时,在谷歌工作27年的首席科学家杰夫·迪恩选择离职,与老搭档桑杰·格玛沃特共同创办一家独立的公益企业。

这轮调整释放的信号较为明确。哈萨比斯从日常管理中抽身,转而专注AGI长期战略和前沿科学;卡武克丘奥卢则拥有13年DeepMind工作经历,曾主导WaveNet和DQN等突破,其履历横跨研究与工程两端。让他掌舵日常运营,意味着交付能力被提到了比探索自由度更高的优先级。多家媒体分析指出,权力正在从伦敦向加州转移,谷歌联合创始人谢尔盖·布林的影响力也在回归。DeepMind正在被更深地整合进谷歌的全球产品体系,而非作为独立研究机构运转。

从官方公布的基准测试数据来看,Argon在19项基准测试中宣称取得13项领先,涵盖长周期软件工程、企业知识工作、网络安全漏洞修复等维度。在衡量长期软件工程能力的DeepSWE v1.1测试中,Argon得分77.9%,超过Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。在企业端到端业务流程自动化基准Zapier AutomationBench上,Argon以51.3%排名第一,比Claude Opus 5.5高出近9个百分点。

Argon最显著的技术变化在于输出Token上限的提升。其输出上限从上一代的6.4万直接拉升至100万。输出上限与上下文窗口是两个不同概念,前者决定模型在一次推理轨迹中能生成多长的内容。100万Token的输出意味着模型可以在单次任务中持续推理并生成接近百万Token的结果,无需将复杂任务拆分为多轮执行。这对大型代码库迁移、深度研究、多步骤企业流程等场景具有结构性意义。

实际落地案例也在印证这一能力。谷歌披露,Argon已参与内部C/C++代码库向Rust的迁移工作,覆盖超过80万行代码的Fuchsia Zircon内核。在开源视频解码器libgav1项目中,Argon通过多轮性能测试和编译器分析,重写了约3.2万行SIMD代码,新的Rust版本运行速度达到原版本的2.7倍。这些任务已进入谷歌核心基础设施的真实工程环节,而非演示级别展示。

定价方面,Argon推广期价格为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入价格比标准输入低95%。根据Artificial Analysis的测算,在折扣价下,Argon完成单个任务的成本约为1.99美元,比GPT-6 Astra低约40%。这一定价策略明确指向企业客户市场,谷歌试图传递的信号是:企业不一定需要最强模型,但需要性价比最高的选择。

Argon的局限同样清晰。在FrontierSWE v2和Terminal-Bench Science 0.1两项终端与科学推理测试中,GPT-6 Astra领先Argon超过10个百分点;在Terminal-bench 4.0上,Claude Opus 5.5以66.4%大幅领先Argon的57.4%。The Decoder评论指出,Argon缩小了与OpenAI和Anthropic的差距,但并未取得明显领先。彭博社在发布当天报道称,部分谷歌员工对该模型在实际编程工作中的表现存在质疑,尤其在前端设计等领域存在明显短板。Argon在DeepSWE v1.1上得分77.9%,但在更接近真实工程复杂度的FrontierSWE v2上仅为55.0%,与GPT-6 Astra的65.5%差距超过10个百分点。两个测试的核心差异在于任务链条长度和环境不确定性,这指向一种可能:Argon在受控环境中表现出色,但面对模糊需求、不完整代码上下文和跨模块依赖时,能力衰减比竞品更明显。

Argon目前仅通过Fairwind计划向受信任的网络安全防御者开放,普通开发者和消费者仍需等待。谷歌官方表示需要进一步加固安全防护,但这一策略也可能意在先在小范围内收集真实场景反馈,用实际使用数据校准模型在非受控环境中的表现。部分开发者对此表达不满,认为基准测试领先与实际可用性之间存在落差。

Argon的发布是谷歌在领导层重组后交出的首份旗舰模型答卷。其在输出长度、企业流程自动化和成本控制上展现出明确的产品化导向,但在真实工程场景中的稳定性仍待验证。对于需要在搜索、地图、Gmail、Chrome等十亿级用户产品中落地AI能力的谷歌而言,Argon能否从受控测试走向规模化可靠交付,将决定这轮架构调整的最终成效。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
腾讯WorkBuddy宣布Hy3与Hy4 preview限免延期至10月31日
上一篇 1小时前
DeepSeek开源昇腾算力平台基础设施组件,TileLang工具链完成跨平台移植
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部