谷歌于9月30日发布其迄今最先进的AI模型Gemini 4 Argon。该模型目前未面向公众全面开放,定位聚焦长流程软件工程、企业知识工作和网络安全防御三大方向。谷歌官方表示,Gemini 4 Argon在真实世界软件工程测试中创下纪录,网络安全基准测试并列第一,并在金融、法律等专业任务基准中处于领先位置。
在核心性能指标方面,Gemini 4 Argon在长周期代码工程测试DeepSWE v1.1中得分77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。在自然语言到代码及应用构建的Vibe Code Bench中,该模型以91.9%的得分领先竞争模型。此外,在跨业务软件端到端自动执行的AutomationBench测试中,Argon以51.3%位列第一。
安全防御能力是此次发布的另一重点。谷歌对Gemini 4 Argon进行了专项训练,使其在网络安全防御方面能力显著提升。在评估模型自动发现并修复软件安全漏洞的CWE-bench v1测试中,Argon以68%的得分并列第一,较3.8 Flash Cyber有明显进步。
模型能力方面,Gemini 4 Argon单次输出上限达到约100万tokens,远高于此前的64,000 tokens,适用于大型代码库处理、长文档分析和多阶段任务执行。在长上下文图结构推理测试GraphWalks中,0至128K区间得分99.7%,256K至1M区间得分84.2%。长视频理解测试LVBench得分91.7%,为当前最佳水平。
在综合代理与知识推理评估中,Argon在Agent’s Last Exam测试中得分39.5%,高于GPT-6 Astra的34.2%。Vals Index测试中,Argon得分68.9%,高于GPT-6 Astra的63.1%和Claude Opus 5.5的67.0%。在涵盖金融、编程、法律、税务等经济任务的Vals Index评估中,Argon得分为68.9%。Artificial Analysis Intelligence Index综合智能与代理能力评估中,Argon得分53,与GPT-6 Astra持平。
谷歌DeepMind Gemini产品负责人Tulsee Doshi表示:“Argon是一个功能全面的模型,在多个领域都具备前沿能力。”
分发策略上,谷歌采取分阶段发布方式。第一阶段通过名为Fairwind Program的计划,向受信任的网络安全防御者提供模型访问权限,并参与美国政府的自愿预发布模型访问流程。此后将先向付费API客户和Google AI Ultra用户开放,再逐步扩展至企业和普通消费者。
定价方面,Gemini 4 Argon初始阶段输入tokens为每百万2美元,输出tokens为每百万10美元;后续价格调整为输入每百万4美元,输出每百万20美元。缓存输入tokens享受输入价格约95%的折扣。
Gemini 4 Argon的发布进一步加剧了前沿AI模型在代码工程、企业知识工作和安全防御领域的竞争。谷歌通过分阶段分发和差异化定价,优先覆盖安全防御场景和付费API客户,这一策略或将在企业级AI市场中形成新的竞争格局。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。