谷歌发布Gemini 4 Argon旗舰模型,18项基准测试中拿下12项第

在谷歌公布的18项基准测试中,Argon拿下12项第一、1项并列第一;GPT-6 Astra拿下3项第一、1项并列第一,Claude Opus 5.5则拿下2项第一。

谷歌正式发布新一代旗舰大模型Gemini 4 Argon,这是该公司时隔10个月推出的旗舰产品。谷歌确认,9月15日在LMArena上以“gemini-3.8-flash”名称亮相、表现接近GPT-6 Astra的模型,即为Gemini 4 Argon。

据谷歌介绍,Gemini 4 Argon采用了公司迄今规模最大的预训练,主要面向长程编程任务、企业级知识工作和网络安全防御场景。在谷歌公布的18项基准测试中,Argon拿下12项第一、1项并列第一;GPT-6 Astra拿下3项第一、1项并列第一,Claude Opus 5.5拿下2项第一。

具体成绩方面,在长程软件工程测试DeepSWE v1.1中,Argon以77.9%刷新纪录,高于Astra的74.1%和Opus 5.5的74.2%。在衡量知识工作能力的Vals Index中,Argon以68.9%排名第一。在Zapier业务自动化测试AutomationBench中,Argon以51.3%领先,Opus 5.5和Astra分别为42.5%和41.4%。金融研究测试Vals Finance Agent v2中,Argon得分65.4%;法律任务测试Harvey Legal Agent中得分19.6%,Astra为5.4%。长视频理解测试LVBench中得分91.7%,GraphWalks长上下文图检索测试中得分84.2%。网络安全方面,Argon与Astra在CWE-bench v1中以68%并列第一;在Gray Swan的提示注入测试中,针对Argon的攻击成功率仅为0.7%,为参测模型中最低。

Argon也存在明显短板。在FrontierSWE v2中得分55.0%,Astra为65.5%;在Terminal-Bench Science 0.1中分别为57.6%和68.1%,两项测试均落后10.5个百分点。在Terminal-Bench 4.0中,Argon得分57.4%,低于Opus 5.5的66.4%和Astra的58.2%。这表明Argon在知识工作上具备优势,但在需要持续操作和执行的任务上仍未追上竞争对手。

幻觉控制是Argon的另一特点。在Artificial Analysis的AA-Omniscience测试中,Argon幻觉率最低,未答对的问题中仅15%给出错误答案,其余选择承认“不知道”。作为对比,GPT-6 Astra在不同推理设置下的幻觉率为45%至51%,Opus 5.5和Fable 5.1在最高推理设置下分别为59%和73%。不过在Artificial Analysis公布的智能指数图中,Argon得分53分,与Astra、Claude Fable 5.1同分,低于Opus 5.5。

目前普通用户和开发者尚无法使用Argon,首批获准使用的是谷歌Fairwind计划中的网络安全防御人员。尝鲜期内,Argon每百万输入token收费2美元,每百万输出token收费10美元,缓存命中的输入价格降至每百万token 0.10美元,低于Astra和Opus 5.5。尝鲜期结束后,标准价格将恢复至每百万输入token 4美元、输出token 20美元。

谷歌同时介绍了Argon的安全设计,包括为首批用户提供移除网络安全护栏的特别版本,以及“监控内部激活”的安全手段,用于识别模型推理过程中的风险信号。据谷歌介绍,Argon已在公司内部投入使用,帮助量子计算团队优化编译流程,将时空开销较已发表基线降低40%;分析跨数据中心性能数据并释放超过300 TiB内存;将C/C++代码迁移至Rust,涉及re2、libgav1及80万行的Fuchsia OS Zircon内核。

自Gemini 3 Pro发布以来,谷歌已近10个月未推出新一代旗舰。此前因Gemini 3.5 Pro表现未达预期,加上内部人事动荡,谷歌一度被认为在旗舰模型竞赛中掉队。Gemini 4 Argon的发布能否帮助谷歌重回领先位置,仍需结合独立评测和实际使用体验来判断。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
腾讯、字节、月之暗面密集布局FDE岗位,大模型交付成本难题待解
上一篇 3小时前
Meta AI助手Muse接连曝出隐私与安全问题,上线两周下载量超250万
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部