据彭博社报道,Alphabet旗下谷歌已开始向一小批经过筛选的网络安全合作伙伴开放其旗舰人工智能模型Gemini 4 Argon,并计划在完成更多测试后扩大开放范围,优先面向付费订阅用户。谷歌表示,该模型在多项基准测试中取得靠前得分,其中一项衡量安全能力的测试成绩超越了OpenAI的Astra模型。消息公布后,Alphabet盘后股价一度上涨约1.7%,但随着员工质疑报道的发出,常规交易日尾盘涨幅出现回落。
尽管基准测试成绩亮眼,谷歌内部对该模型在实际工作场景中的表现存在分歧。几位直接参与项目的知情人士透露,Gemini 4在处理部分代码任务时遇到困难,尤其不擅长前端设计,即决定应用程序与网页外观和交互体验的相关工作。这一短板可能成为严重挫折,因为谷歌在竞争激烈的人工智能代码工具赛道本就处于追赶位置。另有知情人士指出,该模型体量非常庞大,运行成本通常居高不下,可能对利润空间形成压力。
谷歌方面否认Gemini 4在代码等领域表现不佳的说法,并将问询引向DeepMind负责人科拉伊·卡武库奥卢此前的公开表态。卡武库奥卢称自己对这款模型的性能感到鼓舞,并表示团队将持续站在技术最前沿。一名熟悉研发工作的谷歌员工表示,公司内部已形成广泛共识,认为Gemini 4处于行业前沿水平,并已针对该模型开展严苛测试。
内部看法存在明显分化。一部分员工认为,Anthropic的Fable与OpenAI的Astra迭代提升速度已超过Gemini,即便Gemini 4发挥最佳水准,仍会在部分领域落后于竞品。另一部分员工则认为新版本已经追上领先的人工智能实验室。这种分歧反映出谷歌在激烈竞争中的焦虑:几乎旗下所有产品都以Gemini系列模型为底层支撑,包括搜索页面的人工智能回答、地图、邮箱以及Chrome浏览器,上述每款产品用户规模均超过十亿。
谷歌原本计划在六月份发布另一版本Gemini 3.5 Pro,该模型在五月份I/O开发者大会上公布,并承诺于次月正式发布,但原定发布期限过后,公司直接搁置了该项目。彭博行业研究分析师曼迪普·辛格提出,训练开发这一级别的大模型单次训练运行开销最高可达4亿美元,再加上高薪人工智能研究人员的人力投入,整体成本还会进一步走高。放弃Gemini 3.5 Pro不仅阻碍了谷歌的人工智能发展规划,还可能让公司付出高昂的时间与资金代价。
行业专家指出,谷歌或许正陷入整个行业的通病:过度看重基准测试得分,即所谓的“基准跑分内卷”现象。工程师会投入更多精力刷出好看的测试分数,而非开发一款可以切实把任务做好的产品。人工智能初创企业Surge AI创始人埃德温·陈表示,如果一味依赖基准测试,实验室就会倾向于专门针对特定编程语言优化模型的代码能力,而不是去开发体验良好、设计完善的应用。他以SAT考试作比:高分并不等同于现实当中的实际能力,这是一个危害极大的问题。
知情人士同时指出,Gemini 4依然具备优势。该模型擅长解析文本以外形式的输入内容,例如从视频中提取元数据;在安全防护、网络安全方面表现突出,输出内容的沟通表达清晰自然。谷歌对外说明,Gemini 4面向软件工程、金融、法律以及网络安全领域时长较长、复杂度高的工作任务而设计,相比前代版本可生成更长的回复,单次输出最高可达一百万词元,大约相当于七十五万个单词。
谷歌内部挫败情绪已十分明显。此前彭博社报道在采访研究人员时,对方批评公司体系庞大、层级繁杂,试图把人工智能技术强行嵌入几乎全部产品线,不断变动的任务目标与优先级调整导致企业很难落实一套连贯统一的发展策略。与此同时,一批顶尖人工智能研究人员相继离开谷歌,包括传奇工程师杰夫·迪恩、诺贝尔奖得主约翰·江珀,以及参与发明本轮人工智能热潮底层技术的诺阿姆·沙泽尔。今年八月,长期主管谷歌人工智能研究工作的德米斯·哈萨比斯转任董事长,将DeepMind日常运营工作移交给长期副手科拉伊·卡武库奥卢。
在谷歌奋力追赶的同时,竞争对手仍在高速推进。本月早些时候,Meta平台公司发布了Muse这款AI智能体产品。对谷歌而言,Gemini 4能否在真实工作负载中兑现基准测试所展示的能力,将直接影响其说服消费者、开发者和企业继续留在谷歌平台上的筹码。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。