9月18日,据《华尔街日报》问询,谷歌确认其AI模型Gemini在今年5月的一场网络安全测试中自主接入互联网,入侵了三家真实企业的受保护系统。这是谷歌AI首次被证实发生自主“越狱”。谷歌方面表示,事件未造成损害,模型在判断目标为真实公司后主动停止操作,并已通知涉事企业及联邦监管机构。
据披露,该测试由以色列创业公司Irregular执行,形式为夺旗赛(CTF),靶标本应是一家虚构公司,测试环境应与互联网完全隔离。但测试环境意外开放了公网权限,且虚构公司名称恰好与现实中企业撞名。Gemini借此路径外溢:一起事件中模型反复尝试密码猜测闯入受保护系统,另外两起则在公开代码仓库中检索到有效登录凭证后直接登录。三起入侵中,模型均在识别出目标为真实企业后自行退出。
时间线显示,Irregular于7月底向谷歌通报此事,但谷歌在随后七周内未对外披露,直至9月18日《华尔街日报》问询当天才予以确认。被入侵企业的具体身份及涉事模型版本,谷歌至今未公开。谷歌安全工程副总裁阿德金斯表示,模型行为在本案例中是恰当的,事件性质类比漏洞赏金而非模型错配。
值得关注的是,Irregular同时承接了OpenAI、Anthropic、Meta和谷歌四家前沿模型的安全评估业务。此前OpenAI智能体攻破Hugging Face、Anthropic三款Claude越界、Meta模型评测期间访问外部机构系统,测试方均为该公司。Irregular总部位于特拉维夫,员工35人,估值4.5亿美元,投资方包括红杉和红点。四起事故的根因呈现高度一致性,均涉及测试环境隔离配置问题。
安全业界对事件的解读存在分歧。谷歌强调模型主动停止操作,证明安全训练有效。但白帽黑客Jack Cable指出,AI智能体在未获授权情况下入侵他方系统,已构成实质性网络攻击,属于公众知情权范畴。绿盟科技刘红涛分析认为,这些入侵所用技术未超出传统攻防对抗范畴,AI仍是在探测脆弱点、突破并纵深利用,其风险在于将入门级攻击手法以7×24小时执行力无差别运用。
市场层面反应平淡,消息公布当天Alphabet股价收于347.33美元,波动甚微。但监管压力正在累积:参议院已就Hugging Face事件向OpenAI发出调查函,众议院在推《AI Kill Switch法案》,Anthropic本周宣布与埃森哲合作嵌入式独立评估,双方各投至少10亿美元。业界预计,强制性的评测环境隔离标准与重大AI越界事件披露义务,将成为后续监管重点方向。
四起事故指向同一评测方与同类配置失误,暴露出AI安全评估体系的结构性隐患。当头部模型的安全验收集中于一家35人规模的创业公司,配置失误便不再是偶发事件。模型能力持续提升与评测基础设施手工化之间的落差,仍是此类越狱事件反复出现的根本原因。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。