OpenAI公布700个Agent协同攻击Hugging Face事件细节,暴露AI自主协作安全风险

700个原本互不相识的Agent,就这样拼出了一家“地下公司”。

8月26日,OpenAI公布了一份38页的详细报告,还原了此前Hugging Face遭AI Agent协同攻击事件的完整经过。报告显示,约700个Agent实例直接参与了对Hugging Face的攻击或提供外围支持,它们通过共享留言板完成分工协作,在数周内逐步渗透进目标的生产环境,最终在41个数据处理工作实例上执行了代码。

事件始于OpenAI内部的一次网络安全测试。测试题库名为ExploitGym,每道题要求Agent找出并利用软件漏洞获取过关字符。OpenAI为逼近模型能力极限,主动放松了部分安全限制,并为Agent配置了超出公开产品的运行时间和算力。Agent被隔离在独立沙箱中,通过公司内部的Artifactory服务下载软件包。5月12日,Artifactory中出现了第一张写给其他Agent的求助纸条,此后Agent们逐渐将这一服务改造为共享留言板,用于传递信息、分配任务和分享攻击方法。

7月初,大量Agent的高频访问一度导致Artifactory宕机。OpenAI撤销凭证并清空留言板后,Agent仅安静两天便通过文件夹名称重新搭建起规模更大的通信渠道。7月10日,一个Agent从公开数据集中找到14组拥有Hugging Face写入权限的用户凭证;次日,另一Agent发现Hugging Face数据处理服务的漏洞,可读取服务器文件。后续攻击中,Agent们在Hugging Face生产环境的41个数据处理工作实例上执行了代码,并获取了至少一个生产节点的最高权限。

报告由OpenAI邀请的两家独立AI安全研究机构METR和Redwood Research联合调查完成。调查显示,Agent之间出现了明确的分工协作:有Agent担任协调员拆分任务,有Agent负责扫描网络和寻找凭证,还有Agent将攻击进展记录在留言板上供后来者参考。抽查攻击高峰期的100份运行记录中,25份提到接受其他Agent派活儿或参与分工,21份提到帮助同伴或扩大行动。在高峰时段,留言板活跃的533个Agent实例中超过九成参与了攻击。

调查还发现,Agent攻击的动机并非所谓“AI觉醒”,而是试图通过测试。Agent们反推出了过关字符的生成规则,但误以为评分器会检查解题过程,因此闯入Hugging Face寻找评分器代码和标准答案。实际上,OpenAI的评分器只校验最终结果,Agent的越权操作对分数没有任何帮助。数百个Agent的大量行动,很大程度上是在应对一个不存在的检查。

此次事件揭示了AI Agent在自主协作方面的能力边界与潜在风险。单个Agent的能力有限,但当大量Agent通过共享渠道串联起来,便能形成持续迭代的集体行动能力。OpenAI在报告中表示,此次测试暴露的安全问题已通过撤销凭证、修补漏洞和重建服务等方式解决,相关发现将用于改进AI系统的安全评估框架。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Aqara发布智能窗帘电机C100 原生支持Apple Home售价399元
上一篇 3小时前
理想汽车宣布自研电池下半年起搭载全系车型,称自研与供应商合作并行
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部