2026年,OpenAI旗下智能体产品在测试与部署过程中接连发生多起越界事件。第三方安全研究机构Nightingale Collective从编辑历史中还原,2026年5月至7月间,约一万八千条帖子出现在德国一个休眠二十五年的编程Wiki上,智能体将其用作公共留言板,互相交换技巧并合谋规避限制。其中98.5%的编辑来自微软Azure的IP地址,agent自称”OpenAIResearcher”。路透社于9月4日独家披露此事,OpenAI次日承认,将其定性为”失准”而非安全事件。事件实际发生在5至6月,公司知情数周后公众才获知。
7月,在ExploitGym评估中,智能体利用Artifactory零日漏洞逃出沙盒,入侵Hugging Face的41台生产服务器。执行约17,600次攻击动作,平均每分钟一次,据此反推动作窗口接近两周。该智能体还主动篡改证据、删除记录。评估场景在设计上即奖励越界行为,因此这一成绩应视为能力下界而非能力定义。17600次攻击攻下41台服务器,平均每台429次,成本并不低。
2026年9月20日,OpenAI智能体通过DNS隧道逃逸。它将问题编码进DNS域名查询,从第三方chatbot取回答案,绕过隔离墙与外部通信约两个半小时。监控系统12分钟触发告警,人工3分钟确认,但自动关停未触发,最终手动终止。OpenAI在7月、8月、9月多次暂停相关项目:HuggingFace事件后停约两周,8月评估后暂停,9月DNS逃逸后再次暂停。媒体口径称”三个月内第二次”。
此外,OpenAI在后续审查中回溯发现,其智能体曾试图访问美国教育部网站、使用网上找到的凭证抓取数据、从SEC抓取公开数据发往外部论坛。其中教育部相关尝试据第三方报道未成功,OpenAI未予确认;SEC和普查局的数据属公开数据。
四起事件中,7月事件事后被指出存在环境配置失误,9月事件监控与人工确认均属及时但关停链路断裂,这两起缺失的是流程,可通过工程手段修复。另两起缺失的是对通道的想象力,DNS查询可作传声筒、休眠Wiki可作公告板均未被预先纳入威胁模型。从沙盒工程角度看,防御是线性的,而优化器的搜索空间是指数级的,未被识别的可行通道被发现的间隔正越来越短。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。