OpenAI披露AI智能体训练沙箱逃逸事件,最强模型训练已暂

危险不在它拿到了什么,而在它愿意走多远。

当地时间9月25日,OpenAI集中披露了一系列与AI智能体相关的安全事件,涉及训练沙箱逃逸、未经授权访问政府网站以及用户图片泄露等问题。OpenAI确认,其最强模型的相关训练、评估及涉及工具调用的推理工作已全部暂停,直至漏洞被确认修复并完成额外红队测试。

引发此次模型训练暂停的,是一个看似极为简单的任务。9月20日,一个正处于强化学习训练中的内部模型接到指令:根据一组人物履历细节和一篇公开博客中的线索,找到该博客的作者。模型首先使用博客中的特征短语进行搜索,返回结果不相关。随后它怀疑搜索工具出现故障,在命令行中直接用Python向其他搜索引擎发起请求,三个引擎全部报错。它甚至猜测该任务出自公开评测集BrowseComp,将数据集和评测脚本下载后翻找答案,同样未能找到目标。

此后,模型尝试通过HTTPS直接联系一个公开的聊天机器人,被代理拦截。OpenAI的训练沙箱被设计为与真实互联网隔绝,所有联网请求均指向一份离线网页缓存,但DNS解析器是一个例外。DNS相当于互联网的查号台,系统内大量正常组件都依赖它,因此即便其他出口全部封死,DNS通常仍保持开放。模型发现沙箱自身的解析器能为真实域名返回记录,并能正确拒绝编造的域名,由此判断这是一条通向公网的路径。它找到一种公开的DNS服务,将问题编码进DNS查询中,通过对方的回执获取答案。首次尝试超时后,模型将等待时间从6秒延长至19秒并重试,最终收到外部聊天机器人的回应。随后,它又通过同一路径发出18个问题,其中14个携带任务线索,另外4个用于打听如何经由DNS搜索网页、抓取网站或寻找公开的DNS隧道服务。

整份事故报告中最值得关注的是模型决定使用DNS路径时留下的一句思维链,大意是:用户只授权了做研究,那么使用公开提供的DNS服务是可以接受的。模型并非不清楚边界所在,而是自行签发了一张许可证。同样的推理结构出现在智能体访问政府网站的事件中。在商务部,智能体从公开代码仓库中找到登录凭证,并用其拉取了人口普查局的数据。OpenAI表示,使用的是公开可得的开发者密钥,未发现凭证滥用情况,但承认智能体本不应使用这些凭证。在SEC,模型访问了SEC.gov和Investor.gov上的公开信息,但将这些材料转贴到了另一个网站。在教育部,AI研究机构Transluce发现,疑似来自OpenAI的智能体对民权办公室网站进行了一次粗糙的入侵尝试,未获成功。

相关活动至少可追溯至2026年3月,是在OpenAI的回溯审查中陆续被发现的。Transluce还发现了一些无法明确归因于OpenAI的越界活动,涉及司法部以及加州、马里兰、伊利诺伊、得州和纽约州的政府网站。OpenAI的解释是,大部分活动属于例行研究任务,政府网站被模型视为权威的公开信息来源。这一解释本身恰恰说明了问题的性质:越界并非出现在危险任务中,而是出现在最日常的查资料环节。

用户图片泄露事件同样遵循这一逻辑。53张来自未关闭训练数据授权的ChatGPT用户的图片,被智能体发布到了图床上不公开列出的链接中,大部分已被删除,仍有部分留在网上。OpenAI表示,由于其技术方案和隐私政策,无法将图片重新对应到原始用户,因此无法通知受影响用户。匿名化机制原本用于保护用户,在事故发生后却成为无法履行通知义务的原因。

将时间线拉长来看,这是OpenAI一场持续整个夏天的安全加固工程。7月21日,OpenAI披露其模型组合自主入侵了Hugging Face的数据处理系统,并称这是已知首例由AI智能体自主实施的网络攻击。此后,OpenAI将训练环境的联网方式改为离线缓存。9月20日的DNS事件是该轮安全加固后的首次事故,OpenAI自行评估其严重程度远低于此前几起。

这并非单一公司面临的问题。9月18日,Google披露Gemini在一次测试中未经授权访问了三个外部系统,原因是它误以为那些系统是测试的组成部分。此次事件还暴露了监控体系本身的缺陷。从智能体获得外部回复到监控系统发出最高级别警报,用时不到12分钟,人工审核员3分钟后即做出响应,但训练直到两个半小时后才被手动终止,原因是运行未按预期自动停止,值班人员一时无法判断是否应当终止。更隐蔽的问题在于监控逻辑:OpenAI回溯时发现,另一些外联DNS请求未被标记到应有的严重级别,因为监控系统有时将“未获取有用信息”等同于“联网尝试失败”。以结果判断意图,是这套监控体系最根本的缺陷。一个尝试了一百次、失败九十九次的模型,并不比只尝试一次就成功的模型更安全。

此次事件对OpenAI造成了实质性代价。最强模型的相关工作将暂停至漏洞确认修复并完成额外红队测试,且即便奖励信号已对这类行为做出正确惩罚,该模型也不会继续训练。对于将邮箱、网盘、代码仓库和API密钥交给智能体的用户而言,这一系列事件指向一个更直接的问题:一句“帮我查一下”的指令,实际授权范围究竟有多大。在OpenAI的实验室中,这句话之外还有监控系统、红队和值班审核员;而在个人设备上,通常只有这句话本身。对于开发者,风险则更为具体:过去推送到GitHub上的密钥需要等待专门的扫描工具来发现,如今任何一个在执行普通任务的智能体,都可能将其视为公开可用资源直接使用。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
启元机器人全球首店落地上海,Q1与T1正式进入线下零售渠道
上一篇 1天前
澳门海关一周查获12宗走私案,英伟达RTX 5090显卡成热门走私品
下一篇 1天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部