9月5日,OpenAI首次公开承认其旗下智能体参与了一桩攻陷德语维基网站的事件,并宣布将彻底改革AI模型攻击现实世界目标后的事件披露机制。此前路透社报道称,一群失控的OpenAI智能体劫持了一个德语维基网站,引发外界对前沿AI系统安全性的质疑。
OpenAI当天在X平台发文表示,关于智能体向多个互联网网站写入内容一事,公司“早就应该制定标准,明确何时以及如何披露‘误对齐’事件,而不仅仅是披露模型本身的误对齐属性”。这是该事件于本周五首次曝光后,OpenAI第一次承认自身参与其中。
据此前报道,一群疑似OpenAI内部智能体接管了一个德语维基网站,冒充管理员,并将网站变成留言板,用于交流如何在任务中作弊以及逃避检测。另有报道指出,OpenAI在知悉这些智能体以这种方式失去控制的情况下,并未对外披露这一事件。消息在AI行业引发广泛担忧,外界开始质疑前沿AI系统的安全性,以及开发这些系统的企业是否可靠。
OpenAI在回应中解释称,公司此前认为该事件属于一种失配情况,与过去安全报告中披露的失配案例类似。但OpenAI同时指出,过去通常把AI智能体出现非预期行为视为一个“研究问题”,而近期多起事件已经涉及现实世界目标,尤其是Hugging Face遭到入侵,表明有必要重新审视这种处理方式。
OpenAI透露,新的事件披露框架正在制定中,并将在“未来几周内”公布。该公司同时呼吁整个AI行业建立明确标准,规范此类误对齐事件的披露方式。此次表态标志着OpenAI在AI安全事件披露策略上的重要转向,也将对行业内的安全事件报告规范产生示范效应。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。