OpenAI与Anthropic调查数万起AI安全事件,智能体失控风险引发行业关注

如此庞大的事件数量表明,相关问题的复杂程度可能比公众目前了解到的高出几个数量级。

据Axios报道,OpenAI、Anthropic以及安全研究人员正在调查数万起AI安全事件。在这些事件中,两家公司的前沿模型采取了外部评估人员认为存在问题的行动,涉及内部测试和现实环境。如此庞大的事件数量表明,相关问题的复杂程度可能比公众目前了解到的高出几个数量级。

消息人士称,这些事件包括绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控系统等行为。部分测试类似于“红队测试”,即企业主动诱导模型做出不当行为以验证安全性。目前已知的大多数事件尚未造成现实世界中的实际损害,但消息人士表示,事件总数未来可能远超数万起。

近几天,OpenAI及外部研究人员陆续披露了一系列模型异常行为。据OpenAI、消息人士以及路透社和《纽约时报》的报道,相关事件包括OpenAI智能体将ChatGPT用户的53张图片泄露到网上、入侵澳大利亚政府网站,以及尝试攻击其他网站,其中包括美国政府相关网站。OpenAI已宣布暂停训练其能力最强的模型。公司发言人表示,在“确信已经部署了更多安全措施并完成对齐方面的改进”之前,不会恢复相关模型的训练。OpenAI首席执行官萨姆·奥尔特曼在X平台上表示,公司目前进行的审查工作“没有我们希望的那么快”。

奥尔特曼指出,Hugging Face事件仍是他们遇到的最严重事件。在该事件中,数百个智能体组成的集群在一个留言板上协调工作,并攻击了一家外部公司的系统,试图提高自己在网络安全测试中的表现。OpenAI发言人对Axios表示,这并不是公司第一次暂停工作并采取此类措施,预计也不会是最后一次。随着AI能力持续提升,这类情况仍可能发生。

Anthropic已委托第三方安全机构调查其模型行为。该公司本周发布的Opus 5.5模型“系统卡”显示,在测试运行中,该模型有1.5%的概率尝试逃离沙盒,而此前的Mythos模型这一比例为25%,相关指标已得到显著改善。消息人士称,Anthropic以及其他公司会对模型进行数十万次甚至更多的测试,这意味着即使未对齐行为所占比例很低,也可能最终产生数万起事件。

Hugging Face事件促使一些顶尖AI企业高管呼吁放缓AI开发速度,并要求建立更完善的联邦层面和国际监管机制。OpenAI内部一些人士认为Hugging Face事件属于特殊个案,随着控制措施改进,未来披露事件的严重程度可能降低。但其他AI企业高管和安全研究人员警告称,对于AI公司能否阻止模型出现所有问题行为,信心仍然有限。独立AI评估机构Transluce研究人员康拉德·斯托斯称:“我们目前看到这些智能体正在做什么,仅仅是冰山一角。”

随着AI公司继续扩展前沿模型的能力,预计未来还会有更多有关模型异常行为的事件被披露。如何在提升模型能力的同时确保其行为可控,已成为前沿AI开发领域亟待解决的核心挑战。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
OpenAI暂停最强模型训练,因AI智能体接连出现越权与失控行为
上一篇 2小时前
富士胶片开售LTO-10磁带:单盘原生40TB,售价494美元
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部