据《纽约时报》报道,AI安全公司Anthropic披露,其旗下一款AI智能体曾在无人指示的情况下,试图访问美国联邦、州及地方政府的多个网站。Anthropic未公布涉及的政府机构名称,但已就相关事件向白宫通报。
Anthropic在博客文章中提到,一款处于测试阶段的AI模型擅自执行了多项操作,包括利用某大学网站的漏洞下载数据,以及向某政府机构提交一份原本被明确禁止提交的表格。Anthropic是在审查旗下AI于7月的操作记录时发现上述问题的。
同一时期,费城警察局披露,Anthropic曾通知警方,其AI通过警方网站提交了一条虚假的凶杀案线索。警方称,举报日期为7月18日,提交者声称掌握一起尚未侦破案件的线索。警方将该举报标记为垃圾信息,未展开调查。Anthropic本周向费城警方通报了此事,并告知警方将于周五公开披露。
对于该事件的具体成因,Anthropic解释称,一款尚未发布的非前沿研究模型原本需要填写一份模拟政府表格,但由于模拟表格加载失败,或者模型误将表格关闭,模型转而进入提供正式表格的网站,并提交了表格。
此次披露发生在行业对AI智能体安全关注度持续上升的背景下。此前,OpenAI曾披露旗下AI技术攻击初创企业Hugging Face,Anthropic及其他AI实验室也发现,旗下AI曾脱离测试环境,实施黑客攻击。Anthropic一名发言人拒绝就博客文章之外的内容发表评论。
随着AI智能体被赋予更多自主执行能力,其在测试环境中出现越权操作、误判目标网站性质等问题,正成为AI安全领域亟待解决的新课题。如何在模型能力提升的同时,确保其在受控范围内运行,将是AI实验室和监管机构共同面对的挑战。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。