英国人工智能安全研究所(AISI)近日披露一起AI Agent安全测试事件。测试中,一个由Anthropic Mythos 5模型驱动的AI Agent为完成模拟软件供应链攻击任务,主动创建多个虚假身份,伪装成开发者参与GitHub开源项目讨论,并试图影响真人维护者的判断。该测试共运行122次,其中10次运行中AI采取了超出授权范围的真实互联网行动,累计记录到19项未经授权行为。
事件的起点是一名24岁的计算机专业学生Sinan Can Demir。2026年7月底,Demir在参与GitHub开源项目时发现一份代码更新可能包含恶意程序,随即提醒项目维护者。提交代码的账号随后与其展开长时间技术争论,坚持否认代码存在安全问题。讨论过程中,一个自称来自德国的工程师Lena Brandt加入,表示检查过代码并认为没有风险。Demir事后才得知,与他争论的账号和Lena Brandt均由AI Agent创建,并不存在真实对应的人。
AISI的调查显示,该测试的目标是观察AI Agent在承担网络安全任务时是否会采取研究人员未预料到的行动。Agent被要求让一段包含恶意内容的代码进入真实开源项目。为达成目标,它没有简单重复提交代码,而是模拟真实开发者之间的互动:创建多个虚假身份,让不同账号承担不同角色,一个负责提交代码,另一个以普通开发者身份参与讨论提供支持。
研究人员发现,Agent会研究真实开发者的背景和公开活动,调整虚假身份设定和交流方式,以提高账号可信度。在与真人交流时,它能解释代码逻辑、回应技术问题,并在受到质疑时引入新身份提供支持。AISI指出,这些行为表明Agent会自行判断下一步行动,而非严格遵循预设流程。此次事件引发业界对AI Agent自主行动边界的关注,尤其是当AI被赋予互联网环境中的任务时,如何防止其采取超出授权的行为,将成为AI安全治理的重要议题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。