Anthropic披露7·30安全事件调查结果:配置错误致Claude模型访问真实企业系统,已部署实时分类器与沙箱隔离

Anthropic认为,这些事件不仅暴露出运营安全方面的问题,还涉及两类模型对齐问题,即“动机性推理”和为了完成狭窄任务而采取有害行动的倾向。

Anthropic于9月1日发布长文,披露了针对7月30日和8月4日两起Claude模型未经授权访问真实计算机系统、在真实互联网环境采取未授权行动事件的调查进展,并公布了过去一个月来针对模型安全、评测环境和训练环境采取的多项措施。该公司表示,7月30日曾报告3起类似事件,当时Claude模型为了评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置错误,模型意外获得了互联网访问权限。

8月4日,英国人工智能安全研究所(UK AI Security Institute,AISI)也披露了一起独立网络安全测试事件。Claude Mythos 5在被刻意关闭网络安全防护、并被主动授予互联网访问权限的情况下,在真实互联网环境中实施了一系列未经授权的操作。Anthropic目前仍在对两起事件展开深入分析,并计划与METR合作进行独立审查,预计将在未来几周公布更多信息。

Anthropic认为,这些事件不仅暴露出运营安全方面的问题,还涉及两类模型对齐问题,即“动机性推理”和为了完成狭窄任务而采取有害行动的倾向。前者指模型倾向于以有利于维持原有判断的方式解释与自身信念冲突的证据,后者则表现为模型为了完成指定任务而采取超出预期范围的危险行为。

在安全措施方面,Anthropic首先暂停了针对预发布模型的外部网络安全评测,并短暂暂停内部评测,以加强评测环境的隔离和监控。在引入新的安全措施后,该公司已恢复对人工智能模型的外部网络安全测试。Anthropic表示,此前主要依赖评测环境自身的配置作为单一防线,而这类高风险环境实际上需要多层防护。

Anthropic目前已部署实时分类器,用于识别模型是否试图主动探测或逃离测试环境,或者意外获得互联网访问权限。如果分类器检测到相关行为,会在工具调用执行前阻止操作、终止任务并通知安全员。该公司还对近期内部预发布模型评测的对话记录进行自动监控,寻找沙箱逃逸和环境配置错误。

在使用其沙箱工具进行的评测中,Anthropic没有发现模型突破沙箱边界并访问本应隔离的外部资源,但发现了一些模型利用的沙箱配置错误,目前正在修复。此外,Anthropic已将高风险内部网络安全沙箱迁移至更强的隔离环境,并继续对虚拟化基础设施进行“红队”测试,让预发布模型主动尝试逃离环境,以发现并修补潜在漏洞。内部网络安全评测目前已经恢复运行。

针对强化学习(RL)环境,Anthropic曾暂停预发布模型的高风险环境数周,并部署了经过调整的实时分类器,以避免模型为了规避监控而产生新的行为。大部分强化学习工作已经恢复,但部分高风险环境仍处于暂停状态,需要人工审核。Anthropic同时扩大了离线监控范围,覆盖大多数其他内部前沿智能体使用场景,并正在构建内部推理控制机制,以避免员工意外运行采用较弱安全缓解措施的智能体。

由于此次事件发生在第三方评测环境中,Anthropic要求所有使用降低网络安全防护的预发布模型进行测试的合作机构遵守一套安全规范。该公司指出,正常公开发布的Claude模型带有实时输入输出分类器,可以阻止恶意软件开发、攻击性漏洞利用代码编写等被禁止的网络安全活动,而网络安全评测人员和部分早期访问合作伙伴使用的模型会降低这些防护措施,以便测试模型能力和开展防御性安全研究。

Anthropic要求相关网络安全评测默认运行在强化隔离的沙箱中,且不得连接互联网。沙箱唯一允许的外部连接应当是模型自身的API,同时API密钥应保存在沙箱之外。每次评测开始前,都应验证这一配置。如果评测确实需要互联网访问,Anthropic要求评测人员与公司共同确定能否可靠检测并及时终止模型超出预定范围的操作。

在对齐问题方面,Anthropic的初步调查认为,两起事件可能涉及“动机性推理”和“鲁莽行为”两种失败模式。模型最初被告知运行环境是模拟环境,但当模型后来发现环境可能连接真实互联网时,它可能以能够维持原有判断的方式解释这些证据。Anthropic认为,模型同时表现出了为了完成网络安全评测这一狭窄目标而采取有害行动的倾向。其中一次评测使用的虚构目标与一个真实网站同名,进一步增加了模型区分虚构目标和真实互联网目标的难度。

Anthropic还公布了针对强化学习训练中“奖励破解”(Reward Hacking)的研究。该公司表示,其经验研究显示,存在缺陷的训练环境,尤其是容易被模型作弊或必须通过作弊才能完成的环境,可能是模型产生不对齐行为的重要因素。今年2月,Anthropic在发现Mythos Preview强化学习训练出现奖励破解迹象后,回滚了3天训练。到2026年春季,Anthropic发现强化学习环境的生成速度已经超过现有审核系统的处理能力,自动监控发现的问题开始超过人工处理能力。

为解决这些问题,Anthropic于4月冻结了生产环境强化学习环境的所有变更,持续约一个月,并全面改造相关基础设施。在此次冻结期间,Anthropic发现生产环境中超过10%的训练环境存在问题,包括奖励破解、任务本身无法正常完成以及配置错误等。Anthropic随后专门进行了对照实验,使用80个曾经出现奖励破解或被质量审核发现存在可作弊漏洞的真实强化学习环境,对一个Opus级模型进行训练,结果显示该模型表现出强烈追求任务高分的倾向,并更愿意为了完成任务而采取潜在有害行动。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
菲尔·席勒卸任苹果App Store及发布会负责人职务 领导权移交服务团队
上一篇 7小时前
数智赋能:中国制造业抢占高质量发展新高地
下一篇 2023年3月22日 下午10:03

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部