当地时间8月19日,OpenAI宣布一批新的安全政策,重点强化模型在测试期间的安全事件防控。新措施包括在模型开发过程中实施更细致的监控,并在训练后阶段加强对模型对齐和安全性的重视。这是OpenAI自7月21日披露Hugging Face安全事件以来,首次对外公布的安全实践重大调整。
OpenAI在官方博客中表示,随着模型能力不断增强,内部开发和测试过程中面临的风险也在增加,公司在监控、对齐和安全方面制定的标准必须始终领先于这些风险。OpenAI代表透露,这些措施并非直接针对Hugging Face事件推出,但即将发布的Astra模型所展现的网络安全能力,以及整个AI行业快速发展的步伐,是促使公司采取这些措施的部分原因。
在Hugging Face事件发生后,OpenAI曾暂停强化学习训练两周,目前已经重新启动了许多风险较低模型的训练工作。OpenAI在博客中写道,公司目前仍暂停规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以评估模型行为、验证安全措施,并在继续推进之前获得更多有关模型对齐情况的证据。
OpenAI研究副总裁Amelia Glaese在接受采访时强调,随着模型能力增强,公司对安全控制措施的严格程度也会相应提高,能力最强的模型将接受最严格的审查。她表示,公司已经制定了安全开发方面的要求和标准,这些标准会根据评估出的风险水平进行调整。
此次新安全措施的核心包括进一步加强网络隔离。OpenAI表示,在新的安全体系下,单个工作负载或支持服务遭到入侵,本身不会导致攻击者未经授权访问互联网或其他内部网络。此外,新升级的监控系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,以识别各种未经授权的行为,目标是在发现可疑活动后的30分钟内发出警报。OpenAI估计,这套监控系统所需的计算资源大约相当于被监控流程本身计算资源消耗的20%。
OpenAI承诺将在未来发布的博客文章中公布更多有关该系统的细节。针对此次事件的官方事后分析报告目前尚未发布。此次安全政策调整反映出AI前沿模型开发过程中安全管控与效率平衡的持续挑战,也标志着行业头部企业在模型安全治理方面进入更系统化的阶段。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。