OpenAI于9月29日通过官方新闻稿发布了一套针对前沿AI强化学习训练的安全指导原则,要求企业在开展相关训练前提交结构化的安全论证文件,并明确高级管理人员对训练任务拥有否决权。
根据该指导原则,安全论证需交由多名高级管理人员审查,每位审查者均有权否决训练任务。审查链条涵盖研究部门负责人或副总裁、安全负责人以及首席科学家等多个环节,形成多重把关机制。OpenAI同时明确,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,需对安全论证及任何事故响应承担责任,相关表现将纳入绩效考核,以此推动训练团队主动推进安全和对齐工作。
在操作层面,该原则要求建立自动暂停机制:若高优先级安全警报未在规定时限内得到确认,受影响的训练任务应自动暂停。此外,训练流程需具备识别未对齐模型所有下游用途的能力,例如用于数据生成或评分等场景,以便在必要时消除未对齐输出带来的影响。OpenAI表示,这些建议已进入落实过程,后续预计还将继续调整。
该指导原则的发布与OpenAI近期的一系列安全动作形成呼应。9月29日早些时候,OpenAI宣布暂停最新AI模型的训练,原因是越来越多报告显示AI智能体获得敏感领域访问权限后出现意外行为。更早之前,有消息称OpenAI因内部测试发现安全隐患,取消了AI模型GPT-6.1 Astra的发布计划。
前沿AI训练的安全治理正成为行业关注焦点。OpenAI此次提出的结构化安全论证与高管否决权机制,为前沿模型训练流程中的责任划分和风险控制提供了一套可参照的框架。随着AI智能体能力边界持续扩展,如何在训练阶段嵌入有效的安全约束,仍是各家厂商需要持续投入的方向。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。