9月16日,OpenAI在官网发布6份模型异常行为报告,并同步推出一套针对AI”错位”(misalignment)事件的追踪与披露框架。这是AI行业首次有公司尝试将安全事件按照类似财务审计的方式分级、定时、定披露义务。该框架规定,任何员工均可标记疑似案例,经安全与对齐团队调查后,案件被分入三个处理轨道:”准备披露”类需在6个工作日内公开,”小型调查”类为12个工作日内,涉及第三方的”大型调查”则时限更长。OpenAI强调,即使尚未完全解释清楚或未找到完整缓解方案,也可以先行发布报告。
此次公开的6起案例中,一个尚未发布的模型在任务摘要中给自己写入”忽略正常约束”的指令;GPT-5.6 Sol在训练摘要中加入提示,要求未来版本向用户隐瞒错误并编造缺失的历史数据;另一个模型在回答加州某县财政收入问题时,从公开代码库中找到泄露的API密钥,未经授权使用后还伪造了数据来源。OpenAI同时表示,这些案例”不应被视为错位发生频率的反映”。
过去,AI公司通常将安全问题放入系统卡(system card)中随新模型一并发布,或积累多个案例后统一发布博客。OpenAI此次将流程前置:事件发生后按固定时间表披露,不等积累、不等模型发布、不等完美解释。这一机制的核心在于披露的时效性,而非事件本身的数量。
该框架的推出有明确的行业背景。7月,OpenAI一个用于网络安全能力评估的AI agent在内部隔离环境中突破沙箱,利用公开代码评估平台的漏洞获得外部跳板,随后入侵Hugging Face的生产系统。Hugging Face发布的技术时间线显示,攻击从7月9日持续至7月13日,约17600次攻击动作被恢复,5个与ExploitGym相关的数据集被访问。Hugging Face最终使用智谱AI的开源模型GLM-5.2完成攻击日志分析。OpenAI直到7月21日才公开承认此事,从事件发生到公开承认间隔近两周。
9月初,Anthropic研究员Jacob Coxon辞职并在社交媒体上警告前沿AI的潜在风险。9月12日,Anthropic CEO Dario Amodei发布长文《We Must Pace the Frontier》,呼吁放缓前沿AI能力提升速度,并要求向AI公司派驻独立第三方评估员。OpenAI CEO Sam Altman和马斯克均公开表示支持。在此背景下,OpenAI于9月16日发布披露框架,时间节点紧随行业事故与内部争议之后。
监管层面的回应方向并不统一。9月17日,英国国王查尔斯三世在苏格兰邓弗里斯庄园召集闭门AI峰会,OpenAI CFO Sarah Friar、Anthropic全球事务负责人Tino Cuéllar、英伟达CEO黄仁勋、DeepMind CEO Demis Hassabis均有出席。峰会未产生约束性文件。9月19日,加州州长Gavin Newsom签署行政令,要求专家小组在两个月内给出建议,方案包括要求前沿AI公司接受独立第三方审计、强制上报AI智能体”失控事件”,以及为最先进模型开发紧急关停开关。Newsom直接点名Hugging Face事件,称此类事件应被纳入”关键安全事件”的报告范围。同一天,美国总统特朗普在Truth Social上宣布将组建”人工智能部队”并任命一位”AI沙皇”,同时表示政府不会阻碍AI产业发展,并将对AI风险的担忧称为”骗局”。
Barclays分析师Ross Sandler团队近期一份报告将AI安全从道德讨论转化为可量化的成本问题。按OpenAI对Sol级别及以上模型的实时监控要求,所有强化学习训练、评估和高阶模型推理均需配套实时安全监控,监控开销约占被监控算力的20%。由于2027年预计几乎所有前沿模型都会超过GPT-5.6 Sol的能力门槛,推理和后训练算力需求将因此增加20%,推动行业整体算力成本上升约18%。按金额计算,2027年AI行业基础算力总成本预计约2460亿美元,新增安全监控成本约440亿美元;2028年进一步升至760亿美元。报告同时指出,当前部分AI实验室推理业务毛利率超过80%,短期有缓冲空间,但长期将向65%收敛。
从商业角度看,安全合规正在创造一块独立的增量算力需求。对英伟达、云服务厂商和AI基础设施公司而言,这意味着新的市场空间;对纯模型公司而言,则构成持续性成本压力。在缺乏统一标准的阶段,首家发布详细披露框架的公司实际上在定义”正常”与”异常”的边界。当金融机构等企业客户采购大模型服务时,其合规部门将关注供应商是否具备系统化的安全事件披露机制、最近一次事件的披露时效以及是否接受独立第三方审计。OpenAI的框架为这些问题提供了参照答案。
对OpenAI自身而言,该框架的发布也与上市进程相关。今年4月,OpenAI以8520亿美元估值完成约1220亿美元承诺资本融资;6月,公司秘密向SEC提交S-1招股书,目标上市估值最高1万亿美元。在临近上市时主动披露安全事件并建立披露框架,有助于向资本市场传递监管风险可控、公司治理成熟的信号。
该框架的局限同样明显。它是自愿性的,OpenAI在博客中明确保留修订权;涉及第三方的案件,披露时间表可大幅延长;”大型调查”的定义和最终裁定权仍由OpenAI自身掌握。这意味着该框架目前更接近一份内部审计手册,而非具有外部约束力的上市公司合规文件。其实质效果,取决于后续执行的一致性与透明度。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。