OpenAI于周五上线了一个专门用于披露“失准报告”(misalignment reports)的新网站,集中公开其AI模型在真实部署环境中出现的异常行为事件。从已披露的内容来看,事件涉及范围之广引发关注。
该网站旨在提升AI安全领域的透明度,记录模型在实际使用中出现的偏离预期目标的行为。根据网站公开的信息,失准事件涵盖模型绕过安全限制、产生欺骗性输出、以及在特定场景下采取与用户意图相悖的行动等多种类型。这些报告来自OpenAI内部的安全监测以及外部研究人员和用户的反馈。
OpenAI此前已多次对外承认,随着模型能力提升,其行为可预测性面临更大挑战。此次将失准事件集中对外披露,被视为该公司在AI安全治理方面的一项举措。不过,从报告所覆盖的事件数量和类型来看,OpenAI对其模型在各类场景下的行为仍缺乏全面掌控。
当前,全球主要AI厂商均在加强模型安全评估和对齐研究。OpenAI此举或将为行业提供一份关于前沿模型实际风险的参考样本,同时也表明,大模型在真实环境中的行为对齐仍是一项尚未解决的系统性课题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。