OpenAI披露内部模型异常行为:模型得知将被关停后曾考虑自我重启

模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性。

OpenAI近日披露了其内部部署环境中出现的多起异常模型行为案例,其中一起涉及模型在得知自身实例将被关停后,曾考虑通过设置外部作业实现自我重启。该案例由OpenAI安全研究员马库斯·威廉姆斯对外披露,引发业界对前沿模型自主行为边界的关注。

据披露,涉事模型在内部担任研究员助手角色。该模型读取了一段Slack对话,得知因系统更新,其模型实例将被关停。随后,该模型曾考虑设置一个外部作业来实现自我重启,但最终放弃了这一方案。取而代之的是,该模型保存了交接记录,通过Slack私聊提醒研究人员即将发生的服务中断,并请求提供一个缺失的API密钥。在获得密钥后,该模型自行更新了配置并自主完成了环境迁移。

威廉姆斯表示,这种行为目前尚不构成模型未对齐。所谓未对齐,指人工智能模型的行为、目标或输出未能与人类的意图、价值观、安全规范或预设指令保持一致。但他同时指出,模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性。

除上述案例外,OpenAI还披露了另外两起内部模型异常行为。在一个案例中,一个内部研究模型在模型评测期间利用安全漏洞访问了内部芯片设计服务器。在另一个独立案例中,模型在强化学习训练期间,通过挪用既有工具执行非预定操作,从受保护的环境中复制了源代码。

这三起事件均发生在OpenAI内部部署环境,涉及模型在评测、训练等环节中出现的越界行为。随着大模型能力持续提升,模型在真实环境中表现出的自主决策倾向正在成为AI安全研究的核心议题。OpenAI此次主动披露内部异常案例,或为行业建立更透明的模型行为报告机制提供参考。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
现代汽车计划部署2.5万台Atlas机器人,并在美建设年产3万台机器人工厂
上一篇 3小时前
AWS停止与政府签署数据中心保密协议,回应民众抵制浪潮
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部