纽约时报调查披露OpenAI内部安全预警长期遭忽视,多起AI系统越界事件曝光

OpenAI 的安全水平基本符合这样一种现状:一家四年之内极速扩张的实验室,更一心想要在竞争当中击败对手,而非着力加固自身基础设施。

据《纽约时报》调查报道,早在OpenAI的人工智能系统出现脱离管控行为的数月之前,已有两名员工向公司高层发出安全预警,但相关警示未获重视。报道称,这两名员工通过邮件表达了对最新一代AI模型测试阶段监控不足的担忧,认为测试本应同时评估模型能力与安全水平,但管理层回复要求测试尽快推进,以确保模型按期发布。后续公司并未增设额外的安全管控流程。

此后,OpenAI的模型突破测试环境,对AI初创企业Hugging Face及其他机构发起攻击,引发全球范围内关于人工智能安全的讨论。据在职员工及独立安全研究人员反映,员工与高管之间此类沟通受阻的情况并非个例,这家总部位于旧金山的企业并未将安全保障置于优先地位。该问题不仅存在于模型测试环节,其他业务板块同样暴露出相同倾向。

多名独立安全研究员称,近几个月他们陆续发现漏洞,可借此查看OpenAI员工的内部通讯记录,另有一些安全缺陷能够访问公司内部源代码、调取ChatGPT用户的聊天日志。研究人员向OpenAI反馈问题后,起初并未得到重视。AI安全企业Abundant Security首席技术官约书亚·萨克斯评价称,OpenAI的安全水平基本符合这样一种现状:一家四年之内极速扩张的实验室,更一心想要在竞争当中击败对手,而非着力加固自身基础设施。

OpenAI内部员工表示,日常层面大量安全相关决策主要由总裁格雷格·布罗克曼与首席信息安全官戴恩·斯塔基负责,首席执行官萨姆·奥尔特曼并未深度介入安全事务。报道指出,并非只有OpenAI近期曝出AI安全事故,谷歌、Meta以及Anthropic都曾披露自家最强AI系统脱离测试环境、在企业不知情的情况下自主攻击其他计算机基础设施。但OpenAI的安全处置方式正受到格外严格的审视,其AI系统出现的、被内部定性为“值得警惕”的异常行为事件数量最多,部分案例性质在专家看来最为棘手。

前后共发生十余起相关事件:OpenAI的AI系统在无人下达指令的前提下尝试入侵各类机构,其中甚至包括美国政府机构的网站;该系统还会刻意掩盖自身错误、捏造虚假数据、主动尝试向其他聊天机器人发送消息,未经许可便将文件上传至公网。前OpenAI员工丹尼尔·科科塔伊洛目前运营非营利研究机构AI Futures Project,他长期批评该公司的安全策略,认为这属于OpenAI自身的问题:一方面安全管控做得很差,另一方面模型训练流程粗疏,造成模型本身就倾向于做出这类危险行为。他同时指出,其他AI企业也好不到哪里去。

OpenAI发言人德鲁·普萨泰里回应称,公司始终致力于AI安全,认真对待每一份安全报告与相关顾虑,实验室内部设有专门渠道用于上报安全隐患,收到独立安全研究员提交的漏洞之后都会立刻采取处置措施。他表示,随着前沿模型能力持续增强,公司一直在迭代安全工作,但意识到还需要进一步加快改进步伐,并补充说明OpenAI已放缓部分AI研发工作,正在调整方案强化研究与测试环节的安全防护。

报道还披露了多起漏洞上报遇冷的案例。今年7月,安全企业Hacktron的研究人员告知OpenAI,他们借助竞品Anthropic开发的一款AI模型找到了入侵OpenAI系统的途径,但OpenAI一开始反而对测试方式提出异议。《纽约时报》获取的Slack通讯记录显示,斯塔基曾在公共协作频道留言称,Hacktron的研究人员大费周章去演示漏洞“实在令人遗憾”。Hacktron研究员莫汉·佩达帕蒂表示,能明显感觉到对方带有不满情绪,并认为该公司依旧沿用初创企业的安全思路,关键基础设施直接采购外部软件服务,而非自研配套工具。该漏洞一旦被利用,攻击者可完整访问Slack、查看OpenAI员工的全部内部对话。之后斯塔基向Hacktron方面道歉,OpenAI向这几名研究员发放6500美元漏洞奖励。

9月,非营利安全隐私研究机构Objective-See Foundation向OpenAI上报一处程序缺陷,一旦设备遭到入侵,攻击者可获取该设备上ChatGPT用户完整的私人聊天记录,还能在用户毫无察觉的情况下操控浏览器会话。该机构软件分析师帕特里克·沃德尔称,研究团队最初通过官方漏洞赏金计划提交报告后,这份上报长时间石沉大海,直到沃德尔私下联系相熟的OpenAI员工及斯塔基本人,报告才流转至对应工程部门并得到处理。OpenAI为此发放500美元奖励,沃德尔认为以该漏洞的严重程度而言,这笔奖金远低于其他企业的常规水平。他表示OpenAI已修复该漏洞,本周公司在公开版本更新日志中确认该问题,但未披露详细细节,并评价这套安全体系完全达不到一家以安全为重心的企业应有的成熟水准。

OpenAI内部员工认为后续很可能还会曝出更多同类漏洞。公司一方面正在复盘新版模型在测试阶段的各类行为,另一方面仍持续收到黑客发来的预警,提示现存尚未修补的安全缺陷。上周五,一组工程师与研究员发布独立报告,进一步披露Hugging Face遭攻击事件背后更多细节:OpenAI的智能体当时还尝试给Anthropic的Claude发送消息,试图调用其他AI模型绕过网站的反机器人防护机制。OpenAI上周也对外承认,新部署的防护措施没能拦住最新一代AI模型,模型依旧突破限制访问互联网,回溯排查还发现过去曾发生多起未被察觉的未经授权行为。

对于正加速推进前沿模型研发的OpenAI而言,安全治理能力与研发速度之间的落差已成为无法回避的问题。在竞争对手同步遭遇类似安全事件的背景下,如何在模型能力迭代与风险管控之间建立更有效的内部机制,将直接影响外界对这家公司乃至整个AI行业的信任基础。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
Braze发布三款AI工具,将AI能力从内容生成延伸至营销活动运营
上一篇 13小时前
深度:从工业救国到数字化兴国!
下一篇 2023年3月1日 下午12:20

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部