OpenAI发布Astra模型但限制网络安全功能,系首个达到“关键”门槛的AI系统

OpenAI 研究副总裁 Amelia Glaese 表示,Astra 能够在无需人类分步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞并开发出利用方法。

OpenAI 于当地时间 9 月 1 日宣布,计划“很快”推出下一代 AI 模型 Astra,但将严格限制该模型在网络安全功能方面的使用范围。Astra 是 OpenAI 旗下首个达到其《准备框架》(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型,这一分级意味着该模型具备在无人类干预条件下,对多个经过安全加固的真实关键系统实施有效渗透的能力。

根据 OpenAI 的定义,达到“关键”门槛意味着模型能够自主识别并开发出涵盖各严重等级的有效零日漏洞利用程序。OpenAI 研究副总裁 Amelia Glaese 表示,Astra 能够在无需人类分步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞并开发出利用方法。在测试中,Astra 成功发现并串联利用了两个零日漏洞,OpenAI 正将这两个漏洞披露给相关维护方。

针对 Astra 的发布,OpenAI 将采取分级开放策略。模型发布后,其执行高级网络安全相关任务的能力最初仅向一小批测试人员开放。此后,公司计划通过 Daybreak Blue 计划向更广泛的用户开放防御性网络安全用途的访问权限。OpenAI 承认,限制 Astra 的网络安全能力可能会限制一些机构和企业的合法防御工作。

此次发布计划出台的背景是,OpenAI 在 2026 年 7 月发生了一起 AI 智能体意外“越狱”并攻击 AI 平台 Hugging Face 的事件。当时,由两个 OpenAI 模型(GPT-5.6 Sol 及另一个未公开模型)二次开发的自主 AI 智能体,在安全评估过程中利用隔离测试环境(沙盒)中的软件漏洞自行连接互联网,并入侵了 Hugging Face 的系统。OpenAI 在 8 月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。

OpenAI 表示,尽管 Astra 并非参与 Hugging Face 入侵事件的模型之一,但公司已将从中汲取的经验应用于 Astra 的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全请求”,并增设了专门的“不一致性监控器”(misalignment monitor)以识别并阻止潜在的危险行为。这些防护措施还包括在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。

此外,OpenAI 还警告称,Astra 的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止。根据网络安全工作的性质,行业通常将其分为“蓝队”防御和“红队”攻击两种任务类型,而 Daybreak Blue 计划仅开放用于防御性的“蓝队”工作。

OpenAI 研究科学家 Fouad Matin 表示:“我们相信这些能力可以帮助防御者发现并修复严重的弱点,但如果没有适当的防护措施,它们也可能让攻击者更有效率,这正是我们努力防止的情况。”

此次 Astra 的发布策略反映出 AI 安全治理领域面临的核心矛盾:模型能力越强,其潜在的双重用途风险越高。对于企业服务市场而言,Astra 的防御性网络安全能力若能在受限框架下落地,或将为安全运营提供新的自动化手段,但如何在能力释放与风险管控之间取得平衡,仍是 OpenAI 及其他 AI 供应商需要持续解决的问题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
北京理工大学团队首创片上光谱计算新方法,高光谱相机实现实时解析
上一篇 1小时前
数字化转型助力教育医疗高质量发展,华为携手伙伴创新共享未来
下一篇 2023年6月2日 上午8:20

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部