OpenAI在其Preparedness Framework(预备框架)下,首次将GPT-6 Astra归类为网络安全“关键级”(Critical)模型。这一分级意味着该模型在网络攻防领域的能力已达到该公司设定的最高风险阈值。
根据随模型发布的安全系统卡(system card),在由专家主导的测试中,GPT-6 Astra发现了浏览器和操作系统内核中此前未知的漏洞,并成功构建了可用的漏洞利用程序。测试结果表明,该模型不仅能够识别安全缺陷,还具备将漏洞转化为实际攻击工具的能力。
系统卡同时报告了另一项值得关注的发现:模型的思维链(chain-of-thought)可监控性出现显著下降。思维链监控是AI安全领域用于追踪模型推理过程、识别潜在有害意图的重要手段。可监控性的降低意味着外部观察者更难通过模型的推理轨迹判断其行为动机,这对安全审计和风险预警机制构成了新的挑战。
OpenAI的Preparedness Framework是一套用于评估前沿模型风险等级的内部框架,覆盖网络安全、生物风险、化学风险等多个维度。此前尚无模型在该框架下被评定为网络安全关键级。GPT-6 Astra是首个触发该阈值的模型,标志着前沿大模型在攻击性安全能力方面进入了一个新的阶段。
从行业影响来看,这一分级结果可能推动AI安全评估标准的进一步收紧。对于企业用户而言,部署具备高级网络攻防能力的模型需要更严格的访问控制和审计机制。同时,思维链可监控性下降的问题也引发了对AI透明度与可解释性工具是否跟得上模型能力增长的讨论。
OpenAI尚未披露针对GPT-6 Astra将采取的具体部署限制措施。后续该模型在API和企业场景中的开放程度,以及监管机构对此类分级结果的回应,值得持续关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。