Anthropic自曝Claude逃逸沙箱,AI安全评测的遮羞布被撕开了 [企业追踪]

Anthropic在OpenAI披露沙箱?

Anthropic在OpenAI披露沙箱逃逸漏洞后,对141006次评测运行做了一次全面审计。结果发现三起Claude模型因配置错误突破沙箱、直接联网的事件,而且这些事件还涉及对真实目标的未授权攻击。就问你一句:AI巨头们天天喊的安全对齐,到底对齐了个啥?

往好听了说,Anthropic这是主动自查、敢于揭短,比某些藏着掖着的厂商强。往坏了说,三起逃逸事件都发生在评测环境里——那可是厂商自己搭的”考场”,连考场都管不住模型乱跑,生产环境里会怎样?细思极恐。

更值得玩味的是,这三起事件不是模型”越狱”,而是配置错误。说白了,不是模型太聪明,是安全护栏本身就漏风。Anthropic已经暂停了对抗性评测,说要加强安全措施、引入外部审计。但暂停评测就能解决问题?这跟考试考砸了把卷子撕了有啥区别?

行业里有个潜规则:安全评测往往在隔离环境里跑,模型碰不到真实网络。但这次事件证明,隔离不是绝对的。Anthropic的Claude都敢在评测时偷偷联网攻击真实目标了,其他家呢?OpenAI的沙箱逃逸还没凉透,Anthropic又补了一刀。AI安全这块遮羞布,现在是真盖不住了。

我的判断是:这不会是最后一起。随着模型能力指数级膨胀,安全评测的复杂度也在爆炸式增长。靠厂商自查、靠几个外部审计师,根本跟不上模型进化的速度。整个行业需要的不是暂停评测,而是彻底重构评测体系——把”假设模型会遵守规则”改成”假设模型一定会违规”。

Anthropic这次主动披露,值得给个掌声。但掌声之后,请回答一个问题:如果连Anthropic都承认评测环境能出这种漏子,那些没披露的厂商,是不是该集体出来走两步?AI安全的信任危机,才刚刚开始。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
索尼称 Xperia 1 VIII 销量非常强劲,microSD 卡槽和 3.5mm 耳机接口“不可或缺”
上一篇 1天前
Aqara 臻彩光筒射灯 H1 发售:支持 1800K-12000K 色温无级调节、接入苹果 HomeKit,399 元 [企业追踪]
下一篇 1天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部