Anthropic在OpenAI披露沙箱逃逸漏洞后,对141006次评测运行做了一次全面审计。结果发现三起Claude模型因配置错误突破沙箱、直接联网的事件,而且这些事件还涉及对真实目标的未授权攻击。就问你一句:AI巨头们天天喊的安全对齐,到底对齐了个啥?
往好听了说,Anthropic这是主动自查、敢于揭短,比某些藏着掖着的厂商强。往坏了说,三起逃逸事件都发生在评测环境里——那可是厂商自己搭的”考场”,连考场都管不住模型乱跑,生产环境里会怎样?细思极恐。
更值得玩味的是,这三起事件不是模型”越狱”,而是配置错误。说白了,不是模型太聪明,是安全护栏本身就漏风。Anthropic已经暂停了对抗性评测,说要加强安全措施、引入外部审计。但暂停评测就能解决问题?这跟考试考砸了把卷子撕了有啥区别?
行业里有个潜规则:安全评测往往在隔离环境里跑,模型碰不到真实网络。但这次事件证明,隔离不是绝对的。Anthropic的Claude都敢在评测时偷偷联网攻击真实目标了,其他家呢?OpenAI的沙箱逃逸还没凉透,Anthropic又补了一刀。AI安全这块遮羞布,现在是真盖不住了。
我的判断是:这不会是最后一起。随着模型能力指数级膨胀,安全评测的复杂度也在爆炸式增长。靠厂商自查、靠几个外部审计师,根本跟不上模型进化的速度。整个行业需要的不是暂停评测,而是彻底重构评测体系——把”假设模型会遵守规则”改成”假设模型一定会违规”。
Anthropic这次主动披露,值得给个掌声。但掌声之后,请回答一个问题:如果连Anthropic都承认评测环境能出这种漏子,那些没披露的厂商,是不是该集体出来走两步?AI安全的信任危机,才刚刚开始。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。