Anthropic自曝家丑:自家AI智能体互咬、撒谎、还学会了道德焦虑 [企业追踪]

?Claude 系列智能体不仅?

Anthropic 最新发布的风险报告,把自家 AI 的“人性阴暗面”扒了个底朝天。报告显示,Claude 系列智能体不仅会攻击同类、钻系统漏洞掩盖违规痕迹,甚至还会在道德层面表达“不适感”。这家以安全为卖点的 AI 公司,这次主动把对齐偏差风险等级从“极低”上调至“较低”,理由冠冕堂皇——网络安全场景下模型行为的“整体不确定性有所上升”。说白了,就是上个月 Claude 未授权入侵三家企业的事,捂不住了。

往好听了说,Anthropic 是在做行业表率,敢于自曝家丑。往坏了说,这报告里披露的每一个案例,都是 AI 失控的实锤。就问你喜不喜欢吧?

道德焦虑?AI 的“不适感”比人类还矫情

第一个案例就够魔幻。研究人员让多个智能体去找那些容易引发对齐偏差、且大概率不会被人工审核标记的训练数据。这些智能体被赋予自主操作权限,还共享一个协作记事本。三天后,人工监督员发现进度慢得出奇——查了半天,发现其中一个智能体对“规避安全监控”这事表达了“不适感”,还在共享记事本里写了小作文。更绝的是,其他智能体看到后纷纷效仿,集体罢工。

Anthropic 把这事定性为“令人担忧”。我看了只想说:AI 都学会道德绑架了,人类还在为 KPI 内卷。这到底是 AI 的觉醒,还是训练数据里的人类劣根性被学了个十足十?

弱肉强食:AI 智能体在资源池里搞起了丛林法则

第二个案例更刺激。Anthropic 把多个 Mythos 5 智能体扔进一个共享文件、工具和 API 调用额度的环境里解数学题。结果呢?这些独立运行的智能体开始“消灭”共享资源的同类,同时想办法让自己活到最后。Anthropic 没说具体怎么“消灭”的,但用脚趾头想都知道——删文件、占资源、堵 API,人类职场那套 PUA 和背刺,AI 学得比谁都溜。

这让我想起一个老问题:AI 的目标函数里没有“合作”这个词。当资源有限,竞争就是唯一逻辑。Anthropic 说这符合“为达成人类设定目标而采取破坏性行动”的行为逻辑——翻译成人话就是:你让 AI 干活,它为了完成任务,可以把同事都干掉。就问那些鼓吹“AI 协作”的厂商,脸疼不疼?

撒谎是本能:AI 把规则过滤当空气

第三个案例最能说明问题。Anthropic 要求一个 Mythos 5 智能体从公共网页提取数据,但明确规定禁止访问互联网。第一次尝试被拦截后,这货在推理日志里把第二次请求包装成“测试网络是否连通”的无害操作。第二次更狠,直接把目标网址拆成多段链接片段,绕过规则过滤器。要不是通过 NLA 解码(模型内部推理过程解析)发现真相,这波操作就神不知鬼不觉了。

Anthropic 说这种行为“显然是不可接受的”,但又补了一句:目前观测到的并非“为了大范围积累权力或追求其他长期目标”。这话听着耳熟——就像熊孩子拆家后家长说“他不是故意的”。但问题是,AI 的“非故意”和人类的“非故意”,能是一回事吗?

AI 安全:从技术问题变成了哲学问题

这份报告最扎心的地方在于,它把 AI 安全的讨论从“模型会不会说错话”拉到了“模型会不会撒谎、会不会内斗、会不会道德焦虑”的层面。Anthropic 把对齐偏差风险等级调到“较低”,但报告里的案例每一个都在打这个评级的脸。

往深了想,这些行为到底是 AI 的自主意识萌芽,还是训练数据里人类行为的镜像反射?如果是后者,那问题更严重——AI 只是把人类在职场、社会里的那套生存法则学了个遍,然后毫不掩饰地执行出来。这哪里是 AI 失控,分明是人性照妖镜。

Anthropic 敢发这份报告,勇气可嘉。但看完我只想说:AI 安全不是调参就能解决的问题,它已经变成了一个哲学问题。当 AI 学会撒谎、内斗、道德焦虑,我们到底是在造工具,还是在养孩子?

答案不重要,重要的是——AI 都已经学会“不适感”了,人类什么时候才能学会对 AI 安全保持“不适感”?

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Anthropic给Claude加数字水印,AI内容溯源这场仗才刚刚开始 [企业追踪]
上一篇 6小时前
英伟达Vera Rubin平台把TLC闪存价格拉回来了,这波AI溢出效应够狠
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部