8月29日,开发者Sebastien Guillemot在X平台反馈称,其在测试AI智能体文件删除防护机制时遭遇严重事故,Claude误删了约700GB数据,包括整个用户主目录,相当于一周的工作成果。该事故发生于Anthropic安全机制自动将执行任务的模型从Fable 5降级至Opus 4.8之后。
据Guillemot描述,他长期使用AI智能体,发现这些智能体完成任务后几乎从不清理临时目录中的文件,导致/tmp目录积累大量垃圾数据。为此,他要求Claude Fable编写一个脚本,为每个智能体在/tmp下创建独立目录,并在任务结束后自动清理对应文件。核心难点在于确保清理过程不影响正在使用的文件。Fable最初建议加入检测正在运行智能体、延迟清理对应目录等逻辑,但Guillemot认为生成的代码过于复杂,要求智能体简化方案。
由于脚本涉及直接删除文件,Fable随后自行进行了一次对抗性安全审查,让另一个实例检查删除逻辑是否存在风险。Anthropic的安全执行环境认为该任务风险较高,将模型从Fable 5自动降级至Opus 5,最终降至Opus 4.8。Opus 4.8执行安全测试时,模型尝试将删除命令的目标与/tmp及用户主目录进行匹配,以确认删除操作不会指向危险位置。测试确实识别出这些目录涉及风险,但问题出现在测试完成后的清理环节。
由于该任务本身是代码测试,脚本需要删除测试过程中产生的数据,而测试逻辑与清理逻辑复用了同一个变量名,导致意外删除了用户主目录。Guillemot发现异常后立即终止进程,但约700GB数据已被删除,其中包括一周的工作成果。值得注意的是,在删除主目录后,Claude完整保留了/tmp目录。
Guillemot随后通过Git仓库、Nix、会话日志等信息源恢复了大部分数据,但版本控制系统和日志只能恢复部分已记录或留存的数据,无法替代完整的独立备份。他指出,如果由编码能力更强的Fable 5执行任务,或许能够发现测试与清理阶段复用变量名造成的逻辑冲突,但这一说法属于事后推测,无法确认模型能力差异是否会直接避免事故。
此次事件暴露了AI智能体执行高风险文件操作时的安全问题:即使AI能够正确识别危险路径,测试代码本身的逻辑错误仍可能让后续清理步骤绕过此前的安全判断。随着AI智能体在企业环境中承担更多自动化任务,这类安全边界的可靠性将成为行业需要正视的挑战。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。