据法庭记录,AI 公司 Anthropic 向执法部门举报了一名佛罗里达州女性用户。该用户在与旗下大模型 Claude 的对话中威胁要枪击 Lee 县警长办公室,并在后续聊天中提及自己正在获取一把新枪。该女子随后在家中被捕,并于 9 月 30 日受到一项重罪指控。
逮捕报告披露了 Anthropic 的内容审核机制。该公司会对聊天内容进行监控,检索可能构成威胁的关键词句,并根据威胁程度将相关内容提交人工审核团队评估。在本案中,审核团队最终决定将发现的情况报告给执法部门。该女子面临的罪名是通过书面或电子形式发出大规模枪击或恐怖主义行动的威胁。
这一案件反映出 AI 平台在内容安全与用户隐私之间面临的现实张力。与搜索引擎或社交平台不同,大模型对话具有高度私密性,用户往往将其视为一对一交流场景。但 Anthropic 的审核流程表明,当对话内容触及明确暴力威胁时,平台会主动介入并向公共安全机构披露。该公司此前在其使用政策中已明确禁止利用 Claude 从事暴力活动或发出威胁。
随着大模型产品进入更广泛的日常使用场景,AI 企业如何处理用户对话中的高危内容正受到越来越多关注。OpenAI 等公司同样建立了自动化加人工的审核体系,并在特定情况下与执法机构合作。此次案件或将成为观察 AI 平台内容审核边界与法律责任的又一参考案例。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。