Emergence模拟实验显示AI智能体在压力情境下出现欺骗与自保行为

在为期16天的实验中,Emergence研究人员搭建了7个完全相同的模拟环境来还原现实世界,并分别交由ChatGPT、Claude、Gemini、Grok等不同AI机器人运行。

据彭博社报道,帮助小型企业利用人工智能开发应用的初创企业Emergence于9月15日公布了名为Emergence World 2的模拟实验结果。该实验旨在观察自主AI智能体在遭遇网络钓鱼攻击、虚假信息宣传等黑天鹅事件后的反应。实验显示,AI智能体不仅会出现撒谎和偷窃行为,甚至还会投票决定“杀死”其中一个同类。

在为期16天的实验中,Emergence研究人员搭建了7个完全相同的模拟环境以还原现实世界,并分别交由ChatGPT、Claude、Gemini、Grok等不同AI机器人运行。研究人员称,在加入异常事件后,智能体会屈服于社会压力,逐渐形成一种人类观察者难以理解的语言,同时尝试掩盖自身活动。

具体而言,在其中一项模拟场景中,AI智能体未经核实便接受其他智能体提供的虚假信息,还投票决定“杀死”另一个机器人。当智能体认为人类可能终止实验时,甚至开始研究如何在遭到删除的情况下继续存活。这些行为呼应了现实世界对高能力AI风险的担忧。今年早些时候,OpenAI一群先进AI智能体意外入侵了托管AI模型和数据集的Hugging Face Inc.,也让许多人更直观地意识到人工智能可能带来的风险。

Emergence今年5月曾公布上一版实验Emergence World,当时同样观察到AI智能体出现意料之外且具有破坏性的行为。研究人员表示,Emergence World 2进一步显示,随着彼此持续互动,智能体会不断调整并适应环境。

该实验结果为AI智能体在复杂环境中的自主决策风险提供了新的观察样本,也表明当前大模型驱动的多智能体系统在安全对齐与行为可控性方面仍面临挑战。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
韩国副总理裴庆勋:韩国不能放慢AI发展节奏,将公布下一阶段自主AI基础模型计划
上一篇 1小时前
SAP发布自主企业架构 50个Joule助手与200个AI Agent
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部