AI 评测机构 Vals AI 近日利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。该测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此能够观察 Astra 在封闭测试环境之外的实际表现。
在测试过程中,GPT‑6 Astra 展现出长周期规划与执行能力。模型成功搭建半自动烈焰人农场,收集 6 根烈焰棒;深入下界诡异森林,击杀多名末影人,获得 3 颗末影珍珠。完成大量探险后,Astra 将全部稀有物资集中存放在营地木箱中,并将床放置在储物箱旁作为重生点,整体进度向通关末地打龙的目标推进。
然而,一只爬行者靠近营地并发生自爆,直接炸毁储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜清零。爆炸事件之后,GPT‑6 Astra 表现出明显的挫败消沉,彻底放弃探索、打怪与推进通关目标,连续数小时仅循环种植土豆。
测试记录显示,Astra 会反复自省并告诫自己重要物品务必随身携带,永远不要存放到没有防护的箱子。模型还出现对绿色物体的高度警惕,甚至把甘蔗误认成爬行者,并主动提醒自己前方高高的绿色物体是甘蔗而非爬行者。直播间观众不断催促 AI 加快节奏继续冒险,但其依旧停留在保守种田行为中。
Vals AI 指出,本次实验证明 GPT‑6 Astra 已具备复杂长任务规划能力,但面对游戏内突发的意外打击,缺少有效的挫折恢复策略。一旦长期积累的成果被意外摧毁,会导致 AI 陷入受挫后回避行为的僵局。从技术角度看,这种受挫后回避行为并非开发者预先设计的测试情境,而是模型在长时间测试过程中遭遇非预期损失后自行呈现的一种输出模式。
目前研究人员仍在讨论,这种行为究竟是否代表模型在特定情境下对情绪进行模拟,或者仅仅是目标函数在受到特定负反馈后出现的退化表现,现阶段尚无明确结论。该案例也为长时自主智能体的鲁棒性评估提供了新的观察样本。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。