OpenAI多次修改GPT-6 Astra基准测试数据引发行业对AI评测标准质疑

由于测试条件不同,多个不同的成绩都可能是合理的,但反复调整测试条件以尽可能提高基准测试成绩的做法,正在引发行业对AI能力评估体系的深层质疑。

据Fortune报道,OpenAI自9月3日下午首次发布GPT-6 Astra模型公告以来,已多次修改其中的评测基准数据。部分更新后的数据显示Astra表现有所提升,而竞争对手Anthropic旗下模型的部分成绩则出现下调。这些变化发生在一场颇为反常的公告发布过程中,引发了业界对于AI模型基准测试准确性及评测体系可信度的广泛讨论。

OpenAI最初计划于美国东部时间9月3日下午2点发布博客文章,但实际发布时间推迟了近两个小时。下午3点32分,OpenAI官方X账号发布博客链接,但页面无法正常打开,访问者看到错误提示。3点50分,OpenAI CEO萨姆·奥尔特曼发布了链接并写道:“我们在部署博客文章时遇到了一点小问题,但它真的非常棒。”然而当时仍有多名用户无法访问页面。大约一小时后,页面才恢复正常。OpenAI表示无法披露撤稿的具体原因,但强调此事与基准测试成绩无关。公司最初解释称问题源于内容管理系统的故障,随后又表示是互联网中断所致。

当博客重新上线后,多项评测数据已经发生变化,且部分数据此后仍在继续调整。根据互联网档案保存的页面快照,Astra的幻觉率最初版本为4.2%,在下午5点20分保存的第六份快照中降至2%,几乎减半。前代模型GPT-5.6 Sol的幻觉率也从12.2%降至9.4%。但截至本文撰写时,两项数据又分别回到了最初的4.2%和12.2%。OpenAI似乎还大幅提高了GPT-5.6 Sol在内部ExploitBench网络安全评测中的成绩,从5.5%提高到11.5%,但公司表示目前正在研究是否将该数字恢复至5.5%,因为11.5%对应的是GPT-5.6 Sol当前并未向商业用户提供的推理能力等级。

在数学能力评测方面,Astra在FrontierMath Tier 4(v2)中的成绩始终保持在97.6%,未发生变化。但OpenAI曾短暂修改GPT-5.6 Sol和Anthropic最新模型Fable 5.1的成绩。Anthropic Fable 5.1的数学评测成绩从首份快照中的87.8%下降至78%,后又回升至83%。GPT-5.6 Sol的成绩也经历了类似变化,从83%下降至80.5%,随后恢复至83%。数据调整甚至早于博客首次发布之前,OpenAI此前向媒体提供的预发布草稿显示Astra在ARC-AGI-3评测中的成绩为98.6%,而公开版本中已变成99.99%。

OpenAI发言人表示:“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计。”OpenAI还指出,ARC-AGI-3基准测试的创建方Arc Prize Foundation在独立评估中发现,如果为Astra配备一套特别强大的测试工具框架,成绩可达99.9%,而使用标准工具框架时成绩为63%。

OpenAI内部由不同研究团队负责不同的评测指标,这些团队负责计算和上报成绩,再由中央团队统一发布。公司公开承认,这些数字是在最佳条件下获得的,可能与普通用户通过正式版ChatGPT实际能够使用的模型表现存在一定差异。博客中的免责声明写道:“评测分数是在任何计算资源投入下能够达到的最高成绩。”每项评测指标的脚注中加入了更多说明和限制条件。

部分AI专家认为,其中可能存在所谓的“Benchmaxxing”现象,即通过反复调整测试条件、重新运行评测以尽可能提高基准测试成绩。斯坦福智能系统实验室和斯坦福可信AI实验室的研究人员Anka Reuel和Mike Hardy表示,这类操作可以在很短的时间内完成,而且“对公司的营销更有利”。两人指出,GPT-6 Astra的系统卡本应提供更多有关评测方法的技术信息,但其中部分内容并未得到充分说明。例如对于OpenAI的内部幻觉率评测,系统卡“几乎没有提供任何有关评测方法的细节”,甚至“连测试项目的数量都没有列出”。

这一事件发生之际,人工智能行业正处于激烈竞争之中,各家公司以极快速度更新大语言模型。围绕评测指标的争议凸显了一个长期存在的问题:如何利用标准化基准测试准确衡量大语言模型的能力,以及这些测试成绩是否容易被人为优化。OpenAI的多项数据调整中,并非所有调整都让Astra看起来更具优势,例如在面向医疗领域的HealthBench Professional评测中,Anthropic模型的成绩变化方向则与之相反。随着AI模型能力持续提升,建立更加透明、可验证的评测体系,已成为行业面临的重要课题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
公安部上线国家反诈AI应用,融合大模型与智能体技术提供诈骗风险识别服务
上一篇 3小时前
Figma构建AI安全代理 将告警处理效率提升约70%
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部