OpenAI发布GPT-6 Astra模型,多项基准测试逼近满分并降低Token消耗

支撑这一跃迁的,是又一次“大力出奇迹”:据外媒报道,GPT-6 Astra的训练动用了10万GPU的集群,是OpenAI迄今最大规模的一次训练。

9月5日,OpenAI全量推送了新一代大模型GPT-6 Astra,面向所有付费订阅用户开放使用。此前一天,OpenAI在面向部分企业用户的发布会上正式亮相该模型,并宣布其训练动用了10万GPU集群,为该公司迄今规模最大的一次训练。OpenAI总裁Greg Brockman在介绍该模型时称“欢迎来到AGI时代”。

与前几代模型相比,GPT-6 Astra在多个关键基准测试中表现突出。在强调陌生环境中学习与抽象推理的ARC-AGI-3测试中,该模型得分从上一代GPT-5.6 Sol的7.8%跃升至99.9%;在研究级数学基准FrontierMath Tier 4上得分达到98,OpenAI官方将这一成绩形容为“饱和”,即分数已达测试上限;漏洞利用测试ExploitBench上则取得满分100%,上一代为78.5%。ARC Prize Foundation的Greg Kamradt评价称:“在96%的测试层级上,Astra超越了我们的人类行为效率基线,实际上达到了人类水平。”

值得注意的是,GPT-6 Astra在ARC-AGI-3上的99.9%高分是在OpenAI为自家模型适配的Harness上跑出的。根据X平台ARC Prize发布的测评结果,去除该适配环境后的得分为62.7%,仍为第二名Claude Opus 5的两倍。厂商使用自研评测框架并非个例,DeepSeek上月底发布的DeepSeek V4 Flash同样基于自研Harness测试,并将该工具作为独立产品推向市场。

GPT-6 Astra在部分任务上也出现“倒退”情况。以测评模型Agent能力的指标之一“人类终极测试”(Humanity’s Last Exam)为例,该模型成绩为57.2%,低于GPT-5.6 Sol与Anthropic的Fable 5.1。按照Artificial Analysis的通用智能指数,GPT-6 Astra为61.2,与上一代Sol的60.9基本持平,该机构评测指标多集中于知识、推理等能力,未完全覆盖新模型的主要优势领域。

在编程场景,GPT-6 Astra在Terminal-Bench 4.0(测评智能体在复杂终端任务上的表现)上得分57.9%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。已有多位网友展示了使用该模型生成的射击游戏、开放世界冒险游戏等作品,从建模和实际体验来看已达到成品级别。智能体维度方面,该模型在Agents’ Last Exam(真实软件中完成金融建模、工程设计、媒体制作等专业任务)上得分59.3%,高于上一代的53.6%;在OSWorld 2.0(真实桌面环境中完成屏幕操作)上得分72.6%;在跨系统业务流程的AutomationBench上,得分从GPT-5.6 Sol的18.1%大幅提升至41.4%。

在实际使用层面,GPT-6 Astra表现出更低的Token消耗和更短的任务耗时。Perplexity在其AI研究智能体评估框架中测出,Astra的单次任务花销低于Anthropic新近发布的Fable 5.1。现场演示和用户实测中,该模型可完成操作电脑、填表单、建网站,以及将电子原理图排成可投产的PCB、在Blender中建模并转进虚幻引擎等复杂任务。

GPT-6 Astra的发布紧随全球AI服务大规模宕机事件之后,时间节点颇为紧凑。Anthropic的Fable 5.1发布不到一周,即被新模型抢去风头。这一代模型的训练规模和性能表现,延续了Scaling Law在AI领域的持续有效性,但部分基准测试的“偏科”表现也提示,模型能力的均衡性仍有待观察。随着全量推送的完成,GPT-6 Astra在真实业务场景中的实际表现,将是对其“AGI时刻”宣言的下一步检验。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
字节跳动获296亿美元银团贷款,AI基础设施资本开支大幅提升
上一篇 3小时前
国家安全部披露快递数据遭境外间谍窃取案件 物流数据安全防线亟待加固
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部