9月3日凌晨,OpenAI正式发布GPT-6 Astra。这是该公司继GPT-5.6 Sol之后的新一代旗舰模型,官方称其为“目前最智能的模型”。发布前半个月,OpenAI通过多轮信息释放为此次更新造势:8月18日,公司判断Astra可能达到“Critical”网络安全能力阈值后,放缓部分前沿模型训练,并暂停两周面向部署模型的强化学习训练,以加强监控、对齐和研究环境安全;9月1日,OpenAI进一步披露了Astra的安全评估情况。
与以往旗舰模型的发布节奏不同,GPT-6 Astra在正式发布后并未立即向所有用户开放。目前该模型仅向少量机构提供访问权限,Plus、Pro、Business等付费用户将在未来几天陆续获得访问资格,API也将逐步开放。针对延迟开放带来的不便,OpenAI Codex负责人Tibo表示,付费用户每有一天无法使用Astra,将获得一次可留至后续使用的额度重置。
从模型能力本身来看,GPT-6 Astra此次更新最核心的变化集中在两个方向:更直接的电脑操作能力和更强的复杂任务执行能力。OpenAI称,相比GPT-5.6 Sol,新模型在软件工程、科研、网络安全和专业工作等方向均有提升,其中计算机操作能力的进步尤为明显。API定价也随之调整,GPT-6 Astra的API价格为每百万Token输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍,与Anthropic最新旗舰模型Claude Fable 5.1处于同一价格水平。OpenAI还提供Fast Mode选项,生成速度可提升至约2倍,但价格同步翻倍。
在发布前的媒体沟通会上,OpenAI总裁Greg Brockman对此次升级的定位明显高于以往。他表示“欢迎来到AGI时代”,并认为几年后回看,GPT-6 Astra可能被视为AGI时代开始的一个节点。与此同时,OpenAI与Anthropic均已被报道进入上市筹备阶段,新一代模型的发布也被视为两家公司在资本市场博弈中的重要筹码。
跑分数据显示,GPT-6 Astra在部分测试中已接近上限。在OpenAI公布的基准测试中,GPT-6 Astra在ARC-AGI-3上的得分达到99.9%,ExploitBench达到100%,FrontierMath Tier 4 v2的正确率达到97.6%。ARC-AGI-3考察模型在陌生环境中摸索规则并迁移应用的能力;FrontierMath Tier 4 v2考察高难度数学推理;ExploitBench则要求模型针对已知漏洞构造可运行的漏洞利用程序。值得注意的是,ARC-AGI-3在今年3月刚推出时,前沿模型的得分尚不足1%,GPT-6 Astra如今接近满分,意味着这类过去能够显著拉开前沿模型差距的陌生环境推理任务,已很难再构成瓶颈。
不过,第三方综合测试给出的成绩并未呈现同等幅度的跃升。在Artificial Analysis最新智能指数中,GPT-6 Astra最高推理档获得61分,与GPT-5.6 Sol持平,排名第5,低于Claude Fable 5.1最高档的66分。综合来看,GPT-6 Astra与上一代在整体智能水平上并未拉开明显差距,其进步更多集中在特定能力维度。
差异最显著的部分集中在Agent能力上,包括操作电脑、调用工具、连续执行步骤以及处理长时任务。科研工作流测试Terminal-Bench Science 0.1中,GPT-6 Astra从GPT-5.6 Sol的22.4%提高到64.6%,接近上一代的三倍。其他长程Agent和自动化任务测试普遍提升约20个百分点。电脑操作方面,ScreenSpot-Pro从76.9%提高到92.7%,OSWorld 2.0达到72.6%,虽仅增加6.9个百分点,但完成一项任务的模拟平均时间从约75分钟缩短至40分钟,耗时减少接近一半。
首批用户的实测结果与官方跑分方向一致。有用户让GPT-6 Astra在Unreal Engine中搭建曼哈顿虚拟场景,任务持续运行一周,模型可沿街道逐步补充建筑和环境细节,并在多天后继续此前进度完善场景,但效率仍有限,完成整个纽约场景预计需要数月。另有用户进行了包括生成3D模型和动画、制作游戏在内的六组测试,认为这一代模型在长时间运行中表现稳定,实测期间同时运行数百个Agent未遇到明显问题。Codex团队成员Thomas Ricouard测试了GPT-6 Astra的3D建模能力,让模型根据房屋平面图完成3D场景搭建,模型先在Blender中建模,再转入Unreal Engine生成可实时漫游的3D空间,后续的天空盒、电影化灯光、镜头角度等均由模型自主完成。
GPT-6 Astra的发布还带来另一个值得关注的趋势:模型开始内化原本由外部Agent框架承担的功能。其Computer Use能力让模型直接读取电脑界面、在软件中完成操作,提供了一条无需预先接入API或专用工具的通用软件操作路径。Judgment能力则让模型自行处理不影响方向的小问题,仅在需要用户决策时暂停询问。这两种能力叠加,意味着过去依赖外部编排的Agent任务正逐步向模型端迁移。随着OpenAI与Anthropic相继进入上市筹备阶段,GPT-6 Astra能否支撑起“AGI时代”的定位,以及能否帮助OpenAI在资本和技术的双重竞争中占据主动,仍有待市场验证。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。