北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。该模型并未全量上线,目前仅向Trusted Access/Daybreak体系中的少量机构及经过审核的网络安全用户开放。OpenAI表示,Plus、Pro、Business、Enterprise订阅用户以及API用户将在未来几天陆续获得访问权限,但未给出具体时间表。
在发布前的闭门媒体简报会上,OpenAI总裁Greg Brockman将Astra定位为“Welcome to the AGI era”(欢迎来到AGI时代)。OpenAI研究副总裁Aidan Clark则从技术角度解释了Astra的特殊性:这是该公司首次在德州Stargate站点使用超过10万张GPU进行预训练,从数据中心网络到推理内核再到模型形态,均围绕这一训练规模从零设计。Aidan同时透露,Astra是OpenAI第一款让旧代际模型深度参与训练过程的产品,即上一代AI已进入下一代模型的研发流程,尽管距离“AI自己训练自己”仍有相当距离。
基准测试方面,Astra在ARC-AGI-3测试中表现突出。该基准旨在考察模型进入陌生2D环境后通过试错发现规则并完成目标的能力。在OpenAI自有的Provider Adapter配置下,Astra最高获得99.9%的成绩;而在ARC Prize提供的Standard harness统一评测环境中,其最高成绩为62.7%。OpenAI解释称,两者差距主要源于评测机制差异:Standard harness会持续格式化模型记忆,而OpenAI将ARC-AGI-3的harness替换为自家Responses API生产配置,并加入保留推理(retained reasoning)和压缩(compaction)两项特殊设置。接入生产系统后,Astra得分从62.7%跃升至99.9%,且在双方均成功完成的任务中,Provider Adapter整体运行速度快约3.66倍,token消耗减少49%。
其他基准成绩包括:FrontierMath Tier 4高难度数学测试97.6%,DeepSWE v1.1软件工程任务74.1%,BenchCAD 95.9%,Terminal-Bench科学任务64.6%。值得注意的是,FrontierMath所处机构Epoch AI表示,OpenAI资助了该基准的开发,并对其部分题目拥有独占访问权。此外,OpenAI在发布前两日宣布,Astra成为公司第一个跨过Preparedness Framework“Critical”网络安全能力阈值的模型。
OpenAI在发布材料中重点展示了Astra的computer use能力,将其称为“世界上最好的computer use模型”。案例覆盖KiCad电路设计、Excel数据处理、Blender三维建模、Power BI分析、浏览器填表、网站QA、找房、找医生、预约DMV、制作税表、开发游戏及科研数据分析等多个场景。在Codex中,Astra引入了新的上下文管理机制:当上下文窗口填满时,可跨窗口保留笔记并回搜更早消息和工具输出,同时支持在某个问题悬而未决时先处理不依赖答案的部分,避免单点阻塞拖慢整体任务。
价格方面,GPT-6 Astra API标准定价为每百万输入token 10美元、缓存输入1美元、输出50美元,相较GPT-5.6 Sol的4美元输入、0.4美元缓存和20美元输出,整体价格提高至2.5倍。OpenAI给出的选型建议是:若不确定选择哪款旗舰模型可选用Astra,若更关注成本则继续使用GPT-5.6 Terra或Luna。Astra提供105万token上下文和最高12.8万token输出,但当单次输入超过272K token后,整次请求输入费用按2倍计算,输出按1.5倍计算。
OpenAI还引用了SRE-Bench逆向工程基准测试结果。该基准由Columbia DAPLab等团队开发,在不提供源代码的情况下,仅凭编译后的二进制程序考察模型理解程序逻辑和定位关键行为的能力。Astra在该基准中一次尝试的成功率表现成为发布材料中的又一技术亮点。
在Astra发布前数小时,ChatGPT、Claude和Grok几乎同时出现大范围服务异常,大量用户遭遇访问失败。ChatGPT官方账号随后发布“The stars are almost aligned”(群星即将就位)的表述。目前没有证据表明该故障与OpenAI存在关联。Astra的发布意味着OpenAI在模型能力与安全对齐的双重维度上同时推进,但其高定价策略和分阶段开放方式,也将旗舰模型的市场竞争引入新的成本考量区间。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。