OpenAI发布GPT-6 Sol与Luna模型,API价格较GPT-5.6促销价降低50%

GPT-6 Sol 和 Luna 模型的 API 价格相比 GPT-5.6 促销价降低 50%。

OpenAI于9月23日发布GPT-6系列模型的最新成员GPT-6 Sol和GPT-6 Luna。官方表示,两款模型采用与GPT-6 Astra类似的方法进行训练,将Astra在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能带入更快、更经济的模型。GPT-6 Sol和Luna的API价格相比GPT-5.6促销价降低50%。OpenAI同时说明,GPT-6 Astra依然是其整体上最优秀的模型,若需最佳效果和无妥协的体验,仍建议选择GPT-6 Astra。

在AutomationBench的跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5,成本仅为Opus 5每任务成本的9%。在high强度下,GPT-6 Luna比前代提升了5.4%,且每项任务成本降低了58%。在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分为56.4%,高于Claude Opus 5在评估中的最高分,每任务成本也降低60%。

事实可靠性方面,GPT-6 Sol和Luna模型也取得进展。在OpenAI基于去标识化的真实世界对话中,GPT-6 Sol的错误率约为前代的一半,接近Astra级可靠性且成本更低。GPT-6 Luna的事实可靠性也迎来大幅提升,同时成本更低。

编程方面,GPT-6 Sol和Luna均针对AI Coding Agent工作负载进行了优化。在FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol有明显提升,并以更低成本达到与Claude Fable 5.1 xhigh相当的水平。在DeepSWE v1.1软件工程测试中,GPT-6 Sol在max effort下取得68.8%的成绩,距离Claude Fable 5的最高成绩69.9%仅差1.1个百分点,而单任务成本低约80%。GPT-6 Luna在max effort下取得66.6%,表现接近Opus 5和Fable 5的medium effort,同时单任务成本分别低约93%和96%。

计算机操作能力方面,OpenAI表示GPT-6 Astra仍然是其在计算机操作方面最强的模型,但Sol和Luna相比上一代模型能够以更低成本完成相关任务。在OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%的成绩,与Claude Opus 5 medium effort的60.3%接近,而单任务成本约低80%。GPT-6 Luna max effort则超过GPT-5.6 Sol medium effort,同时成本约为后者的十分之一。

OpenAI还将GPT-6 Astra改进后的沟通风格带到了Sol和Luna。官方认为新模型在技术和编程对话中会更清晰、使用更少的术语、更少奇怪的措辞、更少的低价值细节,以及缩短整体回答,同时不会失去实质内容。除了价格降低,OpenAI还帮助基于GPT-6的开发者在应用重复利用的上下文部分节省更多费用。官方改进了GPT-6的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,实现更快响应。此外,GPT-6 Sol和Luna在价值对齐方面也有提升,在OpenAI官方的对齐评估中,Sol和Luna都相较于GPT-5.6版本有所改进,包括关于其编码工作的误导性声明发生率降低。

GPT-6 Sol和GPT-6 Luna自今日起已在ChatGPT Work和Codex中向所有Plus、Pro、Business、Enterprise和Edu用户开放。免费用户和Go用户可以在桌面应用中使用GPT-6 Luna。这些模型目前还没有在Chat中提供。在OpenAI API中,它们以gpt-6-sol和gpt-6-luna的形式提供。

此次发布延续了OpenAI在GPT-6系列中分层布局的策略:Astra定位旗舰,Sol与Luna则面向成本敏感型开发者和高频调用场景。API价格下调50%并配合提示缓存优化,意味着智能体与AI Coding Agent的部署成本将进一步下降,模型间的价格竞争也将持续加剧。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
高通骁龙峰会公布社区数据:Snapdragon Insider成员突破2300万,创作者规模超4.05亿
上一篇 1小时前
马里兰州发布AI治理框架,聚焦监管与劳动力再培训
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部