OpenAI发布GPT-6.1 Sol模型,性能接近Astra但成本仅为其五分之

官方称这是“在目前同等性能下性价比最高的模型”。

在9月30日举行的OpenAI开发者活动日上,OpenAI正式发布GPT-6.1 Sol模型。该模型在智能体编程、电脑操作和专业工作流等任务上的性能接近其旗舰级模型GPT-6 Astra,但标准输入与输出Token价格仅为Astra的五分之一。OpenAI官方将其定位为“在目前同等性能下性价比最高的模型”。

GPT-6 Astra是OpenAI于2026年9月推出的旗舰级大语言模型,官方定位为“迄今最智能、最对齐”的模型,重点面向长程多步骤任务与专业工作流。此次发布的GPT-6.1 Sol则在保持相近性能表现的同时,大幅降低了调用成本。根据官网公布的定价信息,在短上下文(输入Token不超过272,000)场景下,Standard模式输入价格为每百万Token 2.00美元,缓存输入为0.10美元,缓存写入为2.50美元,输出为10.00美元。Batch与Flex模式价格减半,输入为1.00美元,输出为5.00美元。Fast模式价格最高,输入为4.00美元,输出为20.00美元。长上下文(输入Token超过272,000)场景下,各模式价格相应上调,Standard模式输入为4.00美元,输出为15.00美元。

四种处理模式针对不同场景设计。Standard模式以正常速度处理请求,适用于日常开发与一般应用;Batch模式采用异步批量处理,速度较慢,适用于非实时、大批量任务,如离线数据处理;Flex模式根据负载动态调整速度,面向需要成本与速度平衡的场景;Fast模式优先处理请求,速度最快,适用于对延迟敏感的实时对话与低延迟响应应用。

性价比方面,GPT-6.1 Sol每百万Token的缓存费用为0.1美元,较GPT-6 Sol模型定价低50%。在性能测试中,该模型在多个维度上表现出接近旗舰模型的水准。软件工程测试DeepSWE v1.1中,较高推理强度下GPT-6.1 Sol表现与GPT-6 Astra相当;较低推理强度与成本条件下,其得分比GPT-6 Sol高出6.4个百分点。专业文档与复杂任务测试GDP.pdf中,该模型以不到Opus 5.5一半的任务成本取得更好结果。自动化工作流测试AutomationBench中等推理强度下,得分比Opus 5.5高2.2个百分点,成本约为其三分之一。

在电脑操作测试OSWorld 2.0离线环境中,最大推理强度下GPT-6.1 Sol得分比GPT-6 Sol高7个百分点,成本不足后者一半;与Astra相比仅低2.1个百分点,但单任务成本约为Astra的七分之一。科学终端任务Terminal-Bench Science 0.1最大推理强度下,其得分是GPT-6 Sol的两倍以上,单任务平均成本为5.47美元,显著低于Opus 5.5的23.21美元和Astra的23.80美元。

除任务执行能力外,GPT-6.1 Sol在可靠性与对齐方面也有所改进。低推理强度下,事实错误比例从GPT-6 Sol的11.4%降至7.7%,下降约32%。在所有推理设置下,该模型错误率与Astra的差距控制在1.9%以内。在困难评测中,模型更少忽略失效的搜索工具,更能遵循明确限制,并减少未经授权的操作。安全测试中未观察到试图绕过自动化安全审查器的行为。

调用方面,自9月29日起,GPT-6.1 Sol向ChatGPT Work与Codex的Plus、Pro、Business、Enterprise及Edu用户开放。开发者可通过API以gpt-6.1-sol名称调用该模型。

此次发布正值企业级AI应用对成本效益要求持续提升的阶段。在模型能力逐渐趋同的背景下,推理成本与任务可靠性成为企业选择AI基础设施的关键考量。GPT-6.1 Sol以接近旗舰模型的性能配合显著降低的定价,或将进一步推动AI智能体在编程、自动化工作流与电脑操作等企业场景中的规模化部署。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
毕马威成立客户技术与创新部门,在企业内部孵化AI原生初创公司
上一篇 3小时前
OpenAI 在 DevDay 2026 升级 ChatGPT 插件扩展,支持 MCP 事件自动化
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部