OpenAI于9月13日凌晨正式发布推理模型o1-preview,同时推出更小、成本更低的o1-mini版本。OpenAI将此次发布定位为“预览版”,强调o1仍处于早期阶段。该模型系列采用强化学习技术训练,核心特点是在给出最终回答前进行内部长链条逻辑推理,OpenAI将其计数器重置为1,以o1命名这一全新模型系列。
在权限开放方面,OpenAI采取分阶段推广策略。ChatGPT Plus和Team用户可立即访问o1-preview和o1-mini,Enterprise和Edu用户将于下周获得访问权。API使用等级5(已消费1000美元且自首次付款以来超过30天)的开发者即日起可使用这两款模型,速率限制为20 RPM。OpenAI还计划在未来向所有ChatGPT免费用户开放o1-mini使用权。
对于开发者而言,通过API使用o1的成本显著高于GPT-4o。o1-preview定价为每百万输入token 15美元、每百万输出token 60美元,而GPT-4o定价为输入5美元/百万token、输出15美元/百万token。o1-preview的输入成本是GPT-4o的3倍,输出成本是4倍。
OpenAI API负责人Michelle Pokrass表示,o1-preview和o1-mini是OpenAI在推理方面表现最佳的模型,将为API解锁全新应用场景。她同时指出,新模型并不能完全替代GPT-4o,开发者需要以不同方式进行提示并以新方式构建应用程序。OpenAI联合创始人Greg Brockman将o1描述为第一个通过强化学习训练的模型,在回答问题之前会深入思考,并称这是一个充满巨大机遇的新范式。
技术层面,o1通过强化学习训练模型优化思维链,而非仅通过提示工程实现逐步思考。OpenAI研究员Jason Wei指出,思维链是一种自适应计算,可以在推理时进行扩展。训练方法的核心在于教会模型“如何思考”,而不仅仅是存储和检索信息。OpenAI发现两个关键因素能显著提升o1性能:增加强化学习的计算量,以及延长模型的“思考时间”。这种方法在扩展性方面与传统大语言模型预训练依赖海量文本数据不同,更多依赖于计算资源和算法优化。
基准测试结果显示,在即将推出的模型更新中,o1在物理、化学和生物学等领域的复杂基准测试中表现达到博士生水平。在国际数学奥林匹克资格考试中,o1正确解答了83%的问题,而GPT-4o仅为13%。在Codeforces编程竞赛评估中,o1表现超过89%的参赛者。在编程奥林匹克竞赛中,允许模型提交10000次的情况下,o1取得32.14分,超过金牌门槛。
o1目前尚不具备ChatGPT的部分实用功能,包括网络浏览、文件上传和图像处理,在世界事实知识方面的表现也不如GPT-4o。OpenAI表示,短期内GPT-4o对于日常应用场景可能仍然更为实用,但o1在复杂推理任务方面代表了AI能力的重大飞跃。o1的技术仍处于早期阶段,OpenAI正在探索其在可靠性、幻觉和对抗攻击鲁棒性方面的安全机会,并研究新方法的扩展限制。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。