OpenAI发布GPT Image 2.5图像生成模型,强化多轮编辑与精确修改能力

相比Images 2.0,新模型最高可以降低50%的生成延迟,同时改善参考图主体保真度、自然光照和纹理表现。

OpenAI于近期发布GPT Image 2.5图像生成模型,将升级重点放在精确编辑、多轮编辑一致性和生成速度上。根据官方公布的信息,新模型相比前代GPT Image 2最高可降低50%的生成延迟,并在参考图主体保真度、自然光照和纹理表现方面有所改善。API层面,OpenAI将该模型分为Flare和Sunburst两个版本,前者定位速度优先,后者定位质量优先,定价与此前的GPT Image 2保持一致。

GPT Image 2.5的核心升级集中在编辑能力上。此前GPT Image 2虽然支持图像修改,但在局部编辑时容易出现整张图结构变化的问题,包括主体位置偏移或背景被意外改动。OpenAI称,新模型的精确编辑能力可以只修改用户指定的元素,同时尽可能保持主体、构图、背景乃至品牌视觉不变,适用于商品替换、文案调整或局部元素修改等场景。

多轮编辑一致性是此次升级的另一项重点。该功能允许用户在一张图完成第一轮修改后直接进行第二轮、第三轮修改,此前的修改结果会被保留,新一轮编辑建立在上一轮输出之上,而不是每次重新理解并生成。OpenAI特别指出,图片质量不应随着编辑轮数增加而持续劣化,该特性旨在解决长期存在的多轮编辑累积失真问题。

在模型评测方面,根据大模型盲测竞技场Arena最新公布的结果,GPT Image 2.5的Sunburst和Flare版本包揽了文生图、单图编辑和多图编辑三个竞技场的前两名。其中Sunburst在文生图评分上较GPT Image 2提高40分,单图编辑提高59分,多图编辑提高81分;Flare版本则分别提高18分、30分和47分。需要指出的是,Arena测试的“多图输入编辑”与OpenAI官方强调的“多轮图像编辑”并非同一维度。

在API定价方面,OpenAI最新价格页显示,GPT Image 2.5 Flare和Sunburst的图像输入均为8美元/百万token,图像输出为30美元/百万token,文本输入为5美元/百万token,与GPT Image 2保持一致。Flare被定义为默认模型,在获得更高质量的同时降低延迟;Sunburst则牺牲部分速度换取更精细的控制,主要面向广告素材、商品图等对细节要求较高的场景。

除模型本身外,OpenAI还新增了两个交互功能。其一是Sketch草图模式,用户在移动端输入@Sketch后可以直接手绘想法,由GPT Image根据草图继续生成图像,降低了文字描述的门槛。其二是Prompt分享功能,用户分享ChatGPT生成的图片时可附带完整Prompt,他人可替换个人信息和细节后直接复刻同一风格。

从行业视角看,GPT Image 2.5在编辑能力上的补强,与谷歌NanoBanana系列此前已实现的功能存在重合。NanoBanana一代已将连续编辑设为核心能力,其后的Pro版本进一步覆盖了相机、灯光、构图和多主体控制,二代产品则将Pro能力压缩至Flash级别的生成速度。OpenAI此次的升级在一定程度上补齐了与竞品在可编辑性上的差距。

社区对新模型的反响集中于图像编辑之外的延伸场景。开发者开始使用GPT Image 2.5连续生成序列帧并拼接为定格动画,有用户从手绘草图出发生成整套动作连续的动画素材。另有开发者测试了Sunburst版本生成透明背景素材的能力,认为其输出质量已可用于游戏开发与设计工作的素材准备。部分用户还尝试了包含复杂指令组合的生成任务,以检验模型对多要素约束的理解能力。

GPT Image 2.5的发布延续了OpenAI将图像生成与文字、排版、布局信息融合的产品路线,但此次升级明显将重心从一次性成图转向了成图后的持续修改。这一方向是否能在实际工作流中替代传统设计工具,仍取决于模型在多轮编辑中的稳定性和可控性,后续开发者与设计社区的反馈将提供参照。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
英伟达DLSS 5开放体验 神经渲染技术提升老游戏画面表现
上一篇 3小时前
GPT-6 Astra引发AGI定义之争:评测高分与通用智能之间仍有距离
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部