德国AI公司Black Forest Labs于10月2日发布公告,正式推出图像生成AI模型FLUX 3 Image。该模型支持生成最高4K分辨率的图片,输出画面在放大后仍能保持丰富细节,目前作为Black Forest Labs的付费服务提供。
FLUX 3 Image基于FLUX 3基座开发,官方将高可控性与精细编辑能力作为其核心卖点。与多数图像生成模型依赖自然语言提示词进行整体描述不同,FLUX 3 Image引入了基于坐标网格的元素级排布机制。用户可在归一化的0至1000坐标网格上,为画面中的每个元素指定唯一ID、描述文本以及精确的边界框,边界框格式为[y_min, x_min, y_max, x_max]。这一机制使生成结果中各个对象的位置与范围可以被显式定义,而非完全交由模型随机决定。
在参考图像处理方面,FLUX 3 Image单次生成最多可融入10张参考图像,并允许用户为每张参考图中的对象指定其在输出画面中的出现位置。这一能力在多主体合成、角色一致性保持以及场景拼合等任务中具有实际应用价值。编辑功能上,该模型支持对指定区域进行修改,同时保持其他像素不变。官方表示,模型能够在像素级别维持原图内容,实现精确的多轮编辑,这意味着用户可以在不破坏整体画面的前提下,对局部细节进行反复调整。
Black Forest Labs是开源图像生成模型FLUX系列背后的开发团队,该系列模型此前已在开源社区和商业应用中积累了较高的关注度。FLUX系列以生成质量与提示词遵循能力见长,被广泛用于设计、广告、电商等领域的图像生产流程。此次发布的FLUX 3 Image在延续基座能力的同时,将产品重心从单纯的生成质量转向可控性与编辑精度,这一方向与当前图像生成领域从“能生成”向“能精确控制”演进的趋势一致。
从行业视角看,图像生成模型的竞争焦点正在发生变化。早期比拼的是生成图像的逼真度与多样性,而随着模型基础能力趋于成熟,可控性、可编辑性和工作流集成能力逐渐成为差异化关键。FLUX 3 Image所采用的坐标网格与边界框机制,本质上是在生成模型中引入结构化控制接口,使其更接近专业设计工具的操作逻辑。这种设计思路与部分商业图像生成平台的方向相似,但FLUX 3 Image将其作为模型原生能力提供,而非依赖外部分割或后期处理工具。
值得注意的是,FLUX 3 Image目前仅以付费服务形式提供,尚未开放模型权重。Black Forest Labs在公告中表示,开放模型版本将于数周内公开。这一策略延续了该公司此前的产品发布节奏,即先推出商业服务验证市场需求,再通过开源版本扩大开发者生态。对于依赖开源模型进行二次开发的企业和开发者而言,开放版本的发布时间与具体许可条款将是后续关注重点。
在应用层面,元素级精准排布与多参考图融合能力,可能对电商商品图生成、广告素材批量制作、游戏概念设计等场景产生影响。这些场景通常对画面中特定对象的位置、比例和一致性有明确要求,传统生成模型难以稳定满足。FLUX 3 Image提供的坐标控制机制,为这类需求提供了一种更直接的解决路径。不过,该模型在实际工作流中的易用性、生成速度以及4K分辨率下的算力成本,仍有待用户侧验证。
随着开放模型版本即将发布,FLUX 3 Image能否在开源社区延续FLUX系列的影响力,并推动可控图像生成成为行业标配,将是未来数周值得观察的动向。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。