德国 AI 创业公司 Black Forest Labs 于 8 月 1 日正式成立,并发布旗下首款文生图模型 FLUX.1。该公司已完成 3100 万美元种子轮融资,由 a16z 领投,Y Combinator 首席执行官 Garry Tan、Oculus 前首席执行官 Brendan Iribe 以及多位知名 AI 研究专家参投。FLUX.1 发布后,xAI 旗下 Grok-2 随即接入该模型提供文生图能力,引发广泛关注。
Black Forest Labs 总部位于德国,由 Robin Rombach、Andreas Blattmann 和 Dominik Lorenz 领导。三人此前均为 Stability AI 工程师,是文生图模型 Stable Diffusion 的核心开发者。Robin Rombach 是 Stable Diffusion 两位主要作者之一,Andreas Blattmann 和 Dominik Lorenz 则是论文《High-Resolution Image Synthesis With Latent Diffusion Models》的主要作者。其代表性工作包括 VQGAN、Latent Diffusion、Stable Diffusion XL、Stable Video Diffusion、Rectified Flow Transformers 以及用于超快实时图像合成的 Adversarial Diffusion Distillation。
FLUX.1 模型按照能力差异分为三个版本,在商业使用权限上有所区分。FLUX.1 [pro] 是全新的 SOTA 文生图模型,具备丰富的图像细节、较强的 prompt 遵循能力和多样化风格,目前通过 API 开放,仅限商用。FLUX.1 [dev] 是 [pro] 的开放权重、非商用变体,基于后者蒸馏而成,推理代码和权重已发布在 GitHub 上。FLUX.1 [schnell] 是超高效的 4-step 模型,遵循 Apache 2.0 协议,可在 Hugging Face 上使用,性能与 [dev]、[pro] 接近。这一版本策略覆盖了商用、开源权重到完全开源,能力最强的版本面向商用和企业合作,基础版权完全开源。
根据 Artificial Analysis 的数据,FLUX.1 在质量方面超越了 Midjourney 和 OpenAI 的图像生成模型,至少从用户在图像领域的排名来看如此。从质量和生成成本综合考量,FLUX.1 [schnell] 处于领先位置。与部分竞品不同,接入 Grok 的 FLUX 不会拒绝涉及真人的提示词,也不会在输出中添加识别水印。这一特性与马斯克此前多次表达的立场一致,他曾表示给大模型设置安全措施会降低 AI 的安全性。
FLUX.1 发布后迅速在 X 平台引发大量用户生成内容,涵盖历史人物、公众人物及多种虚构角色。Anjney Midha 在 X 上发布了一系列对比图片,展示 FLUX 与 Gemini 在历史人物准确性上的差异。在部分案例中,FLUX 生成的图像在细节还原和 prompt 遵循方面表现更为准确。
与 Stable Diffusion 时期不同,Black Forest Labs 此次与 xAI 达成合作,为 Grok 2 提供图像生成功能。对 xAI 而言,这一合作有助于吸引更多用户并积累数据;对 Black Forest Labs 来说,合作带来的算力和资金支持预计将加速模型迭代。在官方介绍中,该公司下一步计划推出 SOTA 文生视频模型,为视频生成技术打下基础,目标是为所有人提供最先进的文生视频技术。
从团队构成和版本策略来看,Black Forest Labs 延续了 Stable Diffusion 时期对开源生态的重视,同时通过商用版本和企业合作探索商业化路径。FLUX.1 的发布是否将改变文生图领域的竞争格局,取决于其后续模型迭代速度以及开源社区与企业客户的采用程度。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。