谷歌于10月7日正式发布AI图像生成与编辑模型Nano Banana 2.1,这是继今年早些时候推出Nano Banana 2之后的又一次版本迭代。谷歌表示,新版本在视觉设计、基于蒙版的图像编辑以及主体一致性三个方向实现重点改进,并已同步面向开发者和企业用户开放。
Nano Banana 2 此前也被称为 Gemini 3.1 Flash Image,其定位是在保持谷歌 Flash 系列模型高速特性的同时,达到与 Nano Banana Pro 同级别的出图质量。谷歌曾将多项原本属于 Pro 版本的能力下放至该模型,包括现实世界知识库、文字渲染效果优化以及角色与物体的一致性表现提升。此次发布的 2.1 版本在此基础上进一步扩展了上述能力边界。
在视觉设计方面,Nano Banana 2.1 能够生成构图效果更佳、完成度更高的视觉素材。在蒙版编辑方面,用户可更精准地选中并修改现有图像的局部区域,无需重新生成整张画面。在主体一致性方面,模型在执行编辑操作或批量生成多张关联图片时,可以更好地保留画面主体的样貌与特征。谷歌方面指出,改进后的主体一致性对 Gemini 用户具有较强实用性,可保证同一个人物或物体在多次生成结果中保持样貌统一。
部署层面,Nano Banana 2.1 已逐步上线,覆盖 Gemini 应用、谷歌搜索的 AI 模式、Google AI Studio、Google Flow、Stitch、谷歌广告以及 Gemini 企业平台。面向开发者,该模型已正式开放调用,对应模型 ID 为 gemini-nano-banana-2.1,支持文本、图片、音频以及视频输入,同时可输出 1K、2K 以及 4K 分辨率的图像。
从竞争格局看,OpenAI 的 ChatGPT Images 2.5 目前仍是全球领先的图像生成编辑模型。该产品在用户持续微调一张图片时,更擅长保留上一轮的修改成果,不会改动未编辑区域,也不会随着反复迭代导致原图画质下降。紧随其后的是微软 AI 的 MAI-Image-2.6 模型,该模型于今年8月发布。谷歌此次更新 Nano Banana 2.1,可视为其在图像生成与编辑赛道对上述竞品的直接回应。
值得关注的是,Nano Banana 2.1 的开放策略覆盖了从消费级应用到企业级平台的多个入口。开发者可通过模型 ID 直接调用,企业用户则能在 Gemini 企业平台中使用。这种多端同步部署的方式,有助于谷歌将图像生成能力嵌入更广泛的业务场景,包括广告创意、设计协作和内容生产等。随着图像编辑模型在可控性和一致性上的持续提升,企业服务领域对 AI 视觉工具的使用门槛正在进一步降低。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。