9月20日,阿里千问宣布开源图像模型Qwen-Image-2.1,该模型将文生图与图像编辑能力整合至同一架构,视觉生成部分参数量为7B,原生支持透明图像的生成与编辑。
据官方介绍,Qwen-Image-2.1的更新集中在四个方向。在模型效率方面,该模型通过轻量化结构与推理优化,试图在生成质量与计算成本之间取得平衡。在透明图像处理方面,模型可根据提示词生成普通图像或透明图像,并支持透明图层编辑与抠图操作,这一能力在电商商品图、设计素材制作等场景中具有直接应用价值。
编辑能力上,Qwen-Image-2.1支持最多10张参考图输入,增强了局部编辑、人像与商品保真度,覆盖多种编辑任务类型。官方演示案例显示,用户可通过十张家居参考图生成具有真实质感的室内布置效果。此外,模型在文字排版、人物光影与细节表现方面进行了针对性优化。
从行业视角看,图像生成模型的竞争焦点正从单纯的生成质量转向生成与编辑一体化、推理效率与部署成本的综合平衡。7B参数规模的视觉生成模型在保持可用效果的同时,对推理硬件的要求相对可控,有利于开发者和企业在自有环境中部署。原生透明图像生成能力的加入,则填补了多数开源文生图模型在图层级编辑上的空白,对需要透明素材的设计、电商、广告等场景具有实际意义。
目前,Qwen-Image-2.1的模型权重已在GitHub、HuggingFace和ModelScope三个平台同步开放下载。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。