蚂蚁集团9月9日宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于Ling-3.0-flash的MoE(混合专家)架构拓展,总参数量为124B,单次推理激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达到256K Token。目前,该模型已在Ling Studio上线并提供免费体验,BF16和FP8版本已在Hugging Face及ModelScope平台开源。
Ling-3.0-flash-VL围绕“更可靠、更高效完成真实任务”的方向,引入了视觉反馈闭环机制。该机制将任务推进为“观察 → 行动 → 验证 → 修正”的持续闭环,使模型在医疗报告解读、前端代码生成及GUI自动化等场景中能够基于视觉反馈持续修正执行结果。这一设计有别于传统多模态模型一次性的“看图生成”模式,强调模型在真实任务执行过程中的自我纠错能力。
在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在Artificial Analysis Intelligence Index v4.1.1评估中,Ling-3.0-flash-VL较纯文本版本Ling-3.0-Flash提升了4分。这一结果表明,视觉与文本的联合训练并非仅服务于多模态任务,还能反向增强模型在纯文本任务上的表现。
在实际应用测试中,该模型在图片转网页任务中可理解布局与组件关系并生成代码,且能通过渲染结果对比进行自我修正。在Image-to-WebDev Arena官方评测中,模型(代号linthium)的评测得分高于GPT-5.4。作为GUI Agent时,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,模型支持跨文档数据整合与风险标识。这些应用场景的覆盖,显示出该模型在视觉理解与任务执行结合方面的能力边界。
从技术架构来看,Ling-3.0-flash-VL引入了任意分辨率视觉编码器与VideoRoPE,语言主干沿用42层混合架构,即交替排列KDA与Gated MLA,比例5:1。在124B总参数下单次推理仅激活5.5B参数,这一稀疏激活设计使模型在实时视频对话、多轮视觉交互及长时任务中可保持低延迟响应。其256K上下文窗口支持长文档与长视频分析,为处理复杂业务场景中的长序列输入提供了基础能力。
蚂蚁集团此次开源Ling-3.0-flash-VL,延续了其在百灵系列模型上的开源策略。此前发布的Ling-3.0-flash文本模型已面向开发者开放,此次多模态版本的推出进一步丰富了百灵系列的产品矩阵。模型在Hugging Face和ModelScope平台同步上线,开发者可直接下载使用。据蚂蚁集团披露,FP4和INT4量化版本计划于近期发布,届时将适配更多推理场景和边缘设备。
多模态大模型正从单纯的图文理解走向复杂任务的闭环执行,视觉反馈机制的引入为模型在真实业务场景中的落地提供了新的技术路径。蚂蚁集团将这一能力率先应用于医疗、前端开发和界面自动化等垂直领域,其开源策略也有助于推动多模态模型在更广泛的企业服务场景中的部署与迭代。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。