阿里千问开源Qwen-Drive-1.0-4B,首个面向自动驾驶的视觉语言基础模型发布

Qwen-Drive-1.0是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了3D感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练VLM的原始架构。

阿里千问于本周开源了Qwen-Drive-1.0-4B,这是一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。据官方介绍,Qwen-Drive-1.0是首个面向自动驾驶的视觉语言基础模型,其在预训练阶段统一了3D感知与视觉问答任务,并进一步将能力扩展至运动规划领域,同时完全保留了预训练视觉语言模型(VLM)的原始架构。

该模型采用分阶段训练方案,将驾驶监督数据与通用视觉语言数据相结合。这一策略使得模型在获得驾驶特定能力的同时,保留了通用的视觉理解与指令遵循能力。Qwen-Drive-1.0-4B同时提供了基于监督微调(SFT)和强化学习(RL)的两个规划专家版本,官方评测覆盖了3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划等多个维度。

在数据构建方面,Qwen-Drive-1.0仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并建立了从开环预测到闭环驾驶的全面评估体系。官方数据显示,SFT模型在所有基准上已具备竞争力;经过强化学习后,该模型以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。

此次开源延续了阿里千问在基础模型领域的开放策略。Qwen-Drive-1.0的发布为自动驾驶研发提供了新的技术路径,其统一3D感知与规划任务的设计思路,或将对智能驾驶系统的端到端训练方法产生影响。相关代码与模型权重已同步上线GitHub、Hugging Face及ModelScope平台,供研究社区使用。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
加南科技预告新款屏显AI眼镜 整机26克计划2027年春季发布
上一篇 1小时前
微软将于2026年终止Office 2021支持,第三方0patch推出付费延长安全补丁服务
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部