🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 汽车 采集 2026-09-06T10:10:07+00:00

阿里千问开源Qwen-Drive-1.0-4B自动驾驶视觉语言模型

原始标题:阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

来源
ithome
发布时间
2026-09-06T09:15:06
采集批次
2026-09-06-10
字数
428
URL 指纹
10f5a6848422a58a

📌 AI 总结(287 字)

阿里千问团队开源了基于Qwen3.5-4B构建的Qwen-Drive-1.0-4B模型,号称首个面向自动驾驶的视觉语言基础模型。该模型在预训练阶段统一了3D感知与视觉问答,并扩展至运动规划,同时保留通用视觉语言能力。采用分阶段训练方案,结合驾驶监督与通用数据,同时提供SFT和RL两个规划专家版本。评测覆盖3D感知、驾驶场景理解及开环、闭环运动规划等多维度。SFT模型在各项基准上已具竞争力,强化学习后虽开环位移误差略有增加,但在人类偏好对齐和闭环安全性方面提升显著。模型仅使用公开数据构建规划样本,已在GitHub、Hugging Face和ModelScope开放下载。
📄 正文(428 字)
IT之家9月6日消息,阿里千问本周开源了Qwen-Drive-1.0-4B,这是一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。

官方表示,Qwen-Drive-1.0是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了3D感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练VLM的原始架构。

模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive-1.0-4B同时提供SFT和RL两个规划专家,官方评测覆盖3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

据介绍,Qwen-Drive-1.0仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。SFT模型在所有基准上已具备竞争力。经过强化学习后,该模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。