Qwen-Drive-1.0:首个统一3D感知与运动规划的自动驾驶视觉-语言模型

2026年9月3日,阿里云通义千问团队发布Qwen-Drive-1.0。这是全球首个在预训练阶段统一3D感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,全程保持预训练VLM架构无改动。模型以Qwen3.5-4B为基座,在不修改原架构的前提下增加两个外部模块,完成了从通用VLM到自动驾驶专用模型的跨越。

一句话结论

Qwen-Drive-1.0是目前最具开放性的自动驾驶VLM方案,基于Qwen3.5-4B微调,保留通用视觉语言能力的同时新增3D感知与轨迹规划能力,BEV感知头全程可检视,适合研究机构和车厂作为自动驾驶视觉语言基座进行二次开发。

为什么需要专门的自动驾驶VLM

通用视觉-语言模型(VLM)已经具备强大的图像理解和推理能力,但直接用于自动驾驶存在两个核心障碍:缺少3D空间感知输出(通用VLM无法直接给出前方障碍物的位置和速度),以及缺少运动规划能力(无法生成自车未来行驶轨迹)。

现有方案通常采用预训练VLM加外部模块的范式,但往往需要修改预训练架构本身,导致模型丧失通用视觉语言能力。Qwen-Drive-1.0的设计目标正是在保持预训练VLM完全不变的前提下,通过增加外部模块来解锁自动驾驶能力。

模型架构:Qwen3.5-4B加两个外部模块

Qwen-Drive-1.0以Qwen3.5-4B为基座,这是通义千问的开源多模态模型,具备原生多模态理解能力。在此基础上,模型增加两个外部模块:

BEV感知头:从多视角相机输入构建鸟瞰图(Bird Eye View)表征,联合完成3D目标检测、语义Occupancy预测与BEV地图分割。这个感知头既是自动驾驶的3D探针,也是整个系统的梯度路径,其损失在联合训练中为共享视觉通路提供额外监督信号,使基座VLM在保持通用能力的同时获得3D空间理解。

规划专家:基于流匹配(Flow Matching)的扩散Transformer,生成覆盖未来5秒的自车轨迹。文本形式的规划推理可作为可选条件输入。整个规划模块面向预训练VLM的表征设计,统一的轨迹标注支持跨多个公开驾驶数据集联合训练。

分阶段训练:如何不破坏通用能力

自动驾驶数据与通用视觉语言数据在分布上有显著差异,直接混合训练容易引发灾难性遗忘,即模型丧失原有的通用能力。Qwen-Drive-1.0采用分阶段训练策略:第一阶段使用驾驶数据微调外部模块,固定预训练VLM参数;第二阶段在更大规模通用视觉语言数据上联合训练,同时保留驾驶专项能力。

团队还统一了跨数据集的标签体系,重新对驾驶相关的VQA数据集打标,并按语义一致性过滤样本,确保训练数据的质量和一致性。

评测结果:开环、伪闭环与闭环均具竞争力

研究团队在3D感知、驾驶视觉问答与运动规划三个维度上对Qwen-Drive-1.0进行了全面评测。评测数据集包括nuScenes、Waymo Open Dataset等主流自动驾驶数据集,以及DriveLM等视觉问答基准。结果显示,Qwen-Drive-1.0在各项指标上均取得具竞争力的表现,BEV感知头提供的3D检测精度与专用3D检测模型差距已缩小至可接受范围。

更关键的是,模型的通用视觉语言能力(图像描述、VQA等)在加入自动驾驶模块后并未显著退化,验证了架构无改动这一约束的实际效果。

开源与生态:Hugging Face、ModelScope同步上线

Qwen-Drive-1.0已在Hugging Face和ModelScope开源,提供了预训练权重、推理代码和评测脚本。研究者和车厂可以直接基于此基座进行下游任务微调,无需从零训练视觉编码器。

开源模型同时支持在线推理和本地部署,为国产芯片适配提供了基础。团队表示,后续将持续更新模型权重和训练代码,推动自动驾驶视觉语言模型的开源生态建设。

数据表:Qwen-Drive-1.0核心参数一览

指标 参数
基座模型 Qwen3.5-4B(原生多模态VLM)
预训练架构改动 零改动,仅增加外部模块
BEV感知头 3D目标检测、语义Occupancy预测、BEV地图分割
规划专家 流匹配扩散Transformer,预测未来5秒轨迹
训练策略 分阶段训练,驾驶数据微调外部模块后联合训练
规划推理 文本形式规划推理作为可选条件输入
开源平台 Hugging Face、ModelScope
评测维度 3D感知、驾驶VQA、运动规划(开环/伪闭环/闭环)

FAQ:关于Qwen-Drive-1.0你最想知道的

Q:Qwen-Drive-1.0和专用自动驾驶感知模型有什么本质区别?
A:专用自动驾驶感知模型通常只输出3D框或占用栅格,无法提供语言形式的解释和推理。Qwen-Drive-1.0在同一个模型里同时完成了3D感知和视觉问答,用户可以追问为什么在这里刹车并得到语言形式的回答,透明度远高于黑盒感知模型。

Q:这个模型可以直接用于量产车吗?
A:不适合直接量产上车——4B参数规模尚未达到车规级实时性要求,且未经过功能安全认证。但非常适合作为研究基座或概念验证阶段使用,团队提供了完整的开源权重和评测代码。

Q:和特斯拉的端到端方案相比,Qwen-Drive-1.0有什么不同?
A:特斯拉的端到端方案是从传感器直接到控制信号的单一大模型,信息压缩在隐空间里。Qwen-Drive-1.0保留了可解释的中间输出(BEV表征、3D检测框、轨迹预测),每一步都可检视可调试,更适合研究场景而非直接对标特斯拉的量产方案。

相关阅读