2026年9月3日,阿里云通义千问团队发布Qwen-Drive-1.0。这是全球首个在预训练阶段统一3D感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型,全程保持预训练VLM架构无改动。模型以Qwen3.5-4B为基座,在不修改原架构的前提下增加两个外部模块,完成了从通用VLM到自动驾驶专用模型的跨越。
一句话结论
Qwen-Drive-1.0是目前最具开放性的自动驾驶VLM方案,基于Qwen3.5-4B微调,保留通用视觉语言能力的同时新增3D感知与轨迹规划能力,BEV感知头全程可检视,适合研究机构和车厂作为自动驾驶视觉语言基座进行二次开发。
为什么需要专门的自动驾驶VLM
通用视觉-语言模型(VLM)已经具备强大的图像理解和推理能力,但直接用于自动驾驶存在两个核心障碍:缺少3D空间感知输出(通用VLM无法直接给出前方障碍物的位置和速度),以及缺少运动规划能力(无法生成自车未来行驶轨迹)。
现有方案通常采用预训练VLM加外部模块的范式,但往往需要修改预训练架构本身,导致模型丧失通用视觉语言能力。Qwen-Drive-1.0的设计目标正是在保持预训练VLM完全不变的前提下,通过增加外部模块来解锁自动驾驶能力。
模型架构:Qwen3.5-4B加两个外部模块
Qwen-Drive-1.0以Qwen3.5-4B为基座,这是通义千问的开源多模态模型,具备原生多模态理解能力。在此基础上,模型增加两个外部模块:
BEV感知头:从多视角相机输入构建鸟瞰图(Bird Eye View)表征,联合完成3D目标检测、语义Occupancy预测与BEV地图分割。这个感知头既是自动驾驶的3D探针,也是整个系统的梯度路径,其损失在联合训练中为共享视觉通路提供额外监督信号,使基座VLM在保持通用能力的同时获得3D空间理解。
规划专家:基于流匹配(Flow Matching)的扩散Transformer,生成覆盖未来5秒的自车轨迹。文本形式的规划推理可作为可选条件输入。整个规划模块面向预训练VLM的表征设计,统一的轨迹标注支持跨多个公开驾驶数据集联合训练。
分阶段训练:如何不破坏通用能力
自动驾驶数据与通用视觉语言数据在分布上有显著差异,直接混合训练容易引发灾难性遗忘,即模型丧失原有的通用能力。Qwen-Drive-1.0采用分阶段训练策略:第一阶段使用驾驶数据微调外部模块,固定预训练VLM参数;第二阶段在更大规模通用视觉语言数据上联合训练,同时保留驾驶专项能力。
团队还统一了跨数据集的标签体系,重新对驾驶相关的VQA数据集打标,并按语义一致性过滤样本,确保训练数据的质量和一致性。
评测结果:开环、伪闭环与闭环均具竞争力
研究团队在3D感知、驾驶视觉问答与运动规划三个维度上对Qwen-Drive-1.0进行了全面评测。评测数据集包括nuScenes、Waymo Open Dataset等主流自动驾驶数据集,以及DriveLM等视觉问答基准。结果显示,Qwen-Drive-1.0在各项指标上均取得具竞争力的表现,BEV感知头提供的3D检测精度与专用3D检测模型差距已缩小至可接受范围。
更关键的是,模型的通用视觉语言能力(图像描述、VQA等)在加入自动驾驶模块后并未显著退化,验证了架构无改动这一约束的实际效果。
开源与生态:Hugging Face、ModelScope同步上线
Qwen-Drive-1.0已在Hugging Face和ModelScope开源,提供了预训练权重、推理代码和评测脚本。研究者和车厂可以直接基于此基座进行下游任务微调,无需从零训练视觉编码器。
开源模型同时支持在线推理和本地部署,为国产芯片适配提供了基础。团队表示,后续将持续更新模型权重和训练代码,推动自动驾驶视觉语言模型的开源生态建设。
数据表:Qwen-Drive-1.0核心参数一览
| 指标 | 参数 |
|---|---|
| 基座模型 | Qwen3.5-4B(原生多模态VLM) |
| 预训练架构改动 | 零改动,仅增加外部模块 |
| BEV感知头 | 3D目标检测、语义Occupancy预测、BEV地图分割 |
| 规划专家 | 流匹配扩散Transformer,预测未来5秒轨迹 |
| 训练策略 | 分阶段训练,驾驶数据微调外部模块后联合训练 |
| 规划推理 | 文本形式规划推理作为可选条件输入 |
| 开源平台 | Hugging Face、ModelScope |
| 评测维度 | 3D感知、驾驶VQA、运动规划(开环/伪闭环/闭环) |
FAQ:关于Qwen-Drive-1.0你最想知道的
Q:Qwen-Drive-1.0和专用自动驾驶感知模型有什么本质区别?
A:专用自动驾驶感知模型通常只输出3D框或占用栅格,无法提供语言形式的解释和推理。Qwen-Drive-1.0在同一个模型里同时完成了3D感知和视觉问答,用户可以追问为什么在这里刹车并得到语言形式的回答,透明度远高于黑盒感知模型。
Q:这个模型可以直接用于量产车吗?
A:不适合直接量产上车——4B参数规模尚未达到车规级实时性要求,且未经过功能安全认证。但非常适合作为研究基座或概念验证阶段使用,团队提供了完整的开源权重和评测代码。
Q:和特斯拉的端到端方案相比,Qwen-Drive-1.0有什么不同?
A:特斯拉的端到端方案是从传感器直接到控制信号的单一大模型,信息压缩在隐空间里。Qwen-Drive-1.0保留了可解释的中间输出(BEV表征、3D检测框、轨迹预测),每一步都可检视可调试,更适合研究场景而非直接对标特斯拉的量产方案。
相关阅读
- Qwen3.8-Omni-Flash:耳聪目明,办事得力
- DeepSeek V4.1 Flash发布:552B MoE、KV缓存缩437倍
- 微软Decision-1发布:基于Qwen3.5-9B,36项基准83.5%准确率
- Cloudflare Clef-omni:首个音视频开放权重决策模型
延伸阅读
- 腾讯混元游戏视觉生成平台解析:建模准备从 12 小时压到 30 分钟,九大能力矩阵开放3 周前
- 美团 AI 原生社区「觅游」公测:4 万+ Skills 技能便利店,让 Agent 拥有身份与成长3 周前
- Anthropic 发布 Claude Science:科研 AI 工作台上线,资助 50 个项目最高 3 万美元额度3 周前
- Manus 宣布脱离 Meta 恢复独立运营,部分用户数据 8 月 23 日将被删除2 月前
