阿里千问开源首个自动驾驶视觉语言基础模型 Qwen-Drive-1.0-4B

📡 IT之家2026-09-06 17:15

阿里千问开源自动驾驶视觉语言模型Qwen-Drive-1.0-4B,基于Qwen3.5-4B打造,统一了3D感知、场景问答与运动规划。

AI 深度解读

阿里巴巴通义千问团队开源面向自动驾驶的视觉语言基础模型 Qwen-Drive-1.0-4B,尝试在保留通用多模态主干架构的基础上统一 3D 感知、视觉问答与运动规划。

  • 架构设计上,该模型基于 Qwen3.5-4B 构建且不改动通用视觉语言主干,外接用于联合执行 3D 目标检测、占据网格预测与 BEV 地图分割的感知头,并接入基于流匹配(Flow Matching)技术的规划专家模块。
  • 训练方案采用分阶段数据配比,将公开驾驶数据集与通用图文语料结合,官方评测数据显示其在保留通用多模态理解能力的同时,在 LingoQA、SURDS 等驾驶问答基准上具备针对性场景理解表现。
  • 运动规划方面,开源版本提供监督微调(SFT)和强化学习(RL)两个规划专家,评测范围覆盖开环预测、NAVSIM 伪闭环及 AlpaSim 闭环驾驶等多种环境。
  • 影响/看点:Qwen-Drive-1.0-4B 的开源为业界探索将通用多模态基础模型扩展至具身与端到端智驾系统提供了公开基准与实现参考;该方案能否在实际车端部署落地,关键取决于 4B 参数规模结合流匹配生成在车载芯片上的实时推理时延与复杂长尾场景下的安全边界控制。
  • 资料依据:
  • Hugging Face(2026-09-06):https://huggingface.co/Qwen/Qwen-Drive-1.0-4B
  • GitHub(2026-09-06):https://github.com/QwenLM/Qwen-Drive-1.0
  • IT之家(2026-09-06):https://www.ithome.com/0/998/997.htm

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手