导航菜单
首页 服务 OPC项目 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于 OPC城市 北京OPC 上海 广州 深圳 杭州 注册指南 OPC完全指南 AI副业
⚡ 创客OPC ← 返回资讯
阿里千问开源Qwen-Drive-1.0-4B:一个4B模型同时做感知、问答与规划

9月6日,阿里巴巴旗下通义实验室正式开源Qwen-Drive-1.0-4B自动驾驶视觉语言模型。该模型基于Qwen3.5-4B构建,官方称其为全球首个面向自动驾驶的视觉语言基础模型。

这里的“统一”指的并非把整个驾驶栈塞进一个端到端黑箱,而是在一套共享的视觉语言表征之上,挂接不同职责的输出头。传统方案中,检测、占用预测、地图分割、行为规划往往由彼此独立的模型接力完成,模块之间的信息接口一旦定义不完整,误差就会沿链路累积。Qwen-Drive的尝试是把这些任务收敛到同一个骨干与表征空间,让感知结果直接服务于语言问答与规划决策,减少跨模块的信息损耗,同时保留每个输出头的专门性。

一、统一三种驾驶能力的单一模型

Qwen-Drive-1.0-4B的创新性在于,在预训练阶段统一了3D感知与视觉问答,并进一步扩展至运动规划,同时保留原VLM(视觉语言模型)架构。传统自动驾驶栈往往把感知、问答、规划拆成多个独立模块,Qwen-Drive试图把它们放进同一套模型表示里:外接的鸟瞰图(BEV)感知头负责3D目标检测、语义占用预测和地图分割,原有的语言模型负责通用及驾驶场景视觉问答,规划专家则读取共享视觉语言表示,预测自车未来行驶轨迹。

鸟瞰图感知头把前视或环视图像转换为俯视视角下的结构化表达,输出物体位置、速度、类别,以及可行驶区域与障碍占用等信号;语言模型部分则保留对自然语言指令和场景问题的理解能力,可以回答“前方路口为什么需要减速”一类需要结合感知与规则判断的问题。两类信息汇入共享视觉语言表示后,规划头才能在同时包含几何空间与语义理解的输入上预测未来轨迹。

二、分阶段训练与双规划专家

模型采用分阶段训练方案,将驾驶监督数据与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive-1.0-4B同时提供SFT(监督微调)和RL(强化学习)两个规划专家。官方评测覆盖3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

两个规划专家的定位各有侧重:SFT版本通过带专家轨迹的监督样本学习稳健的基础驾驶行为,适合快速接入与基准对比;RL版本在SFT基础上继续优化,用奖励信号对齐人类偏好和闭环安全性,代价是开环位移误差略有上升,换来的是更贴近真实驾驶需求的决策质量。规划专家采用流匹配方式生成未来轨迹,把轨迹预测建模为连续的去噪生成过程,相比逐帧自回归式预测,更便于产出平滑、整体一致的路径。评测分三个层次:开环评测只比较单步预测与真实轨迹的偏差;伪闭环评测引入部分模拟反馈;闭环评测让模型在仿真环境中完整行驶并统计安全与接管情况,由浅入深地刻画能力边界。

三、规划样本全部来自公开数据

据介绍,Qwen-Drive-1.0仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。SFT模型在所有基准上已具备竞争力;经过强化学习后,该模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。模型已在GitHub、Hugging Face、ModelScope三大开源平台同步发布,开放代码与权重。

规划样本全部来自公开数据的另一层价值在于可复现:任何研究团队都可以按同一组数据集复跑训练与评测,而不必依赖厂商私有的路测数据。统一各数据集的轨迹格式,则解决了不同来源数据在坐标系、采样频率与标注口径上的不一致,让多个公开数据集可以拼合使用,相当于为开源社区提供了一套可横向比较的基准底座。

四、与论文版本的关系

通义千问团队与华中科技大学联合提出的Qwen-Drive-1.0论文显示,它在保留通用视觉-语言能力的同时,将3D感知、视觉问答、运动规划集成于统一框架。团队也承认,统一模型并不等于所有模块都由语言模型独立完成,检测、地图分割和轨迹生成仍有专门头部,它们共享表征但承担不同输出约束。论文同时强调,闭环测试高分不等于量产道路部署,4B模型尚不能在量产车上覆盖传感器故障、恶劣天气、长尾交通参与者等真实边界。

这也划出了开源驾驶模型的现实边界:4B规模让模型可以跑在消费级显卡上,用于研究与原型验证,但距离车规级的安全冗余、故障降级与功能安全认证仍有相当距离。把这类开源模型用于仿真训练、数据标注与教学演示,是现阶段更稳妥的切入点。

面向创业者与一人公司的行业点评

对一人公司和中小技术团队来说,Qwen-Drive给出两个值得记下的信号。其一,开源自动驾驶基础模型正在把“感知-理解-规划”压进一个可微调的小模型,单人开发者借助公开数据与开源代码,就能在仿真或园区场景做闭环验证,不必从零搭建多模块流水线。其二,它示范了一种稳妥的数据策略:规划样本全部用公开数据、统一轨迹格式,从一开始就规避合规与授权风险。对资源有限的团队,选开源、可商用、数据干净的底座,比追参数规模更实在。自动驾驶的落地门槛依然高,但这类开源VLM把“先跑起来做一个可演示原型”的成本压到了个人可负担的范围。

本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理

微信搜一搜「北京安迪哥OPC」
上一篇
Claude 11天跑通费马大定理:1300万行Lean代码...
下一篇
iPolloWork开源OPC协作平台亮相:左对话右成果,一...
需要落地支持?

从网站 / 小程序开发到 AI 工具链企业培训,提供全栈交付与落地方案;也可以先看看一个人如何用 AI 工具链撑起专业级交付。本页内容整理的是一线实践,具体项目按需评估。

查看服务与报价 → AI 工具链 + FDE 实战 →