本篇论文出发点:
端到端自动驾驶因“全可微、模块一体化优化”的优势,已成为研究热点,但现在端到端方法存在三个问题:
1.昂贵的bev计算:稠密bev计算开销大
2.动作多样性缺失,UniAD/VAD 回归单模态轨迹,忽略驾驶行为固有的多模态性与不确定性
3.复杂场景决策次优:在真实复杂场景中决策质量不佳
作者认为:扩散模型能建模多模态输出,VLM能提供高层驾驶决策常识,sparse表示能降低计算成本,三者各有优势但单独不足以同时解决上述三点。于是提出DiffVLA,把VLM高层引导+稀疏-稠密混合感知+截断扩散规划组合成一个框架。
本文主要贡献:
论文声明的三大组件:
1. VLM Guidance Module:基于Senna-VLM,输入多视角图像,输出高层驾驶指令(横向/纵向控制 one-hot 编码),与外部导航指令融合后作为扩散规划的语义引导。
2.Hybrid Perception Module:稀疏分支(Sparse4D-v3+SparseMEXT,输出3D框与地图矢量)+ 稠密分支(BEVDet式BEV投影,128×128网格、64×64m范围)。显式信息用于碰撞检测与可行驶区域检查,隐式信息用于轨迹扩散引导。
3.Diffusion-Based Planning Module:基于DiffusionDrive的截断扩散策略,k-means构造轨迹词表V,32个 anchor,缩短扩散schedule,并设计分层信息编码融合异构输入。
4.本文方法与相关方法对比
维度 | UniAD | VAD | SparseDrive | DiffusionDrive | Senna | DiffVLA |
感知表示 | 稠密 BEV | 向量化 | 稀疏实例 | 稠密 BEV | 端到端+VLM | 稀疏+稠密混合 |
轨迹建模 | 单模态回归 | 单模态回归 | 单模态 + 多模态选择 | 多模态扩散 | 单模态(VLM 给 meta-action) | 多模态截断扩散 |
VLM 引导 | 无 | 无 | 无 | 无 | 有(自然语言 meta-action) | 有(one-hot 指令) |
训练方式 | 端到端联合 | 端到端联合 | 两阶段 | 端到端 | VLM 与 E2E 解耦训练 | 多模块分别训练(受时间限制) |
Benchmark | nuScenes | nuScenes | nuScenes | NAVSIM v1 | nuScenes/DriveX | NAVSIM v2(含反应式 stage-2) |
知识点介绍:
VLM解耦引导(Senna范式)VLM不直接输出精确数值轨迹,而是输出高层决策(横向:变道/转弯;纵向:加速/制动),再由端到端模型生成精确轨迹
本文方法介绍:

总结:
1.好的点
a)工程整合度高,把稀疏感知、稠密感知、VLM引导、截断扩散四个方向拼成一个能跑通NAVSIM v2反应式评测的完整系统。
b)稀疏+稠密互补、显式信息用于碰撞检测/可行驶域检查的设计务实可解释。
2.不好的点
a)零消融、零基线对比,贡献无法归因——方法学不达标。
b)"全可微端到端"动机与"分模块分别训练"实现自相矛盾。
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
更多精彩内容,欢迎大家关注微信公众号“自动驾驶新视界”。