关注【顶会通关攻略】,每日精选顶会顶刊前沿论文,不错过每一个科研通关干货!
VLA(Vision-Language-Action)+ 自动驾驶 是当前AI领域最热门的交叉方向之一。它将视觉感知、语言推理与车辆控制端到端融合,被视为端到端自动驾驶 2.0 的核心技术。相比传统模块化流水线,VLA 直接从原始图像和自然语言指令输出车辆控制量,实现"看→懂→做"一体化闭环。该方向汇聚了 CVPR / ICCV / NeurIPS 三大顶会论文,且有 Wayve、小米、Turing Inc. 等产业界深度参与,论文引用增长极快。
不少同学和行业工程师刚入门 VLA 自动驾驶就踩坑,要么模型推理和行车动作完全脱节,要么复杂路口、人车加塞场景泛化能力拉胯。
本文聚焦小米、UCLA、Wayve 三大业界代表性 VLA 方案,横向对比 ORION、AutoVLA、SimLingo 的核心创新。从时序 Transformer 因果约束、生成规划桥接、Action Dreaming 指令校验三大突破点入手,用通俗图解讲清“看画面 - 语言推理 - 输出轨迹”一体化闭环如何实现,同步放出 Bench2Drive 闭环跑分对照、消融实验结论,看完就能掌握当下最前沿的 VLA 建模范式。
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
面向端到端自动驾驶的自适应推理强化微调视觉语言动作模型 AutoVLA
针对现有自动驾驶 VLA 模型动作不物理、推理僵化问题,提出 AutoVLA 统一推理与轨迹生成;通过动作离散编码、双思维 SFT、GRPO 强化微调实现自适应推理,多数据集开环、闭环实验验证其性能与效率优势。
1. 基于 Qwen2.5-VL 构建统一自回归 VLA 框架,嵌入物理动作 Token,直接完成场景推理与轨迹规划。
2. 设计 GRPO 强化微调方案,搭配推理长度惩罚,实现简单场景快速推理、复杂场景深度推理自适应切换。
3. 搭建自动化 CoT 标注流水线,蒸馏大模型推理知识,构建大规模自动驾驶结构化推理数据集。
1. 采用 K-Disk 聚类构建 2048 维动作码本,将连续轨迹离散为可嵌入大模型的物理可行动作 Token。
2. 两阶段训练:SFT 混合纯轨迹与 CoT 数据,训练模型快慢双推理模式;RFT 用 LoRA+GRPO 优化规划与推理效率。
3. 基于 nuPlan、Waymo、nuScenes、CARLA 多数据集,开展开环基准与 CARLA 闭环仿真全面评测。
1. 相比文本路点输出,物理动作 Token 大幅降低轨迹误差、碰撞率与推理运行耗时。
2. GRPO 强化微调使 PDMS 指标提升 10.6%,推理耗时减少 66.8%,平衡规划精度与推理开销。
3. AutoVLA 在 nuPlan、Waymo、CARLA 多基准取得 SOTA 级表现,闭环仿真驾驶得分超越主流端到端模型。
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
基于视觉语言指令动作生成的全域端到端自动驾驶框架 ORION
针对 VLM 推理空间与轨迹动作空间割裂难题,提出 ORION 框架,QT-Former 提取长时视觉信息,VAE 生成器对齐双空间,构建 Chat-B2D 数据集,闭环 CARLA 测试大幅超越现有 SOTA 模型。
1. 提出生成规划器模块,通过 VAE 隐空间对齐 VLM 语义推理与数值轨迹动作空间,实现端到端联合优化。
2. 设计 QT-Former 时序模块,搭配记忆库与历史查询,高效聚合长周期多帧视觉场景上下文信息。
3. 搭建全自动标注流水线,构建适配闭环仿真的 Chat-B2D 自动驾驶 VQA 数据集,补充训练数据。
1. 三阶段分层训练:先视觉 - 语言对齐,再语言 - 动作对齐,最后多任务联合微调完成全域优化。
2. 采用 VAE 生成规划器,KL 损失约束推理 token 与轨迹隐分布匹配,输出多模态可行驶轨迹。
3. 在 Bench2Drive 闭环基准、nuScenes 开环基准开展对比消融,验证各模块独立增益。
1. ORION 在 Bench2Drive 闭环测试达 77.74 驾驶分、54.62% 成功率,显著领先所有主流端到端模型。
2. QT-Former 记忆库、交通状态监督、生成规划器三者组合可叠加提升闭环驾驶综合性能。
3. VAE 相比扩散模型更适配推理 - 动作空间对齐,框架可兼容多种生成器,泛化灵活性强。
SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
仅视觉输入、实现语言动作对齐的闭环自动驾驶模型 SimLingo
针对 VLM 自动驾驶语言与动作脱节问题,提出 SimLingo 单目视觉框架,设计 Action Dreaming 任务构建多指令数据集,解耦路径 / 速度轨迹输出,在 CARLA 闭环基准大幅领先主流方法,同时兼顾 VQA、推理能力。
1. 提出 Action Dreaming 新任务与配套数据生成方案,构造多指令动作对,解决语言与动作空间失配问题。
2. 设计解耦式轨迹输出头,分别预测几何路径、时序速度路点,显著提升车辆转向与控车稳定性。
3. 基于 InternVL2 搭建纯相机 VLA 模型,仅视觉输入实现闭环驾驶、场景问答、指令推理多任务统一。
1. 图像分块编码 + 像素下采样压缩视觉 Token,融合导航指令、车速送入 LLM 统一建模多模态输入。
2. 离线仿真生成多样指令 - 轨迹对,区分安全 / 危险动作,构建 Action Dreaming 训练验证数据集。
3. 采用 AdamW+LoRA 微调,混合驾驶、VQA、Dream 数据训练,在 CARLA 两大闭环基准完成评测。
1. SimLingo 仅使用相机在 CARLA Leaderboard2.0、Bench2Drive 达成 SOTA 闭环驾驶指标。
2. Action Dreaming 训练可大幅提升模型跟随各类语言指令的成功率,适配分布外指令。
3. 解耦路径 + 速度路点输出方案大幅降低静态物体碰撞,有效改善转向控制缺陷。
时序视觉 Transformer 搭配 VLA 因果对齐模块是自动驾驶主流方案,定制因果分支弥补大模型只看关联、无驾驶因果的缺陷,结合多尺度时序模块提取长短时路况特征,解决推理与轨迹脱节、场景虚假关联、滞后决策三大痛点。
除 ORION、AutoVLA、SimLingo 三篇核心 VLA 论文,我还整理了十余篇同方向顶会文献与复现代码,覆盖仿真、实路、语言控车场景,三套模型均可复现,支持闭环指标对比、推理可视化,后台回复【VLA +自动驾驶】免费领取。