关注我,帮你了解自动驾驶最新动态!

自动驾驶大模型现在很会“解释”:它能描述路口、车辆、行人,也能给出一段看似合理的推理链。
但开车不是语文题。真正要紧的是,模型的注意力有没有落到会影响轨迹的地方:前车、车道线、行人、路口转向区域,而不是散在天空、楼面或无关背景上。
DriveTeach-VLA 这篇 ECCV 2026 论文抓住的就是这个问题:自动驾驶 VLA 不是只要会说,还要被教会“该看什么、往哪里看”。
团队 论文作者来自北京航空航天大学、清华大学 AIR、滴滴、中国传媒大学等机构
论文arXiv:2607.01658,Teaching Vision-Language-Action Models What to See and Where to Look
状态 论文页面标注已被 ECCV 2026 接收
代码GitHub 项目为 ShivaTeam/DriveTeach-VLA,采用 Qwen2.5-VL-3B 作为基础模型
问题不在会不会说,而在看没看对地方

论文指出,很多自动驾驶 VLA 的训练仍然偏向文字中心:先用 VQA 注入交通知识,再用 CoT 解释和专家轨迹做监督。
这会带来一个隐蔽问题:模型学会了说“前方有车”“需要减速”,但视觉表示未必真正绑定到会影响轨迹的空间区域。
论文里的注意力图很直观。普通 Qwen2.5-VL SFT 基线的热力分布更分散,而 DriveTeach-VLA 更容易盯住前车、车道、行人和转向相关位置。
它先让模型知道未来轨迹该落在图像哪里

DriveTeach-VLA 的核心概念叫 2D Trajectory-Guided Prompt,简称 2D-TGP。
简单说,它不是只让模型输出 BEV 坐标里的未来轨迹,而是先把专家轨迹投影回前视图像,用一串图像坐标告诉模型:如果要这样开,应该重点看哪些区域。
这一步很适合 VLA,因为多模态大模型本来就擅长处理图像里的坐标、框和指代。把轨迹投回图像,相当于把驾驶规划问题变成一个更接近视觉 grounding 的问题。
论文里的关键公式,其实是一次坐标转换
公式部分可以压缩成一个问题:怎样把 BEV 世界坐标里的专家轨迹,变成前视图像里的可见提示?

这里 C 是相机图像,S 是车辆状态,L 是语言指令,P_I 是图像平面上的 2D-TGP 提示。第一行负责把轨迹点投到图像里,第二行表示 Planner 在图像、状态、语言和 2D-TGP 条件下预测未来 BEV 轨迹。
这不是为了把问题复杂化,而是为了让模型在生成轨迹前,先获得一个空间锚点:未来车要往哪里走,图像里的哪些区域就更值得看。
两步训练:先教该看什么,再教该看哪里

第一步是 DVD,也就是 Driving-aware Vision Distillation。研究者用 Grounding DINO 标出车、行人、交通灯、车道相关物体,再让学生视觉编码器从原图里学到这些交通关键区域。
这一步回答“该看什么”:不是让模型平均理解整张图,而是把视觉表征往驾驶相关目标上拉。
第二步是 TGP-guided learning。TGP-Prompter 先生成 2D-TGP,TGP-Planner 再在这个提示下输出未来 4 秒轨迹。随后还用 GRPO 做强化优化,让轨迹更符合驾驶偏好。

结果:NAVSIM 上 PDMS 达到 90.4

在 NAVSIM 的 Navtest 上,DriveTeach-VLA 报告 PDMS 为 90.4。对比同样基于 Qwen2.5-VL-3B 的 AutoVLA,论文表中 AutoVLA 为 89.1;CuriousVLA 为 88.9。
在 nuScenes 开放环评估上,DriveTeach-VLA 的 3 秒 L2 误差为 0.30 m,碰撞率为 0.12%。这些数字说明,空间引导并不是只让解释更好看,而是确实反映到轨迹预测上。

消融也支持这个判断。基础 Qwen2.5-VL-3B Planner 的 PDMS 为 84.8;常规 VQA 加 CoT 后为 86.4;引入 DVD 和 2D-TGP 后继续提升;最终加入 GRPO 达到 90.4。
适用边界:仍需真实道路闭环验证
这篇工作的边界也很清楚。DriveTeach-VLA 是在 NAVSIM 和 nuScenes 这类基准上验证,仍然不等同于真实道路闭环部署。
双模型结构也增加了推理链路:先由 Prompter 生成 2D-TGP,再由 Planner 规划轨迹。论文报告 L20 GPU 上单样本推理约 3.18 秒,虽然快于 AutoVLA 文本航点版本,但离车端实时部署仍有距离。

为什么这篇值得关注
自动驾驶 VLA 的一个趋势,是把“会解释”推进到“会行动”。但行动不是语言能力自然长出来的,它需要和空间、车辆状态、未来轨迹绑定。
DriveTeach-VLA 的价值在于,它把这个绑定做得很具体:用检测框教模型看交通关键目标,用 2D-TGP 教模型把未来轨迹落回图像,再让 Planner 在这个空间提示下生成轨迹。
这也给后续自动驾驶大模型一个很实用的启发:不要只问模型为什么这么开,还要检查它开车前到底在看哪里。
如果自动驾驶大模型要真正上车,你觉得更重要的是让它解释得更清楚,还是让它的注意力更可验证?
如果你想持续看机器人、具身智能和自动驾驶论文的可读版拆解,可以关注本号。
▍往期精选