关注我,帮你了解自动驾驶最新动态!

自动驾驶大模型,要先预判世界。
路口左转时,自动驾驶系统真正需要判断的,不只是当前画面里有哪些车,而是这些车接下来会怎么动。
如果模型只在看到风险后被动刹车,它仍然像一个反应式驾驶员;如果它能预判对向车、旁车和自车之间的博弈,才更接近主动驾驶。
WCog-VLA 把这个问题拆成两层:一层负责看懂道路世界,一层负责生成未来多车交互轨迹。论文在 NAVSIM 上报告 PDMS 92.9,核心主张是让端到端驾驶大模型不只会回答和规划,还能提前构造世界演化。
团队与论文信息
论文 WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
团队 同济大学与南洋理工大学合作完成;Jia Hu、Binyang Song 为通讯作者
状态 arXiv:2607.08375,2026-07-09 提交;论文正文采用 ECCV 2026 模板
▍痛点不是“会不会看”,而是“能不能提前想”
端到端自动驾驶 VLA 很容易落入一个陷阱:模型能读图、能解释场景,也能输出轨迹,但它对其他交通参与者的未来行为缺少连续、可操作的表示。
论文把现有问题概括为两类。一类是缺少全面世界认知,模型看到了物体,却没有足够的 3D 空间和动态 token;另一类是世界预测被拆得太碎,感知、推理和轨迹生成之间对不齐,最终仍然偏反应式驾驶。
因此,WCog-VLA 的设计要求很直接:既要知道当前世界里有什么,也要生成未来世界会怎样变化,还要把这种预判反馈到自车规划。

WCog-VLA 用生成式世界认知预测其他车辆未来轨迹,再决定自车动作。
▍第一层:让 VLA 真的拥有道路世界认知
语义层做的是“看懂现在”。模型引入 3D 空间感知,并注入 agent tokens 来表示道路中不同交通参与者的动态状态。
这一步的重要性在于,自动驾驶不是静态图像问答。车辆、行人、车道和地图元素都在一个共享空间里相互影响。没有明确的空间与对象表示,后续推理很容易只停留在语言描述上。
论文还构建了 85k Game-CoT 标注,让模型用博弈式链式思维去解释交通互动:谁该让行,谁可能加速,当前自车轨迹会不会制造冲突。

语义层同时预测 3D 目标和未来轨迹,帮助模型理解当前世界状态。
▍第二层:把未来轨迹生成出来
生成层的核心是 ADDT,也就是 Aligned Decoupled Diffusion Transformer。
它不是让大语言模型逐字生成一段很慢的推理文本,而是把语义层的世界表示转成多智能体联合轨迹。换句话说,模型要同时想象自车和周围车未来会怎么走。
论文中特别强调推理速度:5 步 ADDT 推理约 0.106 秒,而直接用 VLM 文本方式推理要慢得多。对于驾驶系统来说,预判不能只准确,还必须足够快。

整体框架把 VLM 推理、3D 感知和 ADDT 生成式世界模型接在一起。
▍结果看哪里:PDMS 92.9,以及四阶段叠加的增益
在 NAVSIM v1 上,WCog-VLA 报告 PDMS 92.9;在 NAVSIM v2 上,EPDMS 为 85.9。论文还给出训练阶段的增益:从基础框架到加入语义认知、生成式世界认知和 GRPO,整体分数逐步上升。
这组结果的可读点不在“又多一个 VLA 排名”,而在它说明世界模型不是装饰。3D 感知、Game-CoT 和 ADDT 共同把模型从单帧理解推向多车交互预测。

关键数字显示,WCog-VLA 的提升主要来自世界认知和生成式未来预测。
▍值得谨慎看待的地方
论文目前主要在 NAVSIM 基准上验证。它能说明模型在闭环规划指标上的优势,但距离真实道路部署仍有距离。
另一个边界是语义世界认知目前更聚焦 agent,对道路几何和地图拓扑未来演化的建模还不完整。论文结论中也把这一点列为未来方向。
▍为什么这篇值得分享
自动驾驶大模型的热度越来越高,但真正有共识的问题并不是“能不能让模型开车”,而是如何让模型在长尾交互里更可靠地理解未来。
WCog-VLA 给了一个清晰方向:让 VLA 不只输出自车轨迹,而是先建立道路世界、预测多车互动,再把预判交给规划。这个思路对自动驾驶、仿真测试和世界模型研究都有参考价值。
读者问题:你觉得自动驾驶大模型最该优先补强的能力,是 3D 感知、长尾场景推理,还是多车未来预测?
如果你想持续看自动驾驶、机器人和具身智能论文的可读版拆解,可以关注本号。
往期精选
1. 自动驾驶大模型会说还不够:DriveTeach-VLA 教它先看对地方