原创 StudyAI.com —中国最佳AI社区
端到端自动驾驶(End-to-End Autonomous Driving, E2E-AD)在 2026 年完成了一次范式确认:行业争论的重心,已从"感知精度还能提多少"全面转向"驾驶基础模型怎么建、世界模型怎么训、闭环仿真怎么跑、车端算力怎么省"。
CVPR、ICLR、ICML、AAAI、ICRA、WACV 等顶会在 2026 年集中涌现出一批真问题、真方法、真数据的论文,它们不再满足于把传感器像素映射成一条轨迹,而是开始追问:模型学到的是因果还是相关?世界模型该做"辅助代理"还是"决策主引擎"?大模型推理能否真正落到方向盘上?
本文聚焦 2026 年已正式录用的顶会论文,按六条主线拆解端到端自动驾驶的年度最强进展,并在文末给出横向对比表与趋势研判。
阅读提示
在展开正文前,先用三个问题框定这次年度盘点视角:
1世界模型是"辅助代理"还是"决策主引擎"?过去世界模型多为可选项,2026 年多篇工作把它推到了规划链路的中心。
2冻结编码器与主动学习,能否破解端到端的数据效率与泛化瓶颈?标注贵、长尾难,是 Scaling 的两座大山。
3VLA 大模型能否把"可解释推理"真正落地到毫秒级轨迹规划?语言、视觉、动作三者统一后,延迟与可靠性仍是硬约束。
带着这三个问题读下去,会发现 2026 年的答案出奇一致:让模型"想未来",比"记历史"更重要。
一、因果去混杂:让端到端学会"真因果"而非"捷径"
端到端模型本质是在拟合 P(Y|S),学到的是统计相关而非因果。nuScenes 中约 75% 为直行场景,模型容易把"直行是默认行为"当成真理,在转向等少数场景崩溃;更隐蔽的是,模型会把自车历史速度/加速度当作预测未来的"捷径",开环评测好看,闭环一旦偏离专家轨迹就灾难性失败。
CausalVAD:用后门调整给端到端"去混杂"
作者:详见原文;详见原文
发表:CVPR-2026
核心贡献:将 Pearl 后门调整理论参数化为即插即用模块 SCIS,在 VAD 架构的感知、预测、规划三阶段做多级因果干预,用可学习原型字典近似隐混杂因子 Z,切断虚假关联路径,提升安全与鲁棒性。
这条线说明:2026 年的端到端不再只追求指标,而是开始用因果工具解决"捷径学习"这一安全根因。
二、世界模型跃升为规划主引擎
2026 年最清晰的主线,是世界模型从"辅助代理任务"升级为"规划主引擎"。五篇代表性工作从残差建模、视频-规划统一、前瞻决策、VLA 融合、想象-规划闭环五个角度切入。
ResWorld:时序残差世界模型,只建模动态物体
作者:张晋卿;北航
发表:ICLR-2026
开源:github.com/mengtan00/ResWorld
核心贡献:把相邻帧 BEV 特征对齐后做差得到"时序残差",自然分离出动态物体,让世界模型只预测动态部分的未来分布(无需检测/跟踪),再用未来引导轨迹优化(FGTR)模块修正轨迹,在 nuScenes、NAVSIM 达 SOTA 规划性能。
DriveLaW:把视频生成与运动规划统一进一个潜空间
作者:夏天泽;华中科技大学
发表:CVPR-2026
核心贡献:提出 DriveLaW-Video(强世界模型,生成高保真未来帧潜表示)与 DriveLaW-Act(扩散规划器,直接消费视频生成器的潜表示),用三阶段渐进训练让"高保真未来生成"与"可靠轨迹规划"天然一致;视频预测 FID 较此前最佳提升 33.3%、FVD 提升 1.8%,并刷新 NAVSIM 规划纪录。
ForeSight(See Tomorrow, Act Today):让"想未来"成为决策主驱动
作者:张博洲;帝国理工学院, 复旦大学
发表:CVPR Findings-2026
核心贡献:指出当前规划器本质是反应性的,只基于历史与当下预测动作。ForeSight 把世界模型从辅助组件变为决策主驱动,先生成 plausible 未来视觉世界,再基于想象中的未来做规划,实现 anticipatory 而非 reactive 的决策,在 NAVSIM、nuScenes 显著超越此前 SOTA。
VLA-World:给 VLA 装上"可反思的世界模型"
作者:王国庆;上海交通大学
发表:CVPR Findings-2026
核心贡献:VLA 模型缺显式时序动态与全局世界一致性,世界模型又不会"评估"自己生成的未来。VLA-World 用动作派生轨迹引导下一帧图像生成,再对自生成的未来帧做反思推理以精炼轨迹,并构建 nuScenes-GR-20K 生成推理数据集,三阶段训练(预训练+SFT+RL),在规划与未来生成基准上同时超越 VLA 与世界模型基线。
ImagiDrive:想象-规划统一闭环
作者:李静宇;复旦大学, 帝国理工学院
发表:ICRA-2026
核心贡献:把 VLM 驾驶智能体(可解释、动作预测稳)与 DWM 场景想象器(生成逼真未来场景)统一成一个想象-规划循环:智能体先出初轨迹,引导想象器生成对应未来场景,再迭代精修决策;引入早停机制与轨迹选择策略兼顾效率,在 nuScenes、NAVSIM 开环与闭环均优于此前方法。
世界模型的 2026 共识:不再"预测未来当副业",而是把未来想象直接变成轨迹优化的监督信号与决策前提。
三、生成式 / 扩散轨迹规划:多模态与实时的平衡
驾驶行为天然多模态(同场景可有多种合理走法),扩散模型能自然捕捉这种多模态,但传统扩散依赖无结构高斯噪声或固定锚点初始化,去噪步数多、难实时。
DiffRefiner:粗到精的混合范式
作者:尹留寒;浙江大学, 纽劢科技
发表:AAAI-2026
开源:github.com/nullmax-vision/DiffRefiner
核心贡献:先用判别式 Proposal Decoder 在聚类轨迹锚点上回归出"粗轨迹提案"作强引导,再用扩散精化器迭代去噪;设计细粒度语义交互模块 FGSIM(全局交叉注意力+局部可变形注意力+自适应门控)让轨迹贴合可行驶区与动态参与者。NAVSIM v2 达 87.4 EPDMS(V2-99 骨干),Bench2Drive 达 87.1 DS / 71.4 SR,均创纪录;得益于高质量先验,单步去噪即可接近最优。
ProDrive:ego-environment 协同进化的主动式规划
作者:付楚尧;详见原文
发表:CVPR Workshop-2026
核心贡献:联合训练 query-centric 轨迹规划器与 BEV 世界模型,规划器生成多样候选轨迹与 planning-aware ego tokens,世界模型据此预测未来场景演化;把规划器特征注入世界模型并并行评估所有候选,保留端到端梯度流,让"未来结果评估"直接塑造规划,在 NAVSIM v1 安全与效率上超越强基线。
生成式规划的 2026 关键词:先验引导 + 单步/少步去噪。用判别式给生成式铺路,既保多模态又保实时。
四、VLA 大模型驾驶:视觉-语言-动作统一
把语言指令、视觉理解、动作生成统一进一个大模型,是 2026 年端到端中最受资本与产业追捧的方向。两条代表路线分别强调"大模型的动作接地"与"导航理解的被忽视价值"。
OpenDriveVLA:面向驾驶的大视觉-语言-动作模型
作者:周星成;慕尼黑工业大学
发表:AAAI-2026
开源:github.com/DriveVLA/OpenDriveVLA
核心贡献:基于开源 LLM 构建 VLA,输入含 2D/3D 实例感知视觉表征、自车状态与语言指令,提出分层视觉-语言对齐把 2D/3D 结构化视觉 token 投影到统一语义空间,并在自回归解码中融入结构化"智能体-环境-自车"交互建模;nuScenes 上开环轨迹规划与驾驶问答双 SOTA,支持 0.5B–10B 灵活部署、推理 15+ FPS。
SNG-VLA:导航理解的"意外有效性"
作者:华志华;复旦大学, 清华大学, 中科院自动化所
发表:ICRA-2026
核心贡献:发现许多端到端系统过度依赖局部场景理解、忽视全局导航信息,规划能力与导航输入弱相关。提出 Sequential Navigation Guidance(SNG)框架,用导航路径约束长时轨迹、用 turn-by-turn 信息做实时决策,构建 SNG-QA 数据集对齐全局与局部规划,模型 SNG-VLA 无需感知辅助损失即达 SOTA。
VLA 的 2026 现实:推理能力有,动作落地难。OpenDriveVLA 证明预训练 VLA 经语义提示即可达有竞争力的多任务场景理解,但动作级任务(决策、轨迹规划)仍必须微调;延迟与可靠性是上车前最后一道关。
五、数据效率与泛化:冻编码器与主动学习
端到端 Scaling 的两座大山是标注成本与长尾泛化。两条路线不约而同地"少改模型、多改数据/表征"。
FROST-Drive:冻结 VLM 视觉编码器做端到端
作者:董泽宇;详见原文
发表:WACV Workshop-2026
核心贡献:挑战"必须微调驾驶数据集上的视觉编码器"这一惯例,冻结来自 VLM 的预训练视觉编码器,直接把其泛化世界知识迁移到驾驶任务;冻结编码器 + Transformer adapter 多模态融合 + GRU 航点解码,并设计直接优化 Rater Feedback Score(RFS)的自定义损失。在 Waymo Open E2E(长尾场景数据集)上显著优于全微调模型。
ActiveAD:规划导向的主动学习
作者:详见原文;上海交通大学
发表:CVPR-2026
开源:github.com/Thinklab-SJTU/ActiveAD
核心贡献:用几乎免费的元信息(天气/光照/驾驶指令/车速)做多样性冷启动初始化,再用位移误差、软碰撞、Agent 不确定性三个免标注准则挑出最该标的场景;只标 30% 数据即在 nuScenes 开环与 CARLA 闭环追平 100% 数据训练的 SOTA。结论干脆:更多数据不必然更好,关键是"标得准"。
数据效率的 2026 共识:与其无差别全量标注,不如用规划目标反向指导"该标什么";与其全微调编码器,不如保住预训练大模型的泛化底盘。
六、指令条件与长尾覆盖:让轨迹"听得懂人话"
最后一条线关注"交互式、指令条件"的轨迹生成,把高层语言指令变成可执行、安全对齐的轨迹,是 L2/L3 向 L4 演进中人机共驾的关键接口。
iMotion-LLM:指令条件的轨迹生成
作者:Abdulwahab Felemban;阿卜杜拉国王科技大学
发表:WACV-2026
核心贡献:把 LLM 与轨迹预测模块集成,基于文本指令生成可行、安全对齐的轨迹,实现自适应、上下文感知的驾驶行为;相比传统方法,能按"左转/让行/超车"等指令产出符合场景约束的轨迹,为"自然语言即控制器"提供端到端验证。
指令条件规划补全了端到端的人机接口拼图:模型不再只输出"它认为该走的路",而能响应"人希望它怎么走"。
趋势研判
1世界模型中心化不可逆:从 ResWorld 的残差建模到 DriveLaW 的视频-规划统一,再到 ForeSight 的"想未来再行动",世界模型已从可选项变为规划主引擎,未来将与规划器共享同一套潜空间。
2因果与闭环是安全双支柱:CausalVAD 用后门调整去混杂,ActiveAD 与各闭环基准(Bench2Drive、NAVSIM)把 open-loop gap 摆上台面,2026 年的评估范式正从开环 L2 误差转向闭环安全率。
3生成式规划走向"少步实时":DiffRefiner、ProDrive 证明"判别式先验 + 少步扩散"是兼顾多模态与实时的最优折中,将成为量产端到端的主流骨架。
4VLA 上车卡在延迟与动作微调:OpenDriveVLA、SNG-VLA 验证了大模型驾驶的可行性,但动作级任务必须微调、推理延迟需压进车端预算,2026 年仍是"原型惊艳、量产谨慎"。
2026 已发布顶会端到端自动驾驶论文速查表
| 方法 | 发表 | 主线 | 作者 | 单位 | 开源 |
|---|
| CausalVAD | CVPR-2026 | 因果去混杂 | 详见原文 | 详见原文 | — |
| ResWorld | ICLR-2026 | 世界模型 | 张晋卿 | 北航 | github.com/mengtan00/ResWorld |
| DriveLaW | CVPR-2026 | 世界模型 | 夏天泽 | 华中科技大学 | — |
| ForeSight | CVPR Findings-2026 | 世界模型 | 张博洲 | 帝国理工学院, 复旦大学 | — |
| VLA-World | CVPR Findings-2026 | 世界模型/VLA | 王国庆 | 上海交通大学 | — |
| ImagiDrive | ICRA-2026 | 世界模型 | 李静宇 | 复旦大学, 帝国理工学院 | — |
| DiffRefiner | AAAI-2026 | 扩散规划 | 尹留寒 | 浙江大学, 纽劢科技 | github.com/nullmax-vision/DiffRefiner |
| ProDrive | CVPR Workshop-2026 | 扩散/主动规划 | 付楚尧 | 详见原文 | — |
| OpenDriveVLA | AAAI-2026 | VLA | 周星成 | 慕尼黑工业大学 | github.com/DriveVLA/OpenDriveVLA |
| SNG-VLA | ICRA-2026 | VLA/导航 | 华志华 | 复旦大学, 清华大学, 中科院自动化所 | — |
| FROST-Drive | WACV Workshop-2026 | 数据效率 | 董泽宇 | 详见原文 | — |
| ActiveAD | CVPR-2026 | 数据效率 | 详见原文 | 上海交通大学 | github.com/Thinklab-SJTU/ActiveAD |
| iMotion-LLM | WACV-2026 | 指令条件 | Abdulwahab Felemban | 阿卜杜拉国王科技大学 | — |
标注说明:未能从公开来源确认的一作或单位,统一标注"详见原文",避免虚构;开源仅列已确认公开仓库,未开源或无法确认的不再单列。
原创 StudyAI.com —中国最佳AI社区