✨导读:世界模型规划通常要先生成未来视频,再从想象画面里推轨迹,效果强但推理慢。SimWAM 反过来把视频世界模型只当训练老师:训练时让动作专家和视频专家一起学未来动态,推理时丢掉庞大的视频分支,只保留轻量动作 DiT,并用 RL 进一步优化驾驶奖励。在 NAVSIM navtest 上,SimWAM 取得 91.5 PDMS,并在 nuScenes 上保持零样本泛化。
• 作者: Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai
• 单位: Huazhong University of Science & Technology; Dongfeng Research & Development Institute
• 论文标题: SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
• 论文链接: https://arxiv.org/abs/2608.07468v1
• 发表信息: arXiv 2026
• 代码链接: https://github.com/H-EmbodVis/SimWAM/
🔍 行业背景:自动驾驶需要世界模型,但不能每次都昂贵地“想象未来”
端到端自动驾驶正在把感知、预测、规划压进一个模型里。这条路线的吸引力很强:模型直接从相机输入输出未来轨迹,省掉复杂手工模块。但真正难的是让模型理解动态世界。只做 imitation learning,模型容易学到数据里的平均行为;引入视频生成式世界模型,又常常需要在推理阶段生成未来帧,延迟和算力都会上去。
SimWAM 的判断很直接:视频世界模型最有价值的地方,不一定是推理时真的把未来画出来,而是在训练时提供一个强大的动态先验。换句话说,未来视频可以教会动作模型“世界会怎么变”,但部署时未必要把这位老师一起带上车。
图注:原文 Figure 1。该图展示 SimWAM 在 NAVSIM 上同时取得更高 PDMS 和更低推理延迟。相比需要在测试时生成未来视频的 WAM planner,SimWAM 把视频生成能力留在训练阶段,因此推理更轻。
💥 三大核心亮点:训练时学世界,推理时只行动
1.Training-only Video Prior。SimWAM 把预训练视频模型作为训练分支,让它预测未来帧,同时让动作专家预测未来轨迹;两个分支共享同一段未来动态监督。
2.Isolated Attention Mask。动作 token 不能访问未来视频 token,避免模型在训练时偷看未来画面;这样视频分支被丢弃后,动作专家仍能独立规划。
3.Reward-driven Refinement。在 imitation learning 之后,SimWAM 用强化学习优化组合驾驶奖励,进一步提升安全、舒适和进度指标。
图注:原文 Figure 2。该图给出 SimWAM 框架:视频 DiT 与动作 DiT 通过 Mixture-of-Transformers 共同训练,视频专家学习未来帧,动作专家学习轨迹;注意力掩码保证动作分支只依赖当前观测,推理时仅保留动作 DiT。
🧠 方法拆解:不是让动作模型看未来,而是让它从视频专家旁边学
SimWAM 的关键是把世界建模变成一种训练信号。论文使用预训练视频专家预测未来 8 帧,并同时训练轻量动作专家预测未来 4 秒、2Hz 的 8 个 waypoint。动作专家本质上是一个较小的 DiT,默认 hidden size 为 1024;视频专家则初始化自 Wan2.2-5B,并保留其 VAE 与 T5 文本编码器能力。
训练时,两个专家在同一个 flow matching 目标下协同学习。视频分支负责吸收丰富的视觉动态,动作分支则学习把当前前视相机画面转成可执行轨迹。论文特别强调 isolated attention mask:动作 token 只能看当前观测和自身 token,不能访问未来帧 token。这样一来,动作专家获得的是被视频任务塑造出来的动态表示,而不是对未来图像的直接依赖。
RL 阶段只更新动作专家里的 LoRA adapter。论文使用 rank 32、alpha 16 的 LoRA,采样每个场景 8 条轨迹,并重点训练 imitation 阶段表现较差的 hard scenes。这使模型不只是复制专家轨迹,而是直接朝 PDMS 相关的驾驶质量优化。
📊 硬核实测:NAVSIM 达到 91.5 PDMS,训练视频分支带来 3.7 分增益
实验设置方面,SimWAM 主要在 NAVSIM 上验证。训练集为 navtrain 103,288 个场景,测试集为 navtest 12,146 个场景;输入默认只用单个前视摄像头,分辨率为 384×672。训练使用 AdamW、余弦学习率、初始学习率 1e-4,共 100 epochs。RL 阶段学习率为 5e-5。论文报告所有延迟在单张 NVIDIA A100 GPU 上测量;batch size、精度和完整推理服务框架论文未明确给出。
表注:原文 Table 1。NAVSIM navtest 主结果显示,SimWAM 取得 91.5 PDMS,在只用前视相机的设置下超过 SGDrive、ExploreVLA、DriveWAM、DriveLaW 等方法。论文特别强调,相比 imagine-then-act 式 WAM planner,SimWAM 延迟更低,因为推理阶段不再生成未来视频。
消融实验清楚说明视频分支的作用:动作专家单独训练时 PDMS 为 86.6;加入视频监督后提升到 90.3;再加入 RL 后达到 91.5。也就是说,未来视频不是最终输出,却实实在在改变了动作模型对动态世界的建模能力。
模型还做了多组结构实验。attention mask 方面,isolated mask 的 PDMS 为 90.3,bidirectional 为 90.2,action-to-video 为 90.1,说明动作分支不需要偷看未来视频也能学到有效先验。视频 backbone 方面,Cosmos-Predict2.5、Wan2.1-1.3B、Wan2.2-5B 等都能带来稳定提升,说明方法不完全依赖单一视频模型。
表注:原文 Table 6。nuScenes 零样本实验显示,SimWAM 不做 fine-tuning、只用前视相机时,平均 L2 误差为 0.96m,平均碰撞率为 0.04%。这说明训练期视频先验不只是在 NAVSIM 上过拟合,也能迁移到不同数据分布。
效率细节同样值得看。默认 10 个 sampling steps 时,SimWAM PDMS 为 90.3,延迟约 518ms;5 steps 仍有 90.1 PDMS,延迟降到约 297ms。分辨率从 384×672 提到 768×1344,PDMS 只从 90.3 提到 90.6,但延迟增加到约 573ms,说明默认配置已经比较接近性价比点。
🧐 深度解析:这篇论文真正处理的是“世界模型能力如何落到实时规划”
SimWAM 最有意思的地方,是把生成式世界模型从在线模块变成训练约束。过去很多自动驾驶世界模型强调“想象未来”,但只要未来视频生成在推理链路中,实时性就会被视频分支拖住。SimWAM 证明了另一条路线:让视频模型在训练时塑造动作模型,部署时只留下行动分支。
这对 VLA、机器人和自动驾驶都有启发。很多场景里,大模型或生成模型的能力不一定要完整保留在在线推理图里。它们可以作为训练过程中的 dense teacher,帮助小模型获得更好的世界理解,再通过结构约束保证小模型脱离老师后仍能独立工作。
当然,SimWAM 目前主要基于前视相机和 NAVSIM 评估。真实自动驾驶还涉及多摄像头、激光雷达、地图、交通规则和极端长尾场景。论文的贡献更像是证明:如果设计得当,世界模型不必总是昂贵的在线想象器,也可以成为一种训练期的动态先验。
✅ 全文总结:世界模型可以只在训练时“上车”
SimWAM 给端到端自动驾驶一个很干净的方案:训练时借助视频世界模型学习未来动态,推理时只保留轻量动作模型直接输出轨迹。它避免了测试时生成未来帧的高延迟,同时在 NAVSIM 和 nuScenes 上保持强表现。
对实时驾驶系统来说,这种思路比单纯追求更大的视频生成模型更实用。关键不只是模型能不能想象未来,而是这种想象能不能被压缩成一个快速、稳定、可部署的动作策略。