
近来,World-Action Model(WAM)通过联合建模未来视觉观测与动作,为端到端自动驾驶引入更显式的时序动态监督。本文提出 SimWAM,一个简单而有效的自动驾驶 WAM 基线。不同于将未来场景预测持续置于推理链路,SimWAM 将 future-video prediction 主要作为训练阶段的动态监督,通过 video-action co-training 将预训练视频生成模型中的交通动态先验迁移至 Action Expert,使其在推理阶段无需显式预测未来帧即可直接生成轨迹。在此基础上,SimWAM 进一步引入强化学习优化轨迹策略。通过将确定性的 flow ODE 转化为支持随机探索的 SDE,并结合 GRPO 根据组合驾驶奖励直接优化 Action Expert,模型在专家轨迹模仿之外进一步提升整体驾驶质量。最终,SimWAM 在 NAVSIM navtest 上取得 91.5 PDMS,以简洁的设计实现了动态先验学习、直接轨迹规划与强化策略优化的统一。
图 1:SimWAM 与现有WAM的时延-性能对比。
论文标题:SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
论文地址:https://arxiv.org/abs/2608.07468
代码地址:https://github.com/H-EmbodVis/SimWAM
模型权重:https://huggingface.co/H-EmbodVis/SimWAM
背景与动机
World-Action Model 的关键在于利用未来视觉预测学习交通场景的时序动态,并进一步服务于动作生成。现有自动驾驶 WAM 多采用 imagine-then-act 范式:模型先预测未来场景或未来视觉表示,再以其作为轨迹规划的条件。虽然这种方式能够显式建模场景演化,但也使轨迹生成依赖测试时的未来场景建模,将计算开销较高的视频预测引入实时规划链路。
SimWAM 将未来视频预测主要作为训练阶段的动态监督。通过 video-action co-training,Video Expert 提供车辆运动、交通交互和场景演化等动态先验,Action Expert 在联合训练中吸收这些信息,并在推理时基于当前观测与导航指令直接生成轨迹,无需显式预测未来帧。由此,视频生成模型的动态建模能力能够用于提升轨迹预测,而不必将未来视频生成保留在推理阶段。
不过,video-action co-training 后的 Action Expert 仍然主要依赖专家轨迹进行模仿学习,其优化目标受限于示范轨迹本身,难以直接针对整体驾驶质量进行策略调整。为此,SimWAM 进一步将确定性的 flow ODE 转化为具有随机探索能力的 SDE,并结合 GRPO 对 Action Expert 进行强化学习,使模型能够在多种候选轨迹之间进行探索,并依据驾驶奖励直接优化轨迹策略。因此,视频联合训练负责增强 Action Expert 对交通动态的建模,而强化学习进一步将这种动态能力转化为更优的驾驶策略。
方法
图 2:SimWAM 整体架构。训练阶段联合优化 Video Expert 与 Action Expert;推理与强化学习阶段直接优化并使用 Action Expert 进行轨迹生成。2.1 Video-Action Co-training:将视频动态先验转化为规划能力
SimWAM 由预训练 Video Expert 与轻量级 Action Expert 组成,并通过 joint flow matching 同时优化未来视频预测与轨迹生成。Video Expert 初始化自 Wan2.2-5B;Action Expert 采用独立的轻量化的 Diffusion Transformer。两个 Expert 保留各自的参数与结构,并在统一的交互接口中进行联合训练。
训练阶段,Video Expert 根据当前观测学习未来 4 秒驾驶场景的演化,Action Expert 同时预测未来 4 秒的自车轨迹。未来视频预测要求模型学习车辆运动、交通交互与场景演化等时序规律,并通过 video-action co-training 将这些交通动态先验传递给 Action Expert,从而增强其轨迹建模能力。这里的关键并不是让轨迹预测依赖生成后的未来帧,而是借助 future-video prediction 的训练信号,使 Action Expert 在联合学习过程中获得更充分的动态建模能力。
因此,在推理阶段,Action Expert 可以直接基于当前视觉观测、ego state 与导航指令预测轨迹,无需显式预测未来帧。这样,未来视频预测主要承担训练阶段的动态学习,而测试阶段则由 Action Expert 直接完成轨迹生成。
2.2 强化学习:从动态建模走向策略优化
Video-action co-training 主要解决动态先验如何迁移到 Action Expert 的问题,但轨迹学习本身仍以专家轨迹监督为主。模仿学习能够复现示范行为,却难以直接针对规划质量进行优化。为此,SimWAM 在联合训练之后进一步对 Action Expert 进行强化学习,使轨迹策略能够根据驾驶奖励进行直接调整。
具体而言,原始 flow matching 采用确定性的 probability-flow ODE 进行采样,不利于在同一场景下形成具有差异性的候选轨迹,同时也缺少策略优化所需的可计算转移 likelihood。SimWAM 将该过程转换为保持边缘分布的 SDE,在生成过程中引入结构化随机性,并为每个场景采样一组候选轨迹。随后,模型依据 NAVSIM 的组合驾驶奖励计算组内相对优势,并通过 GRPO 更新策略。
2.3 直接轨迹推理与模型可扩展性
SimWAM 的 Video Expert 与 Action Expert 不共享参数,二者的模型规模与结构可以相对独立地调整。Video Expert 可直接替换为更先进或具有更丰富驾驶域先验的视频生成模型,为联合训练提供更高质量的动态监督;Action Expert 则可根据推理开销与计算预算灵活调整模型容量,而无需同步改变 Video Expert。
这种相对独立的结构为模型提供了两个互补的扩展维度:Video Expert 的能力影响训练阶段所引入动态先验的质量,而 Action Expert 的规模主要影响轨迹规划能力与推理成本。因此,SimWAM 可以持续利用视频生成模型的发展增强动态建模,同时根据具体计算预算独立配置 Action Expert,实现规划性能与推理效率之间的灵活权衡。
实验结果
3.1 NAVSIM 主结果:91.5 PDMS 与较低推理开销
在 NAVSIM navtest 上,SimWAM 取得 91.5 PDMS,达到当前端到端规划方法中的最佳结果。其中,相比 VLM-based planner SGDrive 提升 0.4 PDMS,相比显式引入未来图像预测的 ExploreVLA 提升 1.1 PDMS;在相同单摄像头设置下,SimWAM 还分别超过现有的Image-then-act范式的DriveLaW 和 DriveWAM 2.4 和 1.4 PDMS。在 world-model-based planners 中,SimWAM 同时取得最高的 DAC 和 EP,并在 NC 与 TTC 上保持具有竞争力的表现。值得注意的是,SimWAM 在推理阶段无需显式预测未来帧,却仍获得了更优的规划性能。结合图 1 中显著更低的推理时延,这表明训练阶段的未来视频建模能够有效增强 Action Expert 对交通动态的规划能力,而无需将未来场景生成引入推理过程,从而在规划性能与推理效率之间取得更优的平衡。
表 2:NAVSIM navtest 上与现有端到端规划方法的性能比较。3.2 Video co-training 与强化学习的互补性
训练阶段消融实验清晰验证了 SimWAM 的两阶段训练作用。仅使用 Action Expert 时,模型取得 86.6 PDMS;加入 Video Expert 进行联合训练后,PDMS 显著提升至 90.3,同时 NC、DAC、EP 和 TTC 均得到提升。这说明未来视频预测提供的交通动态监督能够有效改善 Action Expert 对场景演化的建模,而其收益并非局限于单一规划指标。进一步引入强化学习后,PDMS 提升至 91.5,其中 DAC 和 EP 分别达到 98.7 和 86.4。因此,这组实验表明,video co-training 能够有效将交通动态先验引入 Action Expert,而强化学习则进一步在该表征基础上优化整体规划性能。两阶段训练具有明显的互补性,使 PDMS 相比 Action-only 基线累计提升 4.9 个百分点,同时保持无需显式未来帧预测的直接轨迹生成。
表 2:训练阶段消融实验3.3 强化学习探索方式消融
为分析强化学习中的探索机制,论文比较了随机噪声与 SDE 两种采样方式。随机扰动虽然能够增加轨迹多样性并提高前进效率,但同时损害了安全相关指标;相比之下,SDE 在保持原始 flow 边缘分布的同时引入随机探索,使候选轨迹具有多样性且保持较好的可行性,最终取得更高的 91.5 PDMS。这表明,强化学习的关键并非简单增加轨迹随机性,而是构造与生成过程一致、且具有可计算 likelihood 的结构化探索机制,从而为 GRPO 提供更可靠的策略优化基础。
表 3:不同强化学习探索方式的比较。3.4 Video Expert 与 Action Expert 的独立扩展
SimWAM 在不改变 Action Expert 与轨迹学习目标的情况下,可直接替换不同的 Video Expert。Wan2.1-1.3B、Wan2.2-5B 分别取得 90.2 和 90.3 PDMS,而在驾驶视频上预训练的 Cosmos-Predict2.5 进一步达到 90.4 PDMS,并取得更优的 EP 和 TTC。结果一方面说明 SimWAM 不依赖特定的视频生成模型,另一方面也表明 Video Expert 所提供动态先验的质量会直接影响规划性能。更重要的是,SimWAM 为 Video Expert 与 Action Expert 提供了相互独立的扩展空间:前者可以随着视频生成模型的发展持续增强训练阶段的动态先验,后者则可根据部署预算灵活调整规模。
表 4:不同 Video Expert 的性能比较。3.5 Zero-shot 跨数据集泛化
为进一步验证从视频生成模型学到的动作先验是否具有跨数据集迁移能力,本文将仅在 NAVSIM 上训练的 SimWAM 直接测试于 nuScenes,如表5所示。SimWAM 取得 0.04% 的平均碰撞率,在表中 zero-shot 方法中最低,同时保持 0.96 m 的平均 L2 误差。值得注意的是,L2 更强调与目标数据集专家轨迹的几何一致性,而碰撞率更直接反映模型对交通交互和安全边界的建模能力。因此,在存在明显数据分布差异的情况下仍保持较低碰撞率,说明 SimWAM 通过 world-to-action 联合训练获得的交通动态先验具有一定的跨数据集可迁移性,而并非仅依赖对 NAVSIM 轨迹分布的拟合。
表 5:nuScenes 上的 zero-shot 泛化实验。3.6 可视化结果
下图展示了SimWAM在NAVSIM的测试场景中的可视化结果。经过强化学习后,Action Expert 在交叉路口和狭窄道路等场景中能够更充分地沿目标方向推进,同时保持在可行驶区域内并与周围车辆保持安全距离。这说明强化学习进一步改善了直接轨迹策略的整体驾驶质量。
图3:Ours-IL 与 Ours-RL 的定性比较。RL 后的轨迹在保持可行驶性的同时表现出更充分的目标方向推进。总结
SimWAM 旨在构建一个简单而有效的自动驾驶 WAM 基线。其主要思路是将 future-video prediction 作为训练阶段的动态监督,通过 video-action co-training 将视频生成模型中的交通动态先验迁移至 Action Expert,使其在推理阶段无需显式预测未来帧即可直接生成轨迹。在此基础上,SimWAM 进一步引入强化学习,将确定性的 flow ODE 转化为支持随机探索和策略优化的 SDE,并结合 GRPO 根据驾驶奖励直接优化 Action Expert,使轨迹学习在专家示范之外进一步面向整体驾驶质量进行策略调整。
整体而言,SimWAM 以简洁的方式串联了动态先验学习、直接轨迹生成与强化策略优化:未来视频预测负责提供交通动态监督,Action Expert 将所学动态能力用于轨迹规划,强化学习则进一步优化其驾驶策略。这样的设计在保持 WAM 简洁性的同时,兼顾规划性能、推理效率与模型扩展性,为探索视频生成模型的动态先验如何服务于端到端自动驾驶,建立了一个简单、有效且具有良好扩展性的基线框架。
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向