【总结】 清华大学AIR团队等联合提出Adaptive-WAM,一种基于视频扩散模型中间特征的质量引导早退自动驾驶规划器,解决了世界-动作模型(WAM)部署时必须执行完整未来视频生成所带来的巨额计算开销。
研究发现,视频去噪噪声水平对规划质量影响极小,而中间层DiT特征已具备强大的轨迹解码能力。Adaptive-WAM基于Wan2.2-5B架构,在6个中间层挂载轨迹扩散头,并引入轻量级DINOv2轨迹质量评分器。一旦中间生成的轨迹达到质量阈值即触发动态早退,完全跳过后续视频去噪与VAE解码。
实验表明,模型在NAVSIM v1上取得90.8 PDMS(64提案变体达92.6 PDMS),NAVSIM v2上达89.9 EPDMS,创下前视视频世界模型规划器新纪录。在A100上平均端到端延迟仅为170 ms,相比全深度规划器降低47%!
单位:清华大学智能产业研究院(AIR)、中国科学技术大学、北京航空航天大学
【简介】 将大型视频扩散模型作为时空先验引入端到端自动驾驶已成为近年来的研究热点,但现有的世界-动作模型在部署时往往需要完整生成未来的多帧视频,带来了极其高昂的计算延迟。然而在真实驾驶场景中,车辆决策仅需要一条精确的自车动作轨迹,这引出一个关键问题:做出可靠的驾驶决策究竟需要执行多少视频扩散计算?
研究团队通过对视频去噪时间步与DiT网络深度的对照实验发现,规划性能对视频噪声水平并不敏感,且中间层DiT特征已经包含了足够丰富的轨迹信息。基于这一发现,团队提出了Adaptive-WAM——一种基于Wan2.2-TI2V-5B大底座的质量引导多出口世界-动作模型。该架构在6个选定的DiT中间块上挂载独立的轨迹扩散头,并结合轻量化DINOv2-Small轨迹质量评估器。在推理过程中,模型逐层解码轨迹并实时预测规划质量,一旦当前轨迹满足预设阈值即立刻早退并输出决策,跳过了后续冗余的视频去噪循环、无条件分类器自由引导(CFG)分支以及VAE解码过程。
在NAVSIM基准测试中,Adaptive-WAM取得了同类前视视频世界模型规划器中的最佳成绩,且零样本迁移至nuScenes数据集时展现出优异的泛化性。在A100显卡上,该质量引导早退机制将平均端到端规划延迟压低至170毫秒,比固定深度的完整网络降低了47%,为大生成式世界模型在实时自动驾驶中的高效部署开辟了新路径。
关键词:#自动驾驶世界模型 #早退规划机制 #视频扩散模型 #端到端自动驾驶 #轨迹质量评估 #零样本迁移
《Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features》

