作者 | Xuchang Zhong、He Zheng、Chenxu Zhao、Tianxiong Lv、Hangqi Fan、Bohua Wang、Yushan Liu、Zhihao Liao、Leigang Luo、Congyang Zhao、Yang Cai
机构 | Amap,Alibaba Group;Tsinghua University
论文 | ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
版本 | arXiv:2606.31226v1,2026 年 6 月
关键词 | 自动驾驶 / World Model / Action-Conditioned Video / Unified Diffusion Transformer / NavSim / Visual Odometry / Act-then-Imagine01 这篇论文真正挑战的,不是结构,而是因果顺序
自动驾驶 world model 最近几年一直在把“未来画面”和“未来动作”放到一起学,但大多数方法默认的顺序其实是:先想象未来,再从想象里补动作。
这听上去很自然,问题却很尖锐。因为在自动驾驶里,未来画面生成往往比单步动作预测更难。如果先把更难的那部分做错,后面的 planner 只能在一段已经漂掉的未来里做动作恢复,误差会层层放大。
ForgeDrive 最核心的判断是:自动驾驶里真正该先解的,不是未来画面,而是动作。动作先出来,才能去纠正未来画面;画面再反过来锚定下一步动作。
02 资源与开源状态
- DOI:10.48550/arXiv.2606.31226
- 代码状态:PDF 元数据和正文里只给出了 arXiv / DOI,没有附 GitHub 或项目页链接。
截至 2026-07-05,公开可见资源里暂未看到作者给出的官方代码仓库或 project page。这意味着这篇论文当前更适合先读范式、机制和实验,而不是默认已有完整可复现工程。03 为什么 Imagine-then-Act 在自动驾驶里是个坏默认
如果把推理顺序写成 Imagine -> Act,模型先要把未来场景画出来,再从这段未来里抽动作。这样会遇到两个结构性问题:
- 画面更难。 未来场景生成本身更容易受模糊、漂移和局部幻觉影响。
- 动作恢复更被动。 动作只能在已经生成出的未来之上事后恢复,信息瓶颈很强。
- 误差会级联。 一旦未来画面有偏差,后续动作和下一步画面都会继续在偏差上滚动。

图 1:ForgeDrive 总览。原文图注翻译:左侧展示三种统一能力,右侧比较 GPT-style、cascaded diffusion 和 ForgeDrive 三种范式。ForgeDrive 在步内让动作纠正对应图像生成,在步间让生成图像锚定下一步动作。这张图最值得记住的一点,不是“又一个 unified model”,而是它明确说清楚了 visual generation 和 action generation 在推理时应该谁先给谁提供纠错信号。04 ForgeDrive 怎么做:把未来拆成 frame-action-status 三元组
ForgeDrive 没有把未来一次性整体生成出来,而是把它拆成按时间滚动的 frame-action-status 三元组。每一步都基于最近的历史窗口,输出下一帧图像、下一步动作以及下一步 ego status。
整个框架的核心是一套 Unified Diffusion Transformer(UniDiT):
- pose 和当前 ego status 被编码成额外 token;
- noisy image token 与 noisy action token 在同一个 Transformer 中联合去噪;
- 当前步输出再被喂回历史窗口,继续做下一步 rollout。
图 2:ForgeDrive 架构。原文图注翻译:在每个 autoregressive step 中,历史帧与 pose、当前 ego status 先编码成上下文特征,UniDiT 在 decoupled diffusion timestep 下联合去噪 image / action token,并在一次前向中输出下一帧、下一步动作和 ego state。这里真正聪明的地方在于,它没有把“生成视频”和“生成动作”分给两套先后串联的网络,而是让两种模态从一开始就在同一个 denoising 过程里交换信息。
因此 ForgeDrive 的目标也不只是更好的 planner。它把三项能力绑在一起:driving simulator、driving planner、visual odometry。05 训练关键:Decoupled Timesteps + 三类学习任务
ForgeDrive 的训练设计是这篇论文的另一半灵魂。它没有要求 image token 和 action token 永远在同一个噪声水平上联合学习,而是把两者的 diffusion timestep 解耦,分别独立采样。
这带来三种互补的训练目标:
- Inverse dynamics modeling:图像基本干净、动作很噪,让模型学会从视觉恢复动作。
- Action-conditioned video generation:动作基本干净、图像很噪,让模型学会在动作约束下生成未来画面。
- Joint video-action prediction
图 3:去噪轨迹。原文图注翻译:训练阶段独立变化 image / action timestep,以覆盖更丰富的 cross-modal 生成条件;推理阶段则比较三种不同的模态解析顺序。这套设计的价值不是“多做几个任务”,而是让模型真正获得一种能力:给定任一模态,都能去推断另一模态。 后面的 Act-then-Imagine,正是建立在这点之上。06 关键结论一:动作预测其实已经学会了,未来画面才是瓶颈
论文中最重要、也最反直觉的一句判断,其实不是某个表格里的分数,而是这一条:single-step action prediction 在训练阶段已经基本被学会;真正更难、更需要显式引导的是 future frame generation。
这句话的后果非常大。它意味着推理时没必要坚持“先把未来图像生成清楚,动作才有依据”;相反,更合理的是:
1. 先用当前上下文解出动作;
2. 用动作去约束未来图像;
3. 再让更可靠的未来图像去锚定下一步动作。
这就是论文主张的 Act-then-Imagine。
图 4:这一页同时给出了 Table 3-6 与 Figure 4。关键信息有三条:其一,视频生成 FVD 达到 69.2;其二,解耦 timestep 与 ego-status co-training 都有实打实收益;其三,不同 inference mode 的可视化里,Act-then-Imagine 更不容易把车带出可行驶区域。换句话说,ForgeDrive 的贡献不是一句“视频有助于规划”。它更具体:动作应该先成为未来画面的约束,未来画面再成为下一步动作的上下文。07 关键结论二:不靠 RL,不靠 trajectory scoring,也能把 planning 做到很强
主结果页的含金量很高,因为它把很多常见“加成项”都排除了。ForgeDrive 的 planning 结果来自:
- 单摄像头输入
- 纯监督学习
- 没有 reinforcement learning
- 没有 learned trajectory scoring
即便这样,它在 NavSim 上还是拿到了很强的结果:
- NavSim v1:PDMS 90.2
- NavSim v2:EPDMS 90.3
- 相对 DriveLaW,v1 高 1.1 PDMS
- 相对 DreamAD,v2 高 2.6 EPDMS
- 相对 Latent-WAM、DriveFuture,也分别高 1.0 / 0.4 EPDMS
图 5:NavSim v1 / v2 主结果。原文图注翻译:ForgeDrive 在 state-of-the-art 比较中给出 v1 的 90.2 PDMS 与 v2 的 90.3 EPDMS,并在多项 safety / comfort / progress 指标上保持竞争力。
如果只用一句话概括主结果:ForgeDrive 不是“生成视频顺手带一点 planning”,而是在 world model 框架下,直接把 planning 做成了第一梯队。08 关键结论三:Act-then-Imagine 不是小技巧,而是主增益来源
从推理策略消融看,这个顺序不是风格问题,而是主要增益来源。
在 NAVSIM v2 navhard split 上,三种顺序的 EPDMS 分数分别是:
- Imagine-then-Act:32.4
- Imagine-and-Act:33.9
- Act-then-Imagine:34.8
更重要的是,这个优势在安全相关指标上更明显。补充材料写得很直白:在 Stage 2 上,Act-then-Imagine 在 DAC / TTC / NC 这些指标上更稳,这说明它不只是平均分高,而是更不容易在关键场景里失真。
图 6:补充实验。原文图注翻译:只用 2 个 sampling steps,模型已经有 89.9 EPDMS;4 步最好,达到 90.3;输入分辨率从 256x512 提到 512x1024,EPDMS 从 89.3 升到 89.9;在 navhard split 上,Act-then-Imagine 达到 34.8,明显高于另外两种顺序。这里还有两个很有意思的小结论:
- 2 steps 就已经有 89.9 EPDMS,说明 image-action 分布本身其实已经学得很扎实;
- 4 steps 最好,10 / 20 steps 收益很小,说明这篇论文不是靠“堆更多 denoising steps”取胜;
- 512x1024 比 256x512 更稳,提升主要落在 EP / EC 等更依赖视觉细节的指标上。
这些消融共同支持同一个判断:高质量动作生成并不依赖先得到“干净的未来画面”;相反,未来画面更依赖动作来减少漂移。09 附加能力:视频生成、轨迹恢复、长视频 rollout 终于挂在同一模型上
ForgeDrive 不只是在 planning 上有分数,它还把几项通常分开做的能力合在了一起。
首先是 planning + future prediction 的联合可视化。模型不仅给出 1s 到 4s 的未来画面,还同时输出对应的规划结果。
图 7:未来画面与规划结果可视化。原文图注翻译:在多个场景下,模型既能生成未来图像序列,也能给出相应的规划结果。其次是 action-controlled video generation。给定同样的历史帧,只要把右转轨迹作为控制输入,模型就能生成与右转动作一致的未来视频。
图 8:动作控制视频生成。原文图注翻译:上半部分是 GT 直行视频,下半部分是在相同条件帧下、给定右转轨迹后生成的右转场景视频。最后是额外能力:trajectory recovery 与 long video generation。论文报告 trajectory recovery 的 Mean ADE 只有 0.11 米,ego dynamics MAE 为 [0.43, 0.03, 0.31, 0.21],command accuracy 为 94.7%;同时,模型支持 120-second rollout,远长于一些固定长度视频 world model。
图 9:附加能力。原文图注翻译:上半部分展示 turning scenario 下的 trajectory recovery,下半部分展示 1s 到 90s 的 long video generation。这意味着 ForgeDrive 想做的不是“再加一个辅助任务”,而是把自动驾驶里的多种未来推断能力收束到同一套 latent dynamics 里。10 这篇论文真正值得行业记住的地方
ForgeDrive 的价值,可以压缩成三条:
- 它改变了 world model 里动作和画面的主从关系。
- 它证明了 planning 不一定要站在“先有未来图像”的前提上。
- 它把 simulator / planner / odometry 统一到了同一个生成框架。
但这篇论文也有明确边界:
- 当前主要验证的是单摄像头、NavSim 和补充可视化;
- 论文最后也明确把未来工作指向 multi-sensor input 与 real-world deployment。
11 结论
ForgeDrive 最值得记住的一句话是:自动驾驶 world model 不该默认“先想象未来,再从未来里补动作”,而该反过来思考。
- 动作先解,不是因为动作比画面更重要,而是因为它在当前设置下更容易先学会。
- 未来画面后补,不是退一步,而是让它在动作约束下生成得更稳。
- 真正的闭环是:动作纠正画面,画面锚定下一步动作。
- 这条顺序一旦理顺,planning、simulation 和 odometry 才有机会共用同一套世界模型。
从这个角度看,ForgeDrive 给出的不是一个小优化,而是一种更像自动驾驶本身的信息流:先决定怎么动,再看世界会如何展开;但一旦世界展开,又立刻反过来修正下一步动作。