作者 | Junzhe Jiang、Zipei Ma、Zijie Pan、Li Zhang
机构 | 复旦大学数据科学学院、Shanghai Innovation Institute
论文 | DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation
版本 | arXiv:2606.31918v2,2026 年 7 月 2 日
关键词 | 自动驾驶仿真 / 场景编辑 / 车辆插入 / Video Inpainting / Point Cloud Condition / Long-term Generation / 3D Gaussian Splatting01 这篇论文真正想解决什么
在自动驾驶仿真里,很多危险场景并不是“重新回放已经录到的数据”就能得到,而是需要把一辆车按指定轨迹插进真实场景里,再观察规划和控制系统会如何反应。
这个需求听起来很自然,做起来却一直不顺。最常见的路线,是先准备一大库 3D 车辆资产,再把它们按轨迹摆进背景场景里;另一类路线走得更重,依赖高质量 mesh、inverse rendering 和逐场景优化。
DriveWeaver 的核心判断是:与其继续堆更大的 3D 资产库,不如把车辆点云直接变成视频修补模型的像素级几何条件,让基础视频模型自己把车辆“补”进真实场景里。
02 资源与开源状态
- GitHub / 项目代码:https://github.com/LogosRoboticsGroup/DriveWeaver
- DOI:10.48550/arXiv.2606.31918
这篇论文首页已经直接给出 GitHub 链接,所以它不是单纯停留在概念展示,而是明确把“可控车辆插入”当成一个可复现的系统方向来推进。03 为什么旧路线很难规模化
过去的车辆插入方案主要有两条路。
- 预重建 3D 资产路线:先把车辆做成可渲染资产,再和背景组合。问题是光照、阴影和材质风格很难完全贴住原始场景,资产库维护成本也高。
- mesh + inverse rendering 路线:几何更强,但要靠高质量 CAD mesh 和逐场景优化,成本太高,不适合大规模闭环仿真。
图 1:通过 DriveWeaver 进行可控高保真车辆插入。原文图注翻译:点云条件视频修补框架支持 (a) 多样化车辆插入选项,(b) 在复杂天气与光照条件下与背景无缝融合,(c) 使用来自不同来源的点云进行灵活插入。图 1 把这篇论文的目标说得很直接:它要的不是“一个能插车的小技巧”,而是一种可控、跨场景、跨点云来源的编辑能力。
这篇论文的真正站位,不是继续优化重建质量,而是把自动驾驶仿真从“忠实复现已录制世界”推进到“可控编辑真实世界”。04 核心结构:把点云变成像素级几何条件
DriveWeaver 建立在冻结的 Wan2.1 VACE-14B 视频生成 backbone 上,但它没有直接全量改 backbone,而是插入一个专门吃点云条件的 PointAdapter。
更关键的是,输入条件不是抽象的 3D token,而是渲染到图像平面的点云条件图和对应 mask:
- 先根据车辆点云和预定义轨迹,渲染得到 point cloud condition maps;
- 再把这些条件图与 reactive mask、point mask 一起送进 PointAdapter;
- PointAdapter 通过残差方式把几何引导注入冻结的 Wan-DiT 主干;
图 2:DriveWeaver 总体管线。原文图注翻译:给定输入驾驶视频、车辆点云和目标轨迹,DriveWeaver 生成一段已完成车辆插入的真实场景视频;其使用冻结的视频扩散 backbone,并通过可训练的 PointAdapter 将点云几何与空间引导注入主分支。插入车辆还可进一步蒸馏为 3D 表示,用于自动驾驶仿真的实时渲染。这里最值得记住的一点是,论文没有把点云当成“语义提示词”,而是把它当成像素级几何约束。这会比单纯的 mask 或 reference image 更硬、更可控,也更容易跨数据集泛化。05 长时序怎么不漂:global-to-local hierarchical inpainting
如果只是按自回归方式一段接一段地生成,插进去的车辆很容易在长时序里出现身份漂移、形状变形和光照不一致。
DriveWeaver 的解决思路,是把长视频生成拆成两步:
- Global anchoring stage:先对长序列做时间下采样,用一个全局前向过程先把整段轨迹上的车辆身份、几何和光照锚住;
- Local interpolation stage:再把原始高帧率时间轴切成多个局部片段,用 anchor frames 作为密集引导做局部细化。
图 3:长时序生成。原文图注翻译:为避免自回归方法常见的误差累积和语义漂移,DriveWeaver 将生成分为两阶段:(a) 全局锚定阶段,对时间下采样后的稀疏序列做一次全局前向,建立贯穿整条轨迹的一致车辆身份与光照;(b) 局部插值阶段,用这些稀疏 anchor frame 作为密集引导生成局部高帧率片段。训练中分别采用 GT-Free 与 GT-Aware 两种模式,对应全局锚定和局部插值。论文里对长时序的具体落地也很清楚:先把 193 帧 序列按步长 4 抽成 49 帧 anchor 序列,再切成 4 段做局部高帧率补全。这个设计比标准 sliding window 更像“先定全局身份,再补局部细节”。06 为什么它还能落到实时仿真:从视频蒸馏回 3DGS
如果只停留在视频生成,这项工作仍然只是一个高质量离线编辑器,因为 diffusion 推理本身太慢,不适合在线闭环仿真。
DriveWeaver 的下一步很关键:它把已经生成好的前景车辆视频,再交给 OmniRe 这类城市重建管线,蒸馏成显式 3D Gaussian 表示。这样一来:
- 在线仿真阶段直接用 3DGS 光栅化渲染,不必再跑慢速 diffusion。
这一步把“生成看起来真实的车”变成了“可以被仿真系统实时调用的车”,也就是把离线生成工具真正接到了在线仿真链路里。实现细节里给出的成本也很有参考价值。49 帧 480p 视频在单张 H200 上生成大约 2 分钟;193 帧序列做标准蒸馏约 1.5 小时 / 单张 RTX 4090。但如果冻结背景,只优化插入前景车辆,单实例蒸馏可以压到 10 分钟。07 Waymo 结果:视觉 realism 明显领先
Waymo 上的对比结果很强,尤其是在 visual realism 指标上。
图 4:Waymo 数据集上的定性对比。原文图注翻译:Waymo 上 DriveWeaver 与各类基线的插入效果对比。
表 1:Waymo 上与现有方法的对比。原文图注翻译:在 Waymo 上比较各方法的短期与长期 visual realism 及 geometric consistency,最佳和次优结果以颜色标出。论文报告的几个关键数值很值得单拎出来看:
- Waymo 短序列:DriveWeaver 达到
FID 15.50 / FVD 80.17 / LPIPS 0.157。 - Waymo 长序列:DriveWeaver 达到
FID 17.50 / FVD 22.46 / LPIPS 0.159。 - Waymo 长序列几何一致性:
PSNR 32.23 / SSIM 0.931。
这组结果的含义不是“它在每一项几何指标上都碾压所有方法”。更准确的说法是:它在真实感上明显领先,同时几何一致性没有为了追求真实感而彻底掉队。HUGSIM 这种显式 mesh 路线几何更硬,但在风格和环境融合上明显更弱。08 PandaSet 与跨数据集泛化:不是只会在一个 benchmark 上好看
DriveWeaver 另一个值得注意的点,是它在 PandaSet 上仍然保持相同趋势。
图 5:PandaSet 数据集上的定性对比。原文图注翻译:PandaSet 上 DriveWeaver 与各类基线的插入效果对比。
表 2:PandaSet 上与现有方法的对比。原文图注翻译:在 PandaSet 上比较各方法的 visual realism 与 geometric consistency,最佳和次优结果以颜色标出。在 PandaSet 上,DriveWeaver 的结果是:
FID 21.54FVD 146.15LPIPS 0.182PSNR 31.34SSIM 0.927
这说明论文的关键收益并不依赖 Waymo 的单一数据分布。点云条件 + 视频修补这条路线,确实比“只靠 mask 补车”更有跨数据集的稳定性。09 消融:真正起作用的是哪三件事
论文的消融也很干净,没有故弄玄虚。
图 6 与表 3:架构消融。原文图注翻译:分别移除 PointAdapter、点云渲染条件和 global-to-local hierarchical 策略后,都会在 Waymo 长时序设定下拉低 visual realism 或几何一致性。最重要的三条结论是:
- 没有 PointAdapter 不行。 直接全量微调 Wan backbone,会把
FVD 从 22.46 拉高到 62.59,说明会出现明显的 catastrophic forgetting。 - 没有点云渲染条件不行。 如果把致密渲染点云换成 naive 2D 投影,
FVD 会从 22.46 变成 28.53,高频纹理和结构细节都会变差。 - 没有 global-to-local 不行。 退回普通自回归后,
FVD 会涨到 29.41,长时序里车辆外观和形状更容易漂。
换句话说,这篇论文不是“恰好某个大视频模型比较强”。它的性能是由三层设计一起撑起来的:点云条件表达、adapter 注入方式、全局到局部的长时序生成策略。10 这篇论文真正改变了什么
DriveWeaver 真正推进的,不只是“插车效果更真实”。
- 它用点云条件替代大规模人工资产库,使车辆插入更有扩展性。
- 它证明了视频 foundation model 不只是做漂亮视频,也可以被改造成场景编辑器。
- 它把离线视频生成和在线 3DGS 仿真接到了一起,让这项工作更接近真实仿真系统,而不是单纯 demo。
这篇论文最值得记住的一句话是:自动驾驶仿真未来不只是“复现世界”,而是“在真实世界里可靠地编辑新事件”。11 局限与边界
- 扩散推理仍然慢。 即使最终能蒸馏成 3DGS,前面的高质量生成仍然是离线过程。
- 几何一致性还不是绝对最强。
- 依赖输入点云质量。 虽然点云比 3D 资产便宜,但条件质量仍会影响最终插入稳定性。
- 长时序依然需要分层设计。 这本身也说明当前 video backbone 还不能轻松无漂地一步生成超长视频。
因此,DriveWeaver 更像一条非常有前景的“仿真编辑基础设施”路线,而不是已经可以无成本替代所有传统资产编辑管线的终局方案。12 结论
DriveWeaver 的贡献可以压缩成四句话:
- 点云不是辅助信息,而是视频修补模型的主几何条件。
- 长时序一致性不能只靠自回归滚动,必须先锚定全局身份,再补局部高帧率细节。
- 只把车插进视频还不够,真正重要的是还能蒸馏回 3DGS,服务实时仿真。
- 这让自动驾驶仿真第一次更像“场景编辑系统”,而不只是“场景重放系统”。
从这个角度看,DriveWeaver 的意义并不只在于一篇视频生成论文,而在于它给自动驾驶仿真提供了一种更像未来基础设施的场景扩充方式。