作者 | Xiaoyu Ye、Leheng Li、Xinyu Ji、Yingjie Cai、Hongda He、Xu Yan、Guanyi Zhao、Ying-Cong Chen、Bingbing Liu、Shuguang Cui、Zhen Li
机构 | CUHK(SZ)、HKUST(GZ)、NTU、Huawei、UNSW
论文 | InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving
版本 | arXiv:2606.31109v1,2026 年 6 月
关键词 | 自动驾驶 / 场景生成 / Occupancy / Video Diffusion / 2D-3D Alignment / Long-horizon Rollout / Waymo / nuScenes01 这篇论文在解决什么
自动驾驶里的场景生成,真正难的不是“生成一小段看起来像车流的视频”,而是把场景连续地延展很长,还不能让几何关系和运动逻辑一路跑偏。
很多方法要么偏向隐式视频自回归,画面好看但会慢慢漂;要么偏向强 prior,比如 BEV 或 HD map,结构稳一些,但 horizon 很短、输入很重。
InfiniVerse 的核心判断是:先构建一个可延展的 3D occupancy 世界,再把这个世界翻译成视频,最后让视频反过来修正 occupancy。
02 资源与开源状态
- DOI:10.48550/arXiv.2606.31109
- 代码状态:PDF 里没有看到官方 GitHub、项目页或数据下载链接,参考文献里也没有给出可直接复现的仓库地址。
因此这篇更适合先读方法和结果,不要默认已有完整开源栈可直接复现。03 核心思路:occupancy 先行,video 负责变得真实
InfiniVerse 把整件事拆成两个大阶段:
- 先从单帧多视角图像重建 occupancy,得到一个明确的 3D 场景骨架。
- 再沿着用户设定的轨迹,把这个 occupancy 当成 sketch,喂给视频扩散模型生成长时序多视角视频。
- 最后把生成的视频再投影回 3D 空间,修正 occupancy,形成闭环。
图 1:驾驶场景生成范式对比。原文图注翻译:隐式视频生成会有几何漂移,显式 prior 方法几何更稳但 horizon 受限;InfiniVerse 通过单帧构建可扩展 occupancy world,并用 reciprocal refinement loop 把视频和几何绑在一起。这张图其实把论文的立场说得很直接:不是在已有视频生成器上“顺手加点几何约束”,而是先让几何成为主角,再让视频去服务几何。
这也是它比普通 video generation 更像 world modeling 的地方。04 先把世界搭起来:Image Guided Voxel Generation
论文先用 XCube 作为初始 scene reconstruction backbone,再通过 DINO-V2 + LSS unprojection,把多视角图像特征投到 dense 3D voxel grid 里。
接着,这个 voxel 表示被压到 triplane latent,再用 diffusion 去生成更完整的 occupancy scene。这个步骤解决的是“从单帧看见的局部,补成可滚动的三维骨架”。
图 2:Voxel-to-video 与 video-to-voxel 细节。原文图注翻译:上半部分先把 occupancy 编成 multiplane images,再用文本和 ref-image 条件驱动视频生成;下半部分则从多视角图像反向重建 occupancy,并把结果写回 triplane,支持 sketch guided scene extrapolate。这里的关键不是“把 voxel 做得更细”,而是让 voxel 成为能被后续视频模型消费的统一中间表征。05 Sketch-and-Refine:长场景是怎么滚起来的
在 coarse stage,模型沿着 trajectory sequence 做 occupancy rollout,生成一个全局布局;在 fine stage,模型再用 sliding window 把每个窗口内的局部细节补回来。
这个设计有点像先画草图,再一笔一笔细化,但它不是纯视觉草图,而是 3D occupancy 草图。
图 3:Waymo 上的长时序生成结果。原文图注翻译:从上到下展示 T+5、T+15、T+25 的生成帧;语义行来自 MPI 编码后的 occupancy 场景,底部是 GT 帧。这张图最有说服力的点,不是某一帧很惊艳,而是连续三段未来帧仍然保持了比较稳定的结构和运动方向。
06 视频生成不是独立模块,而是 occupancy 的翻译器
InfiniVerse 的视频生成模块用的是 CogVideoX1.5-5B,并通过 LoRA 做微调。
它把 occupancy 对应的 camera frustum 编成 multi-plane image(MPI),再用 ControlNet-style injection 把几何条件注入到 latent video UNet 的对应层里。这样,视频不是“随便生成”,而是被 occupancy 拉着走。
图 4:多模态输出一致性。原文图注翻译:nuScenes 上,模型生成的 RGB、semantic、depth、occupancy 和 LiDAR 与 GT RGB 对齐,展示了 2D-3D coupled generation paradigm 的效果。这篇论文最值得记住的,不是某个单独视频看起来逼真,而是它能同时保持 RGB、语义、深度、occupancy 和 LiDAR 的一致性。07 数据怎么来的
论文的数据不是随便拿公开视频喂进去,而是做了比较完整的 curating:
- Waymo Open Dataset 上保留 618 条训练序列和 130 条评估序列。
- 通过 ground-truth LiDAR 和 occupancy 约束,保留更适合长时序生成的样本。
- 视频 caption 先用 InternVL2-40B-AWQ 生成,再用 Meta-Llama-3-8B-Instruct 润色。
- 再用 VideoCLIP-XL 过滤掉对不齐的视频-文本对。
训练成本也不轻。论文给出的实现细节是 occupancy branch 训练约100 GPU days,video generation component 训练约64 GPU days,单 chunk 推理分别约2 分钟 和2.5 分钟。08 sketch control 具体长什么样
用户不仅能让场景“往前走”,还可以给出左转、直行、右转这种 sketch 约束,让 occupancy scene 沿指定布局延展。
图 5:Sketch-guided voxel generation。原文图注翻译:根据对应 sketch 生成左转、直行和右转的长程 occupancy 场景。这点很适合自动驾驶语境,因为很多测试场景真正想控制的不是美术风格,而是道路几何和轨迹走向。
09 结果:单帧起步,仍然能拿到很强的数值
论文在 nuScenes validation 上报告了 FID 6.40、FVD 67.97。
表 1:主结果对比。原文图注翻译:与先前方法相比,InfiniVerse 只用单帧输入就能生成对齐的长视频,并在 nuScenes validation 上取得新的 SOTA FID。表里一个值得注意的点是,很多方法依赖 BEV map、HD map 或 Box+FoV 之类更强的输入,而 InfiniVerse 只用 image 就起步,但仍能输出 voxel + LiDAR 对齐的长场景。

10 消融:到底是谁在起作用
论文的消融非常清楚。单看 3D branch 或纯 I2V 都不够,真正把质量拉上去的是 reciprocal loop 和 region-aware loss。
表 2:结构消融。原文图注翻译:3D branch、2D-3D reciprocal loop 和 region-aware loss 都在持续提升结果;FID / FVD 随着组件叠加明显下降。从数值上看,47.89 / 320.6 这样的纯 reference image 结果,靠加入 3D branch 可以降到19.12 / 142.12;再加 reciprocal loop 可以到7.98 / 80.87;最后加 region loss 到6.40 / 67.97。
这说明这套系统不是“某一个大模型比较强”,而是每一层都在给时序和几何一致性补位。
再看 rollout 长度,InfiniVerse 在 12 / 24 / 36 / 48 / 96 帧上分别是52.1 / 59.8 / 67.5 / 73.9 / 86.5,而 Vista 是78.4 / 86.2 / 94.7 / 105.9 / 141.3。差距说明它的长时序退化更慢。
图 6:FID/FVD 随 rollout 变长的变化。原文图注翻译:InfiniVerse 的退化趋势显著慢于 Vista。这张曲线图的意思很直白。不是只在短视频里赢,而是滚到更长时,模型仍然更不容易崩。11 这篇论文真正强的地方
- 它把 occupancy 放在了生成管线的正中心,而不是当附属约束。
- 它不是只生成更像真的视频,而是生成 2D-3D 对齐的多模态世界。
- 它通过 reciprocal refinement 让视频和几何互相纠偏,而不是各干各的。
- 它把 long-horizon generation 的问题说清楚了:不是“能不能画”,而是“能不能持续不散、不漂、不失真”。
但它也有现实边界。训练成本高,单 chunk 推理不算轻;目前流程更像一套高质量研究原型,还不是轻量实时系统。12 局限与边界
- 算力不低。 occupancy branch 和 video branch 都需要比较大的训练预算。
- 推理还不算轻。 单 chunk 需要分钟级推理时间,不是实时在线生成。
- 依赖 curated 数据。 这套方法对数据清洗、caption 质量和 occupancy 对齐要求都很高。
- 代码链接未公开。 目前 PDF 没有直接给出官方仓库或可下载数据入口。
- 更适合研究原型。 这篇论文已经证明方向可行,但距离“车上实时跑起来”还有工程距离。
13 结论
InfiniVerse 最值得记住的一句话是:长场景生成不该先问“视频怎么补”,而该先问“世界骨架怎么长”。
- occupancy 是可延展场景的骨架,video 是把骨架渲染成现实的翻译器。
- reciprocal refinement loop 是这套方法避免漂移和幻觉的关键。
- 单帧输入并不妨碍长时序生成,前提是中间表征真的足够强。
- 对自动驾驶来说,最有价值的不是一段好看的视频,而是一个可控、可对齐、可延展的驾驶世界。
从这个角度看,InfiniVerse 做的不是普通视频生成,而是在给自动驾驶世界模型补一条更像“物理骨架”的主线。