
4D 占用网格预测(4D Occupancy Forecasting)是近年来伴随生成式 AI 与世界模型发展而迅速兴起的自动驾驶前沿任务。它在 3D 稠密语义体素网格(描述场景几何占用与语义标签)的基础上拓展至时间维度,旨在通过历史观测状态预测未来 3D 场景随时间的时空演化。由于其能够兼顾精细几何与语义演变,为现代自动驾驶中的长周期轨迹规划、长尾极端场景仿真以及高质量数据合成提供了不可或缺的基础支撑。
然而,现有主流方法普遍依赖“离散 Token 化 + 自回归生成”的范式,极易导致静态几何结构漂移变形、跨时间戳全局空间上下文缺失以及生成误差单向累积。针对这些瓶颈,来自华南理工大学与中国科学院光电技术研究所的研究团队提出了一种几何感知时空上下文建模框架(Geometry-Aware Spatio-Temporal context modeling, GAST)。
GAST 摒弃了复杂的两阶段“先分词后生成”模式,直接在连续的鸟瞰图(Bird's-Eye-View, BEV)表征空间中进行端到端建模。该方法通过渐进式显式-隐式生成结合自车位姿几何先验构造保真的逐帧特征,并借助双路径时空建模并行捕捉全局空间结构与时序演化规律。在 Occ3D-nuScenes 基准测试中,GAST 在预测精度上取得 47.40% mIoU 与 56.24% IoU,相较此前最佳模型提升了 7.67% mIoU 和 6.44% IoU,同时模型参数量压缩至仅 12.09M,在单张 RTX 3090 GPU 上的推理时延缩减至 80.03 ms(提速达 2.84 倍)。

- 论文标题: Geometry-Aware Spatio-Temporal Context Modeling for 4D Occupancy Forecasting
- 论文地址: https://arxiv.org/abs/2608.15279
- 代码仓库: https://github.com/chenst27/GAST
背景与动机:离散 Token 化自回归范式的局限
近年来,受生成式大模型发展的启发,以 OccWorld、I²-World、RenderWorld 为代表的自回归占用世界模型逐渐成为 4D 占用预测的主流技术路线。这类方法通常采用两阶段流程:首先利用 VQ-VAE 将 3D 语义占用体素网格压缩为离散 Token,随后借助 Transformer 进行自回归序列生成,最后再将预测的 Token 还原为占用网格。
范式对比:(a) 现有的两阶段离散 Token 化自回归预测范式;(b) GAST 提出的连续 BEV 空间端到端建模范式。然而,这种两阶段离散生成范式在实际落地中暴露出三项显著制约:
- 缺乏显式几何刚性约束:静态背景(如路面、路沿、建筑物)在物理世界中主要随自车运动发生刚性变换。离散自回归模型缺乏显式的几何位姿变换机制,在多步长时预测时极易产生几何形变与位置漂移。
- 全局空间上下文割裂:自回归模型的单向因果生成机制主要关注前后序列递推,难以在统一的全局世界坐标系下协同感知多时间戳的跨区域长程依赖,从而削弱了时空一致性。
- 两阶段训练与误差累积:离散分词器的表征能力直接决定了后续生成模型的性能上限;同时,步进式的 Token 生成易造成误差的单向累积。
为了克服这些局限,GAST 提出将 4D 占用预测统一在连续 BEV 空间中,利用几何刚性先验指导生成,并通过全局坐标对齐与时序循环提取实现端到端优化。
方法详解:显隐结合生成与双路径时空建模
GAST 系统的整体架构由四个主要部分构成:占用编码器(Occupancy Encoder)、渐进式显式-隐式生成模块(Progressive Explicit-Implicit Generation, PEIG)、双路径时空建模模块(Dual-Path Spatio-Temporal Modeling, DPSTM)以及占用解码器(Occupancy Decoder)。
GAST 整体架构概览1. 占用编码器与位姿预测
系统输入包含历史 帧的 3D 占用栅格 (其中 )与对应的自车位姿 (由平移向量 与单位四元数 构成)。编码器首先将 3D 空间占用压缩为紧凑的 BEV 特征 。
为了消除对外部真值轨迹的依赖,模型通过轻量位姿编码器将历史相邻帧间的平移增量 和旋转增量 编码为自车运动 Token,并借助交叉注意力机制与 BEV 特征融合,预测未来 帧的相对运动参数 ,积分后得到未来绝对位姿序列 。
2. 渐进式显式-隐式生成 (PEIG)
为了解决静态物体的漂移和动态物体的语义演化,PEIG 模块采用“刚性投影构建骨架、隐式调制注入动态、注意力细化修补细节”的三步策略生成逐帧未来表征:
- 显式几何变换(Explicit Geometric Transformation, EGT):利用自车位姿构建坐标系间的相对刚性变换 ,对当前时刻 BEV 特征 执行可微网格采样(Grid Sampling),直接获得未来帧的几何变换特征:该操作无需学习参数,直接在物理层面锁定了静态背景的几何一致性。
- 隐式特征调制(Implicit Feature Modulation, IFM):针对非刚性动态变化,利用 MLP 将未来相对位姿变化量映射为通道级的缩放参数 与偏置参数 ,对特征进行自适应仿射变换:
- 特征细化(Feature Refinement, FR):为了进一步融合当前观测中的细粒度线索,模块引入可变形交叉注意力(Deformable Cross-Attention, DCA)。以调制特征 为 Query,将未来 BEV 网格中心映射回当前坐标系作为 2D 参考点,在当前 BEV 特征 上自适应采样关键线索:
3. 双路径时空建模 (DPSTM)
获得逐帧初显特征后,DPSTM 采用双路径并行架构强化全局时空一致性:
- 全局空间上下文聚合(Global Spatial Context Aggregation, GSCA):将历史序列 与未来细化特征 统一转换到固定的全局世界坐标系下,生成对齐序列 。随后将其投影到 3 个分辨率层级(),利用卷积模块自粗至精逐级上采样融合多尺度上下文,最后通过逆变换网格采样回各时刻的自车 BEV 空间,输出全局几何特征 。
- 时序动力学提取(Temporal Dynamics Extraction, TDE):将历史与未来特征按时间维度拼接为时空序列,送入轻量级 ConvGRU 沿时序因果递推演化,提取时序动力学特征 。
两条路径的输出在各时间戳进行通道拼接并经卷积融合:,辅以可变形自注意力机制增强帧内语义。
4. 占用解码与联合优化
解码器将历史 BEV 特征与预测未来 BEV 特征拼接构成统一的时空体,通过双线性插值与残差卷积块恢复原始分辨率,联合输出历史重建与未来预测的 4D 占用网格 。整个框架采用端到端方式训练,联合优化占用分类损失(加权交叉熵与 Lovász-Softmax 损失)与位姿回归损失(平移 L2 损失与四元数角度损失)。
实验与结果分析
实验在自动驾驶常用基准 Occ3D-nuScenes 上展开评测(输入 2 秒历史数据 ,预测未来 3 秒 ),并在 Occ3D-Waymo 上进行了零样本迁移验证。
1. 4D 占用预测精度表现
在 Occ3D-nuScenes 验证集上,无论输入源为 3D 占用真值还是原始相机环视图像,GAST 均展现出明确的性能优势。
Occ3D-nuScenes 验证集上的 4D 占用预测性能对比(Table 1)- 3D 占用输入 + 真值轨迹:GAST 取得了 47.40% 的平均 mIoU 与 56.24% 的平均 IoU,相较此前的代表性工作 -World(39.73% mIoU / 49.80% IoU)分别提升了 7.67% 和 6.44%;相较扩散类世界模型 COME(34.23% mIoU)与 DOME(27.10% mIoU)优势更加明显。
- 3D 占用输入 + 预测轨迹:在依赖自车位姿在线预测的实际应用场景下,GAST 依然取得 27.38% mIoU 与 35.90% IoU,显著超越同类方法。
- 相机环视图像输入:配合 STCOcc 骨干时,GAST 在真值轨迹设定下达到 20.16% mIoU 与 29.87% IoU,在预测轨迹下达到 14.84% mIoU 与 23.87% IoU,均保持领先。
2. 八秒长周期预测稳定性
在将预测时间跨度从 3 秒扩展至 8 秒的测试中,GAST 展示了出色的抗漂移能力。
Occ3D-nuScenes 验证集上的 8 秒长时 4D 占用预测表现(Table 2)在整个 1 至 8 秒的时间范围内,GAST 取得了 24.12% 的全域平均 mIoU 与 39.06% 的全域平均 IoU,即便在第 8 秒依然保持 15.96% mIoU,显著优于 COME(全域平均 19.07% mIoU)和 DOME(全域平均 15.83% mIoU)。
3. 计算开销与推理时延
得益于端到端连续 BEV 空间建模,GAST 避免了复杂的自回归采样迭代与大参数量扩散网络设计,在运行效率上表现突出。
Occ3D-nuScenes 验证集上的模型效率与复杂度对比(Table 4)在单张 GeForce RTX 3090 上,GAST 的参数量仅为 12.09M,计算量为 416.27 GFLOPs,单次推理耗时仅为 80.03 ms。相比于 -World(227.09 ms)实现了 2.84 倍的提速,相比基于扩散模型的 COME(4377.67 ms)提速超过 54 倍。
4. 零样本跨数据集迁移与定性效果
在未进行任何微调的前提下,将 nuScenes 上训练的模型直接应用于 Occ3D-Waymo 验证集:在 10 Hz 采样率下,GAST 取得了 57.47% mIoU,大幅超越 -World 的 43.73%;在 2 Hz 采样率下依然取得 46.70% mIoU,展现了良好的泛化能力。
Occ3D-Waymo 零样本迁移结果(Table 3)
Occ3D-nuScenes 上的可视化对比结果(Figure 3)从可视化结果中可以看出,面对复杂的街景动态变化,GAST 能在 3 秒预测范围内清晰保持路面平整度与建筑物边缘,同时精准捕捉前景运动车辆的位置变迁。
写在最后
GAST 重新审视了 4D 占用预测中的表征范式,通过在连续 BEV 空间内将显式刚性投影与隐式特征学习有机融合,摆脱了离散分词带来的表征上限与误差累积问题。对于自动驾驶感知与预测领域而言,GAST 证明了紧凑的时空连续表征不仅可以大幅降低计算延时与显存消耗,还能有效保持远期预测中的几何保真度,为车载端侧实时部署 4D 世界模型提供了一条具备实用价值的演进路径。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向