T26: 自动驾驶BEV多模态空间融合:Temporal BEV→Fusion BEV
上一篇《从BEVFormer到Temporal BEV》讨论了BEV如何从单帧空间表示演化为时空一致表示。通过历史信息融合,Temporal BEV实现了:
Spatial(空间) BEV → Spatio-temporal(时空)BEV
缓解了遮挡、远距离目标以及信息缺失问题。但无论是LSS、BEVDet、BEVFormer还是Temporal BEV,主要信息来源仍然是Camera,感知能力仍然受限于单一传感器。Camera最大的优势是语义丰富、成本低、部署方便;但Camera天然存在物理限制,深度依赖估计、光照敏感、雨雾敏感、遮挡敏感等。于是BEV开始进入下一阶段:
Spatio-temporal(时空) BEV → Fusion (融合) BEV
1. BEV Fusion与传统Fusion的区别
Camera、LiDAR、Radar三种传感器拥有完全不同的数据形式,融合困难
Camera → Image LiDAR → Point Cloud Radar → Sparse Point
传感器融合主要发生在原始数据、特征或检测结果层面,可以在不同的层面将信息统一到同一个空间,进行融合。
过去信息融合:Raw Data(原生数据)、Feature(特征)、Decision(决策) 前融合 中融合 后融合
Camera Feature + LiDAR Feature + Radar Feature → 坐标对齐(Ego Frame)→ Fusion
从几何意义上,多模态融合已经统一在同一个空间坐标系了,但仍然保持各自的数据表示形式
Camera → BEV LiDAR → BEV Radar → BEV
Fusion BEV核心思想是将Camera(语义)、LiDAR(几何)、Radar(速度与恶劣天气)在BEV空间融合成Unified BEV特征,获得语义+几何+运动综合信息。
Fusion BEV中所有传感器首先转换到统一BEV坐标系,再完成融合。因此目标、车道、道路结构、自由空间等都能够在同一个空间框架下表达。
BEV Fusion首次将不同传感器统一映射到同一种空间表示(BEV),融合对象从“数据、特征或结果”演化为“统一世界表示”。不仅坐标统一,表示形式也统一了。不同传感器首次能够在统一BEV空间中进行信息交互。
Image → BEV → BEV Feature LiDAR → BEV → BEV Feature → Fusion Radar → BEV →BEV Feature
这次是Ego Coordinate Alignment -> BEV Representation Alignment的范式升级。这也是为什么 BEVFusion 在自动驾驶发展史里意义这么大。
2.1 最简单的方法:BEV Feature Concatenation
Camera BEV → Concat → MLP / Conv → Unified BEV LiDAR BEV
Camera BEV -> Cross Attention <- LiDAR BEV
例如:LiDAR Query -> Attend Camera Feature
Camera Query -> Attend LiDAR Feature
•
代表思路:FUTR3D、TransFusion、DeepInteraction
进一步发展后,不再区分Camera BEV、LiDAR BEV、Radar BEV
例如:Camera Token、LiDAR Token、Radar Token,全部送进Transformer:
Multi-modal Transformer -> Unified BEV
不再继续设计谁融合谁、谁指导谁,交给Attention学习。
第一阶段 第二阶段 第三阶段
Feature Concatenation->Cross-modal Interaction -> Unified Representation 拼接 交互 统一
例如:RGB + Depth / RGB + Language / Image + Text / Camera + LiDAR
最后都在向:Unified Token Space 演化。
BEV最初解决的是空间表示问题。传统图像特征属于图像坐标系,难以直接表达真实三维世界;BEV通过构建鸟瞰空间表示,实现了:
随后Temporal BEV引入时间维度,通过历史BEV累积,实现:
Spatial BEV → Spatio-temporal BEV
增强了遮挡区域、远距离目标以及稀疏观测区域的感知能力。而Fusion BEV进一步向前推进:
Spatio-temporal BEV → Unified Multi-modal BEV
Camera提供语义信息,LiDAR提供几何信息,Radar提供运动与全天候信息。不同传感器不再仅仅进行坐标对齐,而是首先映射到统一BEV表示,再在同一个空间框架内完成信息交互。这意味着BEV的角色已经发生变化:
Bird's Eye View(鸟瞰表示)→ Unified World Representation(统一世界表示)
因此,Fusion BEV真正重要的并不是简单地融合了更多传感器,而是第一次让来自不同传感器的信息能够以统一的世界表示形式存在和交互。
这标志着BEV开始从一种感知网络结构,逐渐演化为自动驾驶系统的统一世界模型(World Representation)的雏形。