Uber VLGA:面向自动驾驶的视觉-语言-几何-动作模型
- 现有VLA模型擅长语义理解,但缺乏空间几何能力。VLA方案从预训练的VLM模型中继承了场景理解与语言推理能力,但仍然缺乏三维几何空间理解能力。而自动驾驶本质是一个三维空间规划问题,例如判断窄路是否可以通行、判断车辆是否发生碰撞,这些都依赖连续且精准的三维空间信息,仅依靠语言推理或场景语义时不够的。因此本文研究怎么让VLA模型具备空间理解能力。
- 现有几何融合方式没有真正发挥三维信息的作用,本文总结了两类已有的三维信息使用方案,如下图
a)稀疏感知式VLA(UniDriveVLA、Orion、OmniDrive):感知专家产出3D box/lane/occupancy等离散query动作专家只读一个小的离散预测集合进行轨迹规划。b)注入式VLA(VGGDrive 等):把冻结 3D 基础模型的 dense feature 经 cross-attention/BEV token/3D Q-Former注入LLM隐状态,同一套 LLM参数同时处理语言与3D信息。c)纯几何式轨迹规划(DVGT-2的VGA框架):架构专为dense pointmap重建服务,丢掉语言推理。- 以上三种方法要么牺牲语言推理能力,要么缺乏有效监督。作者主张:一个有效的VLA模型必须同时具备 (i) 语言推理、(ii) 稠密空间表征、(iii) 专用的参数处理几何结构——三者目前无一范式兼具。为此,VLGA 引入独立的Geometry Expert,并利用PointMap重建进行稠密几何监督,在保留VLA语义推理能力的同时,实现对三维空间结构的精确建模,从而提升自动驾驶规划的安全性和空间精度。
- 提出了首个Vision-Language-Geometry-Action(VLGA)自动驾驶模型。 在传统VLA框架中,引入Geometry作为第四种模态,在Mixture-of-Transformers(MoT)架构中设计了具有独立参数空间的Geometry Expert,并利用 LiDAR 监督的逐像素PointMap重建任务进行训练,使模型能够学习连续、稠密的三维空间几何信息,而非仅依赖语言推理或稀疏感知结果。
维度 | 稀疏感知 VLA (UniDriveVLA/Orion/OmniDrive) | 注入式 VLA (VGGDrive) | 纯几何 VGA (DVGT-2) | VLGA (本文) |
语言推理 | ✓ | ✓ | ✗ | ✓ |
稠密3D表征 | ✗(离散 box/lane/occ) | ✓(dense 3D feature) | ✓(per-pixel pointmap) | ✓ |
专用几何参数 | ✗(共享 LLM 参数读 query) | ✗(几何经 LLM 参数处理) | ✓ | ✓ |
几何监督目标 | 稀疏 box/map/occ loss | 无显式几何监督(feature 注入) | dense pointmap | dense pointmap(ego 系) |
推理需 LiDAR | 否 | 否 | 否 | 否(解码器仅训练期) |
几何骨干来源 | — | 冻结 VGGT | 自身 | 冻结 DVGT-2 |
backbone是否冻结 | — | VLM 冻结 | — | VLM/perception/几何骨干均冻结 |
- Mixture-of-Transformers (MoT)与masked joint attention:MoT为多模态基础模型设计,把不同模态分配给"模态特化专家",各专家有独立Q/K/V投影;同一层内各专家token拼接后在一个联合注意力里交互,但由一个 visibility mask 控制谁能看到谁,实现"参数隔离但可控耦合"。VLGA 的四专家U/P/G/A即建立在MoT 上,mask决定geometry token看U/P、action看U/P/G。
- Pointmap回归 + Pi3置信度加权(aleatoric uncertainty):对每个patch预测3D点+不确定性logit,损失为‖x̂−x_gt‖₁/b + log b,b=softplus(c)。模型对高不确定区域自动放大b,降低该点对损失的贡献,从而在遮挡/远距/无GT区不强行拟合,是处理"无效patch"的关键机制。
VLGA由四部分组成:多视角视觉编码器、语言tokenizer、四专家MoT block、几何骨干。- MoT block内新增geometry expert,与继承自prior VLA的VLM/perception/action专家并列。VLM 骨干、perception 专家、几何骨干均从各自预训练checkpoint初始化并全程冻结;本文新增的可训练组件为:geometry expert、per-patch geometry projector、action expert、轻量 dense pointmap 解码器(仅训练期用)。
- 每层MoT通过masked joint attention耦合四专家:各专家 Q/K/V 在 {U,P,G,A} 上拼接后按可见性mask M 注意力,再做各专家独立输出投影与FFN。mask M 继承 UniDriveVLA 的 U/P/A 注意力模式并接入几何流:geometry token attend到understanding 与 perception token;action expert额外attend到 geometry token。A把U/P/G作为条件并经flow matching输出轨迹。
- 几何专家:复用DVGT-2作为几何流来源,不从零学几何。骨干对6路相机(960×544)各输出60×34=2040 个 per-patch feature(hidden dim d_g),共 V×2040=12,240个geometry token/场景。保留完整per-patch网格不做 pooling(因 dense 重建需要 per-pixel 分辨率)。轻量 per-patch projector f_proj: R^{d_g}→R^{d_MoT} 把每个token映入MoT空间:g_i = f_proj(f^geo_i)(式2)。这些 token 作为 G 专家输入进 MoT。
整体也比较好理解,相当于在unidrive的基础上增加几何专家,概念上比较新颖。创新属于结构改进而非范式创新。VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving
更多精彩内容,欢迎大家关注微信公众号“自动驾驶新视界”。