LiAuto-GeoX 是理想视觉基座团队自研的面向全视角自动驾驶场景的高效稠密 3D 几何大模型。通过大规模驾驶场景重建模型训练与几何结构保持蒸馏,将高质量的三维几何能力压缩到轻量化车端模型中,解决传统视觉几何模型算力开销大、跨环视空间不一致、无法车端实时推理三大行业痛点。我们将从核心架构创新、整套训练落地方案、模型性能实测以及下游任务泛化效果等多个维度完整拆解 LiAuto-GeoX 的技术细节。
论文链接:https://arxiv.org/pdf/2606.05774
项目链接:https://ljwwwiop.github.io/GeoX
一、行业痛点
当前量产自动驾驶系统普遍采用基于 Transformer + BEV/Occupancy 的端到端架构,以Occupancy(占用网格)作为三维空间的主流感知底座。然而,Occupancy对三维空间的描述本质上是离散的(方块状),在精度上限和资源消耗方面存在固有瓶颈。为此,以 VGGT、DVGT 为代表的通用稠密3D 重建方案被视为替代或升级现有Occupancy表征、建立更高精度连续三维世界底座的重要技术路径。然而,此类方案在自动驾驶场景实际落地过程中,普遍面临三大核心挑战:
算力开销高,量产部署难:主流几何重建模型参数规模普遍超过 10 亿,单帧推理时延通常达到数百毫秒级,对车端 SoC 有限的算力和功耗预算有着极高需求,导致实际部署成本居高不下,难以满足量产上车需求。
环视重建一致性不足:自动驾驶环视相机天然存在视角重叠区域有限的问题,通用多视图模型在该场景下容易出现跨视角空间对齐不稳定、远距离几何畸变等现象,影响整体重建结果的全局一致性与可靠性。
与下游任务协同不足:现有的 3D 重建方案仍主要作为独立感知任务进行优化,与占用预测、轨迹规划等自动驾驶核心任务之间缺乏高效协同,导致重建结果难以充分转化为系统级决策价值。
二、方案创新贡献
面向自动驾驶场景对高精度、低时延、可部署 3D 重建能力的核心需求,LiAuto-GeoX 创新提出“几何保持蒸馏”范式。该方案以海量环视驾驶数据为基础,先训练具备强几何理解能力的大容量教师模型,再通过由掩码引导深度蒸馏和相对位姿关系蒸馏构成的双路径蒸馏机制,将百亿级模型的几何表征能力高效压缩至仅 155M 参数的轻量化学生模型中。
这一创新方案在大幅降低模型规模和部署成本的同时,依然实现了对稠密重建精度的有效保留,并满足车端场景对于超高实时性的严苛要求,打通了从离线高精度重建、到车端实时推理、再到自动驾驶下游任务高效复用的完整技术链路。
三大核心技术创新
掩码引导深度蒸馏:针对图像中几何价值更高的关键区域进行定向蒸馏,增强模型对物体边缘、远景目标及细粒度深度结构的保持能力,进一步提升复杂驾驶场景下的深度重建质量。
相对位姿关系蒸馏:通过构建跨视角几何关系约束,在全局层面强化环视多相机之间的空间一致性,有效缓解跨视角错位和几何畸变问题,提升环视重建稳定性。
多源数据联合训练:结合多个公开自动驾驶数据集与稀疏激光雷达先验进行联合优化,显著提升模型在远距离、弱纹理及长尾场景中的几何感知能力与泛化表现。
三、核心架构创新
LiAuto-GeoX 整体技术链路采用三阶段设计:前期通过大容量教师模型训练建立强几何表征能力,中期借助双路径几何蒸馏实现能力高效迁移,最终由轻量化学生模型推理实现从离线高精度学习到车端实时部署的系统化贯通。
大容量教师模型预训练
在大容量教师模型预训练阶段,LiAuto-GeoX 参考 VGGT 的大模型架构,构建具备强大几何理解能力的教师网络。模型采用 24 层编解码设计,特征维度为 1024,以增强对复杂空间结构的表征能力。训练过程中,模型以大规模自动驾驶数据集中的标定环视图像及其对应的相机内外参信息为输入,并融合稀疏激光雷达先验,充分学习多视角场景中的几何结构与空间关系。
双路径几何蒸馏
LiAuto-GeoX 通过双路径几何蒸馏实现了对局部细节与全局结构的协同增强:一方面,掩码引导深度感知蒸馏聚焦关键几何区域,提升深度信息的学习效果;另一方面,相对位姿关系蒸馏强化跨视图空间约束,提升环视一致性。二者结合后,模型在重建精度、位姿估计和深度预测等任务上实现了更优的整体性能。
掩码引导深度感知蒸馏
为提升轻量化学生模型对关键几何区域的深度感知能力,LiAuto-GeoX 设计了基于掩码引导的深度感知蒸馏机制。该方法首先冻结教师模型,并提取其 token 层级的激活得分,从中筛选几何响应更强的区域,生成二值掩码。随后,通过轻量化 Depth-Mask Adapter 将掩码信息注入学生模型的编码层,在训练阶段定向强化模型对物体边缘、远景区域等关键深度信息的学习,而在推理阶段不会引入额外计算开销。
相对位姿关系蒸馏
区别于仅回归相机绝对位姿的方案,LiAuto-GeoX 在归一化各视图特征后,进一步构建跨视图余弦相似度关系矩阵,并对其中非对角线项的跨视图关联进行约束。该设计从全局层面强化环视多相机之间的空间一致性,有效提升多视角重建的对齐精度与整体几何稳定性。
轻量化学生模型推理
在推理阶段,LiAuto-GeoX 采用由 DINOv2-Small 编码器 与 12 层解码器组成了轻量化的学生模型,总参数量仅 155M。训练完成后,教师模型、雷达先验以及掩码辅助模块均可剔除,模型仅通过单次前向计算即可完成全环视稠密 3D 重建,原生适配自驾场景下 5~8 目任意的环视相机配置。
相比参数庞大、推理开销高的通用稠密 3D 重建方案,LiAuto-GeoX 以更轻量的模型规模实现了更高的推理效率,显著降低了车端部署门槛,为量产场景下的实时 3D 几何感知提供了可行路径。
四、全维度模型性能实测
基于 KITTI、Waymo、nuScenes、DDAD 等主流自动驾驶数据集,我们从3D 重建精度、相机位姿估计、深度估计、推理效率以及四大自动驾驶下游任务表现五个维度,对 LiAuto-GeoX 与 VGGT、π³、DVGT 等业界 SOTA 方案进行了系统性横向评测。
通用 3D 稠密重建效果
在仅 155M 参数规模下,LiAuto-GeoX 依然展现出领先的稠密 3D 重建能力。在 DDAD 数据集上,模型取得 Acc = 1.012、Comp = 1.174 的成绩,位居榜单首位;在 Waymo、nuScenes 等数据集上,其重建指标也与 1B+ 参数规模的超大模型基线持平,部分指标实现反超,充分体现了其在轻量化与重建精度之间的优异平衡。
从可视化结果来看,在 2 至 8 个不同相机配置下,LiAuto-GeoX 对道路边界、远距离障碍物等关键结构的重建更加完整,能够有效避免跨视图碎片化和空间错位问题,展现出更强的环视一致性与几何稳定性。
相机位姿估计
在 PandaSet、DDAD、Lyft、nuScenes 四大自动驾驶环视数据集上,LiAuto-GeoX 在相机位姿估计任务中表现出色,相对旋转精度(RRA)达到 100%。同时,AUC 指标相较于最优基线 π³ 实现了 3~4 倍提升,充分验证了其在多视角空间关系建模上的显著优势,也展现出对多规格环视相机布局的良好适配能力。
推理速度与显存占用
在推理效率与资源占用方面,LiAuto-GeoX 同样展现出显著优势:
深度估计能力
在深度估计任务上,LiAuto-GeoX 同样表现领先。在 Lyft、PandaSet、Waymo、nuScenes 四个数据集上,模型的 Abs Rel 指标均达到行业最优,尤其在远距离目标以及侧后广角相机场景中,深度误差得到显著优化。
在 KITTI 场景下,尽管精度较大模型存在小幅差距,但 LiAuto-GeoX 依然以超过 2 倍的推理速度实现了精度与效率的良好平衡,进一步体现出其在实际部署中的应用价值。
下游自动驾驶迁移任务
闭环轨迹规划任务
闭环轨迹规划任务(Navsim 仿真)中,LiAuto-GeoX 仅依赖相机输入即可取得 90.6 的 PDMS 指标,性能表现优于 UniAD、DriveVLA、各类世界模型,以及基于几何模型 DVGT2 的端到端方案。该结果表明,LiAuto-GeoX 所学习到的高质量几何特征不仅能够服务于重建任务,还可进一步直接赋能车辆的决策与规划能力。
4D 时序占用预测
在 4D 时序占用预测任务(Occ3D-nuScenes)中,LiAuto-GeoX 取得了 24.63% 的平均语义 mIoU 和 47.67% 的平均几何 IoU。在 3 秒远期预测场景下,其各项指标全面领先于 SparseWorld-TC 等主流占用预测模型,充分表明高质量稠密几何表征能够有效增强模型对未来场景演化的推演能力。
实景连续重建表现
从实景案例来看,在直道行驶、城市转弯等复杂路况下,LiAuto-GeoX 依然能够输出拓扑结构连贯、可行驶区域完整的 3D 场景重建结果,并在长时序连续重建过程中保持稳定,无明显漂移。
五、总结
在通用稠密 3D 重建方案普遍面临算力成本高、环视一致性不足、难以服务下游任务等落地挑战的背景下,LiAuto-GeoX 为自动驾驶几何感知提供了一条兼顾精度、效率与可部署性的可行路径。它跳出了“3D 重建仅服务于单点感知任务”的传统思路,探索将稠密几何能力沉淀为可贯穿自动驾驶链路的通用底层表征,推动几何信息从单一重建结果向更广泛的系统复用价值延伸。
通过创新的轻量化几何蒸馏方案,LiAuto-GeoX 在仅 155M 参数规模下,原生适配市面主流 2~8 目量产环视相机配置,打通了从基座模型能力学习到轻量化车端部署的完整技术链路,实现了接近甚至部分超越超大模型的重建精度。与此同时,LiAuto-GeoX 所学习到的高质量几何表征还能够原生迁移至轨迹规划、占用预测、未来场景推演等关键下游任务,展现出从感知到决策的广泛复用价值。
面向未来,团队还将持续推进 LiAuto-GeoX 的能力演进:一方面,进一步拓展模型适用边界,推动其在机器人与具身智能场景中的研发和落地,增强对更多真实世界任务的兼容与适配能力;另一方面,持续探索规模化流式架构,打造具备高效横向扩展能力的流式几何建模大模型,为更复杂、更开放环境下的实时空间理解奠定基础。