NeurIPS韩国 KAIST 联合 42dot 提出 VR-Drive 端到端自动驾驶框架,核心解决现有 E2E 模型相机视角分布偏移鲁棒性差的行业痛点;将前馈 3D 高斯 Splatting 作为辅助任务融入自动驾驶流水线,在线生成多样视角图像做数据增强,配套视角混合记忆库、视角一致蒸馏两大核心模块对齐跨视角特征,构建包含多视角偏移的 nuScenes、CARLA 评测基准;在俯仰、高度、深度等各类未见相机配置下,轨迹误差、碰撞率大幅优于 AD-MLP、BEV-Planner、DiffusionDrive 等基线,兼顾开环定量与 CARLA 闭环仿真验证,是首个系统性解决自动驾驶跨相机视角泛化的端到端统一方案。
问题 1 VR-Drive 和 DiffusionDrive 核心区别?
DiffusionDrive 依靠扩散模型生成新视图,渲染存在大量几何伪影,极端未知视角物体漏检、碰撞率极高;VR-Drive 采用前馈 3D 高斯 Splatting,全局完整 3D 几何约束,渲染结构一致性更强;同时搭配视角混合记忆库、视角一致蒸馏对齐跨视角特征,抑制合成图像噪声,在俯仰、高度各类偏移相机下碰撞率降低一半以上,且推理速度远快于扩散方案。
问题2 视角混合记忆库 VMM 的作用是什么?
1)FIFO 时序存储多帧、多视角物体实例特征,弥补单帧视觉信息缺失;2)通过运动补偿消除时序车辆偏移;3)交叉注意力融合当前与历史全局特征,构建不随相机位置变化的标准化 3D 物体表征,大幅提升 OOD视角检测稳定性。
问题3 视角一致蒸馏 VCD 为什么只用原图做教师?
原始真实相机拍摄图像无渲染伪影、物体可见度高,特征更精准可靠;合成新视图存在遮挡、模糊、几何失真,直接训练会污染模型感知能力。该蒸馏方案用原图干净特征约束合成视图,过滤低置信噪声区域,在增强视角多样性同时保证表征质量。
问题4 前馈 3DGS 相比离线 NeRF 增强优势?
离线逐场景 NeRF/3DGS 迭代优化单序列需 8 小时以上,无法大规模扩充训练数据;VR-Drive 前馈 3DGS 推理毫秒级,训练过程在线实时生成任意偏移视角,无需额外离线算力,工程落地训练成本极低。
问题5 为什么需要循环重建损失?
保证模型渲染的各类偏移新视图拥有全局一致 3D 几何;防止生成视图物体扭曲、尺寸失真,确保增强样本真实有效,不会引入错误场景先验干扰规划训练。
问题6 该方法只提升未知视角性能吗?
不是,消融显示联合 3D 重建、视角增强模块同时提升原始固定相机场景精度;模型不会出现 “为泛化牺牲原位表现” 的权衡,双向优化原始与分布外视角感知规划。