论文标题
Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos
论文地址
https://arxiv.org/pdf/2606.07366
自动驾驶系统在标准道路上已经越来越稳,但这套能力在面对施工区时却频频翻车。
碰撞紧急车辆、开进未干的水泥、看不懂旗手的 Stop/Slow 指示牌、在临停的工程车之间被困住——这些不是虚构的 corner case,而是 2022 到 2026 年间多家商业自动驾驶公司公开记录的真实事故。
施工区之所以难,是因为它把长尾问题的三个维度一次性打包了:罕见的物体(锥桶、临时指示牌、箭头板),罕见的路面布局(车道封闭、对向借道、地面标线被覆盖又重画),以及罕见的交互行为(工人铲雪、旗手挥舞、交警手势指挥)。
但这些极端场景恰恰是行车记录仪最常拍到的东西。
每天,数以百万计的消费级行车记录仪在路上默默录像。它们覆盖的城市数量、道路类型和异常事件,远超任何一个自动驾驶车队的采集范围。
问题在于——这些视频是单目、无标定、GPS 粗糙甚至缺失的。要把它们变成仿真器能用的 4D 驾驶日志,需要解决尺度歧义、目标定位、地图对齐这一连串难题。
来自 CMU、NEC Labs America、MIT 和 UC San Diego 的研究团队给出了一个答案。
他们提出了 Dash2Sim,一个将野生单目行车记录仪视频转化为公制尺度、地理参考的 4D 驾驶日志的框架。基于这个框架,他们构建了 ROADWork4D 数据集,覆盖 17 个美国城市、4,244 个施工区场景、270 万个 3D 目标标注。
Dash2Sim 的核心思路可以用一句话概括:用公开基础设施当锚点。
单目视频最大的痛点是尺度不确定。你用 SfM 重建出来的轨迹和场景,只能确定到一个全局的相似变换——你不知道这条路的真实尺寸是多少米,也不知道车辆在地图上的精确位置。
研究团队的观察非常巧妙:尺度恢复本质上是一个检索问题,而不是传感问题。
他们用粗粒度的行车记录仪 GPS(精度可能差到把一个街区外的位置标过来)去检索附近的 Google 街景全景图,渲染出透视图,然后把行车记录仪帧和街景帧一起扔进 SfM。因为街景图片自带精确 GPS 坐标,这个联合重建就自然获得了公制尺度和地理参考。
在 nuScenes 上验证的结果相当惊艳:中位平移误差不到 10 厘米,旋转误差在 1° 以内,恢复的尺度与真值的偏差只有 0.3%。
有了准确的深度和位姿,接下来的挑战是检测和追踪那些长尾物体。
施工区里的锥桶、管状标记、临时指示牌,在行车记录仪画面中往往只有几个像素宽。传统检测器对这类罕见类别泛化能力有限。研究团队的策略是用 SAM3 做提示式追踪:用一个领域特定的检测器先找出高置信度的目标作为模板,然后把模板的掩码作为提示喂给 SAM3,让它在整个视频中传播。检测和追踪交替迭代,逐步"清空"场景中的所有实例。
然后,他们把恢复的密集深度作为条件信号,用 WildDet3D 将 2D 追踪结果提升到 3D。
最后一步是让这些日志能跑闭环仿真。研究团队选择了 nuPlan 作为仿真接口,用 OpenStreetMap 作为路由地图。这张地图是独立维护的——它和数据来源之间没有任何"串通",因此可以作为一个外部的、无标注的质量检验信号。
恢复出来的 4D 日志质量怎么样?
在传统的数据集中,你可以用 LiDAR 真值去比对。但野生行车记录仪视频没有这些。研究团队提出了一个聪明的方法:非反应式日志回放验证。
逻辑很简单。这些视频里的驾驶行为本身没有过错——驾驶员完整地走完了路线,没有发生事故。那么,把记录的 ego 轨迹在仿真器中回放,关掉其他车辆的交互(非反应式模式),如果仿真器给了低分,那大概率不是驾驶的问题,而是重建或地图的问题。
用这个机制,他们从 4,244 个场景中自动筛选出了 2,201 个高质量场景,构成了 ROADWork4D-CL 子集,专门用于闭环规划的训练和评估。有趣的是,筛选前后的城市分布比例基本一致,说明这个验证机制没有引入系统性偏差。
在 ROADWork4D-CL 上跑闭环规划的结果,延续并扩展了之前的一个重要发现。
规则方法 PDM-Closed 得分 53.0,混合方法 Pluto 得分 57.5,而纯学习方法——PlanTF 只有 17.7,Diffusion Planner 也只有 24.0。
这个差距高达 30 到 40 分。
更值得玩味的是不同规划器的失败模式。研究团队用雷达图做了详细分析:PlanTF 极度保守,几乎没有碰撞但也不怎么前进;Diffusion Planner 非常激进,碰撞率高达 51.8%;PDM-Closed 安全但过于保守,不太擅长在施工区做必要的变道;而混合版 Pluto 在各项指标之间取得了最好的平衡。
研究团队还做了一个关键消融:把动态车辆全部移除,只留静态施工区物体和地图。结果分数变化很小。这说明,让这些规划器头疼的不是路上的其他车,而是施工区本身的布局——封闭的车道、偏移的行车路线、与地图矛盾的临时通道。
另一个有趣的发现是通道敏感性。在正常的车道保持评估中,所有车道都是可行驶的。但在施工区,锥桶和指示牌把车流"挤"进特定通道,偏离这个通道就算违规。当评估从"通道敏感"切换到"通道不敏感"模式时,所有规划器的分数都显著提升——Pluto 更是从 32.7 跳到 43.0。这说明当前很多规划器对车道中心线的过度依赖在施工区恰好变成了弱点。
好消息是,运动规划是可以从 ROADWork4D 中学习的。研究团队用不同城市的子集训练 PlanTF,发现即使只加一个城市的数据,在全城市测试集上的表现就能提升。当用到全部 17 个城市的数据时,PlanTF 从零样本的 19.0 分提升到 23.8 分,追平了零样本 Diffusion Planner 的水平。
特权规划假设你已经有完美的感知结果。但现实中的施工区事故,很多时候恰恰是感知先出了问题——没看到那个锥桶,没读懂那块临时指示牌。
所以研究团队进一步探索了闭环传感器仿真的可能性。
他们用 Dash2Sim 恢复的密集深度作为额外监督信号,去训练 OmniRe(一个基于 3D Gaussian Splatting 的城市重建框架),然后在保留的测试帧上做新视角合成。
结果很直接:加上深度监督之后,感知指标 LPIPS 提升了 14%,CLIP-FID 提升了 19%,DreamSim 提升了 16%。
尤其是在那些小尺寸的长尾物体上——锥桶的渲染质量提升了 20%,管状标记提升了 14%,垂直面板提升了 13%。临时指示牌上的文字也因此变得更清晰,这对需要"读懂"施工区标志的端到端模型来说至关重要。
Dash2Sim 最值得关注的地方,不在于它产出了 ROADWork4D 这个具体的数据集,而在于它建立了一套可扩展的流程。
街景锚定 + OpenStreetMap 对齐 + 非反应式日志回放验证——这三个组件都不依赖昂贵的车队传感器或人工标注。只要有行车记录仪视频和对应的地理位置,理论上就能跑通。
研究团队甚至测试了完全不用 GPS 的替代方案:用视觉地点识别模型 MegaLoc 在 Mapillary 的街景数据中检索,发现 60% 的查询能在 50 米内找到对应参考图像。在街景覆盖密集的区域,这个数字可以到 76%。
当然,这套框架也有明确的局限。单目前视摄像头只能看到前方,车身周围大部分区域是盲区。恢复的智能体轨迹用的是恒定速度的卡尔曼滤波,无法建模真实世界中的复杂交互。OpenStreetMap 的标准精度有时和实际情况对不上——比如车道数不一致、缺少转弯导流岛的建模。
但这些局限恰好指明了后续的研究方向:更好的 3D 重建方法、学出来的交通模型、以及真实道路上的验证框架。
这篇工作传递了一个更宏观的信号。
自动驾驶的数据采集长期依赖昂贵的车队——装备了 LiDAR、多相机、高精度 GPS 的改装车辆,在有限的几个城市里开了又开。这种方法能稳定产出高质量数据,但永远追不上长尾场景的分布广度。
而行车记录仪视频是另一个数量级的数据源。估计 30% 的美国车主装了这个东西。它覆盖的城市、道路类型和异常事件,是任何单一车队都难以企及的。
Dash2Sim 把这条路径从"想法"变成了"可运行的框架"。4,244 个施工区场景,横跨 17 个城市,包括芝加哥、哥伦布、印第安纳波利斯、夏洛特等在现有自动驾驶数据集中从未出现过的城市。
施工区只是长尾场景的一个切面。同样的思路,也可以延伸到恶劣天气、罕见交通参与者和非常规道路布局。
把满街的行车记录仪变成自动驾驶的"数据众包网络"——Dash2Sim 迈出了一大步。