
点击下方卡片关注我们,点亮星标⭐,优质好文第一时间送达^_^
Click on the card below to follow US

>>>戳我一下,加入智驾机器人学习交流群✨
在自动驾驶研究中,做一个新数据集似乎有一套约定俗成的流程:
购买传感器、搭建采集车、规划路线、录制数据、组织标注,最后再设计几个任务和榜单。
但卡尔斯鲁厄理工学院(KIT)与FZI研究人员在最新论文《Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark》中提出了一个看似简单、却经常被忽略的问题:
在决定采集数据之前,我们真的已经证明“重新采集”是最合适的方案了吗?
这篇文章并没有再发布一种新的感知网络,也没有围绕某项指标刷新排行榜。作者真正想解决的是一个更上游的问题:资源有限的高校实验室、研究团队和初创公司,应该怎样设计一个真正有研究影响力的自动驾驶数据集?
论文给出的答案可以概括为一句话:
先判断研究受阻的原因,再寻找能够填补缺口的最低成本数据操作;只有其他方案都无法解决问题时,才重新采集真实道路数据。
这套方法被作者称为从“研究缺口”走向“Benchmark”的战略框架。为了证明它并非停留在概念层面,论文还以KIT团队正在建设的 KITScenes Multimodal 和 KITScenes LongTail 两套数据为贯穿全文的案例。
过去十多年,自动驾驶数据集的规模不断扩大。
从KITTI、Cityscapes,到nuScenes、Waymo Open Dataset、Argoverse 2,再到面向规划、端到端驾驶和世界模型的大规模数据,研究者能够接触到的数据数量、传感器类型和任务种类都远超早期阶段。
但作者观察到,自动驾驶数据正在逐渐走向两条不同的路线。
一条路线追求规模。
这类数据通常服务于模型训练,依靠车队采集、自动标注、仿真生成或生成式模型扩展数据量。它们的目标是让模型见到更多道路、更多交通参与者和更多驾驶状态。
另一条路线追求评测的可信度。
这类数据不一定很大,却需要更准确的传感器标定、更严格的同步、更高质量的标注,以及更有针对性的长尾场景。它们的作用不是继续“喂大”模型,而是回答一个更困难的问题:
这个模型到底有没有真正解决目标任务?

作者认为,这种分化意味着:今后的自动驾驶研究未必还需要所有团队都去追求“更大的数据集”。
工业车队可以不断积累海量数据,高校实验室很难在规模上正面竞争。学术团队更有价值的突破口,可能是寻找现有数据无法回答的问题,并用规模更小、但设计更精准的数据建立可信的评测标准。
论文框架的第一步,不是选择相机或激光雷达,而是判断研究究竟卡在哪里。
作者将常见瓶颈分成两类。
当一种方法在理论上能够建立,但由于训练样本数量不足、场景不够多样,或者缺少某类传感器数据而无法训练时,研究面对的是数据问题。
例如:
这类问题的主要矛盾在于数据供给。
解决方案往往需要扩大规模、增加多样性,或者利用仿真、自动标注和已有数据降低成本。
另一种情况更加隐蔽。
研究者已经能够训练模型,排行榜上的数字也在提升,但现有测试集可能过于简单,指标可能与真实驾驶需求脱节,训练集与测试集之间还可能存在地理位置或场景泄漏。
此时,继续增加训练数据不一定能解决问题。
真正缺少的是:
这就是评测问题。
作者特别提醒,数据集建设中一种代价高昂的错误,是用扩大规模的方式解决评测问题,或者用一个小而精的评测集去承担大规模训练任务。
两类问题的目标不同,后续的采集方式、标注方式和成本分配自然也不同。
在确定问题类型后,第二步是找到足够具体的研究缺口。
作者建议,不要以“做一个更全面的数据集”作为项目目标,而应从一开始就明确:
论文以在线高精地图构建为例。
近年来,MapTR、MapTRv2、StreamMapNet、MapTracker等方法持续推动在线矢量化地图构建的发展。在Argoverse 2等数据集上,模型的mAP曾快速提升,但在一段时间后,性能增长开始趋缓。
问题是,指标趋于饱和并不意味着在线地图已经能够直接服务自动驾驶系统。
很多模型可以输出车道线、道路边界等几何元素,却仍然缺少实际规划系统需要的关系信息,例如:
也就是说,模型在既有指标上继续提升,并不等于结果正在接近可部署状态。

KITScenes Multimodal针对的正是这一缺口。
它并不只是希望提供更清晰的图像或更密集的点云,而是尝试建设一套包含完整关系标注的、面向真实自动驾驶软件栈的高精地图数据。
作者尤其强调交通灯与车道之间的显式对应关系。这些内容在研究数据集中经常被简化,但在规则规划、混合式规划以及实际软件栈中非常重要。
因此,这里的核心矛盾不是“精度还能不能再提高一点”,而是:
现有任务和指标,是否真正衡量了部署所需要的能力?
确定研究缺口后,作者没有立即讨论采集车,而是提出了五类数据操作方式。
论文将它们称为 Data Operators。这里的“算子”不是神经网络算子,而是研究团队获取、组织和改造数据的基本手段。
这种方式不产生新的传感器数据,而是在已有数据基础上进行:
它的成本通常远低于重新采集。
一套旧数据并不意味着只能支持旧任务。只要原始数据中保留了足够的信息,通过重新标注和重新定义问题,仍然可能产生新的研究价值。
Collection更接近数据挖掘或众包。
例如,从行车记录仪、手机、公开道路视频或其他已有来源中收集图像和片段。它能够以较低成本获得较大的地域和外观多样性,但传感器质量、标定精度和数据一致性通常有限。
自动驾驶领域的数据格式、坐标系统、标签定义和接口长期不统一。
Unification并不产生新的道路场景,而是把多个现有数据集转换到统一格式、统一任务定义或统一API中,使模型能够进行跨数据集训练和评测。
这类工作的价值容易被低估,但它能直接减少研究碎片化。
仿真平台能够提供可控场景和近乎免费的精确标签,生成式模型则可以进一步扩大外观、天气和事件的多样性。
合成数据适合构造真实世界中稀少、危险或难以重复采集的场景。
它的问题也很明确:生成的数据是否足够真实,以及模型是否会利用仿真环境中的特有规律。
这是最直接、也最昂贵的方式。
它涉及传感器采购、车辆改装、时间同步、标定、采集软件、路线设计、数据存储、隐私处理和人工标注。
Recording的独特价值在于,它能够获得真正新的真实世界传感器数据。但也正因为成本最高,作者提出了全文最重要的一条建议:
把重新采集视为最后选择,而不是数据集项目的默认起点。

“最小数据算子”并不意味着一味选择最便宜的方式。
它真正强调的是:选择能够完整解决研究问题的最低成本方案。
假如重新标注已有数据就能建立新任务,就没有必要搭建新的采集车;假如研究缺口来自特定地域和传感器质量,而现有数据无法补足,那么重新采集反而可能成为最低限度的可行方案。
KIT团队在规划KITScenes Multimodal时,也曾考虑过更便宜的方案。
其中一个思路,是直接扩展Argoverse 2,为其增加Lanelet2风格的三维关系地图标注。
从成本角度看,这明显比重新搭建传感器系统、录制欧洲城市道路更省事。
但团队最终放弃了这一方案,主要有三个原因。
KITScenes希望覆盖欧洲高密度城市中更复杂、更不规则的道路布局。
这类道路结构与北美许多相对规则的城市道路存在差异,而Argoverse 2中缺少团队所需要的代表性场景。
在原始场景不存在的情况下,重新标注无法创造新的道路结构。
KITScenes希望支持远距离感知、高精地图构建和高可信评测。
如果原始传感器分辨率、同步和标定精度不足,即使增加标签,也无法恢复采集阶段没有记录下来的信息。
论文核心贡献:
要建立能够准确投影到图像和点云中的三维地图,必须首先拥有高质量的定位、标定和多传感器数据。
如果底层数据存在偏差,后续地图关系再完整,也很难形成可靠Benchmark。
因此,重新采集并不是因为团队忽视了成本,而是因为现有数据无法通过改造满足目标。
值得注意的是,作者也坦言,这一选择能够成立,还有一个现实前提:KIT和FZI已经具备传感器硬件、录制软件以及高精地图制作方面的积累。
对一个从零开始的团队而言,同样的研究目标未必应该采用同样的方案。
KITScenes Multimodal的设计逻辑不是单纯追求数量,而是强调传感器、标定、同步和地图标注的完整性。
其传感器系统包括:
论文称,部分激光雷达的有效距离超过400米。
团队采用车顶传感器架,而不是将设备完全嵌入量产车身。这种设计更接近L4 Robotaxi研究平台,虽然与普通L2量产车的传感器布局并不完全一致,却有利于提高标定精度和数据质量。
这也反映了KITScenes的定位:它首先是一套面向可信评测的研究数据,而不是对某款量产车传感器配置的直接复刻。

KITScenes Multimodal的另一个重点是开放格式的高精地图。
作者希望地图能够与Autoware、Apollo等自动驾驶软件栈衔接,因此采用Lanelet2等标准化思路,并提供规划系统所需的关系信息。
这里体现了论文反复强调的“应用对齐”:
数据集不能只考虑研究模型容易输出什么,还要考虑真实系统最终需要什么。
随着自动标注技术发展,大规模数据越来越依赖离线模型生成标签。
对百万级甚至更大规模的数据而言,完全依靠人工标注并不现实。自动标注可以显著降低成本,也是训练型数据集扩张的重要基础。
但KITScenes的目标之一是高可信评测。
因此,团队采用了人机协同标注策略:
作者指出,高精地图自动标注目前仍然是一个没有彻底解决的问题。
尤其是地图元素之间的逻辑关系,错误往往不容易通过单个几何距离发现。一个交通灯的位置可能标得很准,但它究竟控制哪条车道,仍然需要更高层级的语义和拓扑判断。
论文由此提出一个值得注意的判断:
当训练数据越来越依赖自动标注时,高质量人工校验数据的价值不会下降,反而会因为它能够充当可信的评测标尺而上升。
不少数据集项目在早期会陷入一种误区:先尽可能多地采集,后续再考虑标注、评测和发布。
论文明确反对这种做法。
作者建议,在项目初期就挑选少量但具有代表性的样本,完成一条端到端流程:
哪怕只有少数几个场景,这条流程也必须先跑通。
原因并不复杂。
许多问题只有在数据真正进入模型和评测系统后才会暴露,例如:
先完成一条小规模闭环,比采集数百小时数据后再发现设计错误,要便宜得多。
一个数据集能否形成研究影响力,不只取决于数据是否公开,还取决于它能否建立可靠Benchmark。
论文重点讨论了三个问题。
自动驾驶数据通常具有很强的时空连续性。
如果直接随机划分帧,或者只按照时间切分,同一条道路、相邻位置甚至同一个静态场景可能同时出现在训练集和测试集中。
模型最终测到的可能不是泛化能力,而是对道路外观和地图结构的记忆。
因此,KITScenes Multimodal优先按照地理距离进行划分,而不是简单地按照时间分割。
在在线地图构建、规划和端到端驾驶任务中,地图、未来帧和高精度地理位置都可能成为泄漏源。
如果测试集中的这些信息可以被间接获取,排行榜结果就很难保持可信。
论文称,KITScenes Multimodal在在线高精地图构建任务中隐藏了测试集的全部地图数据,以减少利用先验地图“绕过任务”的可能。
端到端驾驶评测中,经常使用预测轨迹与专家轨迹之间的位移误差。
但真实道路上,面对同一场景可能存在多种合理行为。
例如,前方出现障碍时,车辆可能选择:
如果评测只把单一专家轨迹当作标准答案,那么一条安全、合法但不同的轨迹,也可能得到很差的分数。
KITScenes LongTail因此引入了 Multi-Maneuver Score,尝试同时考虑多种合理驾驶动作,并结合人工推理记录评估模型是否理解了场景中的关键约束。
这也是KITScenes LongTail与普通轨迹预测数据的主要区别:它不仅记录“驾驶员最后怎么开”,还关注“为什么可以这样开”。
论文介绍,KITScenes数据家族初步提供五类Benchmark:
两套数据分别对应不同的设计重点。
KITScenes Multimodal强调传感器、地图和标注的高保真,适合研究远距离感知、在线地图构建和多模态建模。
KITScenes LongTail则强调少见但具有决策价值的驾驶场景,并提供人类推理记录,希望推动端到端驾驶模型从“模仿轨迹”走向“理解约束后作出合理决策”。
前者解决评测的精度问题,后者解决评测的覆盖问题。
从表面看,这是一篇自动驾驶数据集设计文章。
但它提出的框架同样适用于机器人、医学影像、遥感、多模态模型和工业检测等依赖数据的研究方向。
很多团队在项目早期会把“缺少数据”当成默认判断,但论文提醒我们,研究停滞可能还有其他原因:
在这些情况下,新采集一批数据可能并不是最有效的投入。
重新标注、统一格式、重新划分测试集、设计新指标,甚至只挖掘一小部分高价值场景,都可能产生比“再录制几百小时”更大的研究影响。
这篇论文提供的是战略框架,而不是一套可以直接计算投入产出比的公式。
“最小算子”究竟是哪一种,仍然依赖团队自身条件。
例如,同样是重新采集:
此外,论文中的很多判断以KITScenes的建设经验为基础。数据集能否真正形成长期影响,还需要观察后续的使用规模、Benchmark参与度、基线结果和社区反馈。
KITScenes强调高保真和长尾评测,但高质量小数据能否稳定反映模型在开放道路上的整体能力,也仍然需要持续验证。
不过,这些局限并不削弱论文的核心价值。
它至少把一个长期被经验化处理的问题明确说了出来:
数据集建设不是从“买什么传感器”开始,而是从“现有研究为什么无法继续前进”开始。
这篇论文可以归纳为五个关键判断:
第一,先判断是数据问题还是评测问题。缺少训练样本与缺少可信Benchmark,是两种完全不同的瓶颈。
第二,研究缺口必须具体到任务、数据和指标。“做得更大、更全”不是足够明确的数据集目标。
第三,优先选择能够解决问题的最小数据算子。重新标注、数据挖掘、格式统一和数据合成都可能比重新采集更合适。
第四,重新采集应当是最后选择。只有当目标场景、传感器质量或底层信息无法从现有数据中获得时,Recording才真正具有必要性。
第五,未来学术数据集的竞争力未必来自规模。在工业车队掌握海量训练数据的背景下,精准定义新任务、建立应用对齐指标、覆盖长尾场景和提供高可信评测,可能是高校团队更有价值的方向。
自动驾驶已经进入一个“不只缺数据”的阶段。
下一套真正产生影响力的数据集,未必是小时数最多、传感器最昂贵的那一套,而可能是最准确地找到了研究缺口,并用最合适方式将其关闭的那一套。
论文标题: Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark
作者: Richard Schwarzkopf、Jonas Merkert、Frank Bieder、Annika Bätz、Alexander Blumberg、Carlos Fernandez、Felix Hauser、Fabian Immel、Christian Kinzig、Hendrik Königshof、Fabian Konstantinidis、Martin Lauer、Willi Poh、Nils Rack、Kevin Rösch、Yinzhe Shen、Marlon Steiner、Gleb Stepanov、Dominik Strutz、Omer Şahin Taş、Julian Truetsch、Kaiwen Wang、Royden Wagner、Jan-Hendrik Pauls、Christoph Stiller
作者单位: Karlsruhe Institute of Technology,KIT, FZI Research Center for Information Technology
项目地址:https://kitscenes.com/
| 本文仅做学术分享,如有侵权,请联系删文!





往期推荐
