凌晨五点,第一批车已经从郊区快速路切进市中心。昨天夜里下过雨,路口地面有反光,右侧施工围挡把原来的非机动车道挤成一条窄缝。导航仍然提示直行,但前方左转待转区的车排得比平时更靠外,一辆外卖电动车从锥桶边缘钻出。端到端模型给出减速直行,安全壳认为轨迹仍然可行;驾驶员却轻踩刹车并向左避了一点。这个片段如果只被记成一次“人工接管”,价值很低;如果被闭环系统拆解成雨后反光、施工挤占、路口拓扑变化、非机动车横穿和模型过晚减速,它就会变成下一版模型的训练资产。
自动驾驶的数据闭环,本质上就是把这种真实道路里的误差转化为模型能力。车队每天产生海量数据,但护城河不在“存了多少视频”,而在能否持续回答四个问题:哪些片段值得上传,怎么标成模型能学的信号,训练后是否真的修复了同类错误,回到车队后指标是否下降。
图1: 真实道路数据闭环要处理的不是单一目标检测,而是天气、路口拓扑、施工占道、非机动车和驾驶员接管共同构成的长尾场景。
1. 一个真实驾驶场景开头
上面的场景之所以适合作为开头,是因为它同时包含感知、预测、规划、控制和系统工程问题。感知侧会问:雨后反光是不是影响了车道线和锥桶识别;预测侧会问:电动车是否会穿过车辆前方;规划侧会问:是直行、轻微绕行还是停车等待;控制侧会问:湿滑路面上这次减速和横向避让是否仍然稳定;系统侧还要问:这个片段要不要上传、由谁标注、如何回灌、是否会影响其他城市的路口策略。
如果没有闭环,这类片段只会留在日志里。工程师可能在复盘时看见一次接管,但很难判断它代表个例、某个城市高频问题,还是全局模型的盲点。闭环系统的价值,是把单个驾驶片段变成可检索、可聚类、可标注、可训练、可回归测试的单元。
2. 提出核心问题
端到端自动驾驶为什么更依赖数据闭环?因为模型能力不再主要来自手写规则,而来自训练分布。传统模块化系统可以在某个规则里写“遇到施工锥桶向左偏移 0.5 米”,但端到端 Driving Policy 更像从样本中学习“施工改变了可行空间、交通参与者会绕行、速度要更保守”。如果施工样本稀缺、标签粗糙、训练后没有回归测试,模型就很难在真实道路上稳定泛化。
核心问题不是“要不要收更多数据”,而是“如何让数据变成模型能力”。这要求系统把车端触发、云端筛选、自动标注、人工复核、训练评估、仿真回放、灰度回灌和线上监控串成闭环。Learning from All Vehicles 提出从车队多车数据中学习,nuScenes 这类数据集证明多模态数据对研发有价值,GAIA-1 和 NVIDIA Cosmos 代表世界模型与生成仿真方向,Waymo、CARLA 和 CA DMV 披露的公开资料则提醒我们:真实道路、仿真和接管报告都只是闭环的一部分。
3. 基本概念
数据闭环不是简单的数据管道。它包含采集、触发、筛选、标注、训练、评估、上线和再采集。车端采集负责记录传感器原始流、BEV/Occupancy、中间特征、自车状态、线控反馈和人工接管;触发器负责决定哪些片段值得上传;云端系统负责去重、聚类、自动标注和困难样本排序;训练系统把这些片段转成模仿学习、强化学习、世界模型或仿真评估的输入;灰度回灌则验证新模型是否降低同类风险。
Corner Case 不是“罕见到从没见过”的同义词。工程上更有价值的定义是:当前模型不会、上线后可能遇到、且修复后能提升安全或体验的场景。极端天气、临时施工、异形路口、交通参与者反常行为、地图过期、传感器污染、驾驶员接管前后的短片段,都属于闭环优先对象。
端到端、大模型、VLM、World Model 和 BEV/Occupancy 在闭环里各有位置。BEV/Occupancy 提供统一空间表征;Driving Policy 负责从历史观测到轨迹意图;VLM 用来解释长尾语义、辅助标注和检索;World Model 用来生成反事实未来和仿真评估;模仿学习从人类或安全策略中学行为,强化学习或偏好优化用于补充交互策略,但都必须受安全壳和量产 ODD 约束。
| 环节 | 输入 | 为什么需要 | 工程注意 |
|---|
| 采集 | 传感器原始流、BEV/Occupancy、自车状态、线控反馈、接管事件 | 覆盖真实分布,不只覆盖测试路线 | 采样策略决定成本,隐私与合规要前置 |
| 筛选 | 不确定性、预测分歧、急刹、接管、安全壳改写、地图冲突 | 把标注预算用在长尾和高价值片段 | 触发器太宽会淹没标注团队,太窄会漏掉风险 |
| 标注 | 自动标注、人工复核、VLM 语义解释、轨迹与占用标签 | 把片段变成可训练监督信号 | 标签必须服务训练目标,不能只追求好看 |
| 训练 | 模仿学习、困难样本重采样、World Model rollout、仿真反事实 | 让策略学到同类问题的可迁移修正 | 要防止过拟合单个城市或单个供应商传感器 |
| 回灌 | 影子模式、灰度车队、离线重放、线上指标 | 确认模型能力真实提升 | 只看离线 mAP 或 open-loop 误差不够 |
4. 技术机制与系统架构
一套量产数据闭环通常从车端轻量触发开始,而不是全量上传。原因很现实:多相机视频、雷达点云、激光雷达和中间特征的带宽、存储和合规成本很高。车端应根据不确定性、规划冲突、急刹急转、驾驶员接管、安全壳改写、地图匹配失败、Occupancy 突变、VLM 异常标签等触发条件,截取接管前后 10 到 30 秒的片段,并保留模型输出、控制命令和车辆状态。
云端接到片段后,第一步不是人工标注,而是机器筛选。系统会做场景嵌入、相似片段聚类、城市/天气/道路类型分桶、风险评分和去重。这样做的原因是标注预算永远不够,尤其在极端天气和施工场景中,真正有价值的是覆盖缺口,而不是大量重复片段。VLM 可以在这里发挥作用:把“锥桶造成临时车道”“交警手势与信号灯冲突”“雨雾导致远处行人低置信”转成可检索标签。
标注阶段要围绕训练目标设计。端到端策略需要轨迹、动作、路权、让行对象和风险偏好;BEV/Occupancy 需要可行空间、动态占用和遮挡区域;World Model 需要未来状态分布;安全评估需要碰撞、最小距离、TTC、不确定性和安全壳介入原因。标签不是越细越好,而是要能改变模型梯度、仿真覆盖和上线指标。
图2: 数据闭环把车队采集、触发筛选、自动标注、训练评估和灰度回灌串起来,目标是让每次长尾和接管都变成模型能力。
5. 核心方法或处理流程
可以把闭环流程拆成五个工程步骤。第一,车端记录多模态输入、模型中间表征和执行结果,触发条件必须足够明确,避免全量上传压垮带宽。第二,云端用检索和聚类找出新颖片段,区分“模型真不会”和“日志重复噪声”。第三,自动标注系统产生初始标签,人工只复核高价值或低置信样本。第四,把片段进入训练集、仿真集和回归集,分别服务模型更新、反事实测试和版本守门。第五,新模型通过离线指标、闭环仿真、影子模式和灰度车队回到真实道路。
1.
系统输入:多相机/雷达/激光雷达、BEV/Occupancy、自车状态、导航地图、模型输出、线控反馈、驾驶员接管和安全壳介入日志。
2.
系统输出:困难样本集、自动标签、仿真场景、训练权重、模型版本差异报告、灰度上线指标和新触发规则。
3.
关键逻辑:先用机器筛出高价值片段,再把标注和训练预算集中到可改变模型行为的场景。
4.
工程注意:闭环成功的证据不是数据量增加,而是同类场景接管率、冲突率、不确定性和安全壳改写率下降。
这套流程的核心是“样本价值函数”。一个片段是否值得进入训练,不只看是否罕见,还要看风险、模型不确定性、覆盖缺口、可标注性和复现性。极端天气片段很珍贵,但如果传感器完全失效且没有可靠标签,它可能更适合进入 ODD 限制和安全策略,而不是直接训练策略模型。
图3: Corner Case 挖掘用触发、聚类、排序和回灌把全量车队日志压缩成真正改变模型的训练与验证样本。
6. 详细用例分析
不同城市路口差异
同样叫“路口”,北京、上海、深圳、旧金山和凤凰城的行为分布并不一样。信号灯安装位置、待转区长度、非机动车密度、右转让行习惯、潮汐车道、公交专用道、道路标线磨损程度,都会影响端到端策略的轨迹选择。模块化系统往往把这些差异写进地图或规则;端到端系统则更依赖样本分布和闭环纠偏。
工程上,路口差异不能只按城市打标签,更要拆成可迁移因子:路权冲突、等待线位置、可行空间变化、遮挡来源、交通参与者密度、信号灯与地图一致性。这样设计的原因是模型需要学习“为什么这个路口该保守”,而不是记住某个城市名称。回灌训练时,可以把同类路口聚成场景族,用新城市少量数据验证策略是否能泛化。
极端天气数据稀缺
极端天气的难点在于低频但高风险。雨雪雾、逆光、路面积水、摄像头水滴、激光雷达雨雾噪声、轮胎附着下降,都会同时影响感知置信度和控制可行性。真实极端天气数据很难靠“多开几天车”补齐,且采集风险高、分布不均。
闭环系统通常要组合三类办法:真实车队触发采集少量高质量片段,仿真和世界模型扩展可控变量,安全壳定义天气下的保守 ODD。VLM 可以帮助识别可见度下降和道路湿滑语义,World Model 可以生成反事实未来,但上线前仍要用真实道路和封闭场地验证。极端天气数据的目标不是让模型在任何天气都激进通行,而是让它知道何时降速、拉长时距、请求接管或退出 ODD。
施工场景自动挖掘
施工场景是数据闭环最能体现价值的地方。锥桶、临时标线、封闭车道、施工车辆、人工指挥、窄道会车,经常不稳定、不断变化,地图也可能滞后。若只依赖静态高精地图,模型会在“地图说能走、现场不能走”的冲突里犯错。
自动挖掘的触发器可以包括:车道线与 Occupancy 冲突、锥桶密度异常、轨迹多次被安全壳改写、同一路段多车低速绕行、驾驶员频繁接管。筛选后,标注重点不是单个锥桶框,而是可行区域、临时边界、绕行意图和让行对象。训练目标也不是让模型“看见施工”,而是让 Driving Policy 在施工改变道路拓扑时仍能生成保守、可执行的轨迹。
驾驶员接管片段回灌训练
接管片段是闭环里最珍贵也最容易误用的数据。珍贵在于它明确指出模型在真实道路上失败或不被信任;容易误用在于接管原因不一定是模型错,可能是驾驶员过度谨慎、法规要求、传感器遮挡、舒适性差或测试员策略变化。
合理做法是保存接管前后 10 到 30 秒的多模态数据、模型输出、候选轨迹、安全壳状态和人类修正动作。回灌时先分类:感知漏检、预测错误、规划过激、控制不可行、地图冲突、交互语义误解。不同类别进入不同训练路径:感知问题补标签,规划问题做模仿学习和困难样本重采样,控制不可行问题改安全壳和可行性反馈,地图冲突则进入地图与在线感知融合流程。
图4: 城市路口、极端天气、施工场景和接管片段都要从触发、标签、训练目标和回灌指标上分别设计。
7. 工程难点:数据、算力、延迟、安全、量产成本
数据难点首先是偏置。车队数据天然集中在已开放城市、常见天气、常见道路和安全驾驶员愿意覆盖的区域。长尾数据少,且越危险越难采。第二是标签一致性:同一个施工绕行片段,不同标注员可能给出不同可行区域和让行解释。第三是隐私和合规,车端采集会包含人脸、车牌、位置和行为轨迹,必须在上传、脱敏、访问和留存上有硬约束。
算力和延迟难点在于闭环跨车端和云端。车端需要低延迟触发和缓存,不能因为记录数据影响实时驾驶;云端需要大规模检索、自动标注、训练和仿真,成本会随多模态数据急剧上升。VLM 和 World Model 适合离线标注、生成和评估,车端 Driving Policy 和安全壳则需要确定性调度。芯片平台的关键不只是 TOPS,还包括视频编解码、内存带宽、热设计、安全岛和日志写入能力。
安全难点在于闭环可能引入回归。把接管片段重采样加入训练集,可能修复施工绕行,却让普通车道保持变得过于保守;用仿真生成雨雪场景,可能提高天气鲁棒性,却让清晰天气下的速度策略偏慢。因此每次模型更新都要有分桶回归:城市、天气、道路类型、交通密度、ODD、接管类别和安全壳介入原因都要分开看。
量产成本来自长期运营。数据上传、标注团队、训练集治理、模型版本管理、仿真集维护、灰度车队、质量审计和法规留痕都要持续投入。真正的壁垒不只是一次性训练出大模型,而是能以稳定成本持续发现问题、修复问题、证明修复有效,并避免新版本引入不可接受风险。
8. 产业判断与落地边界
产业判断很明确:端到端路线越深入,数据闭环越重要。感知、预测、规划接口减少后,很多能力不再来自规则堆叠,而来自训练数据覆盖和反馈效率。谁能把车队里的接管、低置信、施工、天气和城市差异快速变成高质量样本,谁就能更快跨城市、跨车型、跨 ODD 扩展。
但边界同样清楚。第一,数据闭环不能替代安全壳,模型学得再好也要受碰撞、法规、ODD 和线控能力约束。第二,仿真和世界模型不能替代真实道路,它们更适合扩展变量和做反事实评估。第三,VLM 不能因为会解释场景就直接控制车辆,它更适合标注、检索、风险解释和低频决策辅助。第四,闭环不能只优化接管率,还要看舒适性、法规一致性、可解释性、故障降级和量产成本。
9. 小结
数据闭环是端到端自动驾驶真正的护城河,因为它决定模型能否从真实道路中持续学习。采集解决“看见什么”,筛选解决“什么值得学”,标注解决“怎么学”,训练解决“学到什么”,仿真和回归解决“有没有副作用”,灰度回灌解决“真实道路是否变好”。
工程落地建议是:
第一,从接管、低置信和安全壳改写建立最小闭环,不要一开始追求全量数据湖;
第二,把城市路口差异、极端天气、施工场景和接管片段做成固定场景族和回归集;
第三,用 VLM 提高语义检索和标注效率,用 World Model 做反事实扩展,但保留真实道路验证;
第四,把闭环指标绑定到同类场景接管率、冲突率、不确定性和安全壳改写率。数据闭环做不好,端到端只是一次模型发布;数据闭环做成了,车队每一天都在把道路经验转化为下一版模型能力。