导语:2026年5月,特斯拉FSD(监督版)车队行驶总里程突破100亿英里(约160.93亿公里),这是马斯克年初设定的“无监督自动驾驶”数据门槛。同期,华为乾崑智驾累计辅助驾驶里程突破100亿公里,小鹏“云端模型工厂”的训练视频数据量从2000万clips向2亿clips迈进。
当端到端算法架构逐步趋同,自动驾驶的竞争重心早已从 “算法创新” 转向 “体系化能力”:算法可以快速复刻,但数据资产、算力基建与闭环效率无法速成。真正的护城河,从来不是 “有多少数据”,而是一套覆盖采集、筛选、标注、训练、仿真、部署的精密工程体系。本文基于 2025-2026 年行业最新公开进展,拆解数据闭环的底层逻辑、技术跃迁与产业格局。
一、数据闭环:自动驾驶的"飞轮效应"
数据闭环(Data Loop / Data Engine)是自动驾驶系统的“自进化机制”机制。其本质是通过真实驾驶数据持续发现系统短板,再通过模型迭代修复短板,最终形成 “数据越多→能力越强→数据越多” 的飞轮效应。
标准闭环的完整链路为:车辆采集数据 → 智能筛选回传 → 自动标注/清洗 → 模型训练 → 仿真验证 → OTA部署 → 车辆继续采集新数据
上图展示了Waymo的"ML Factory for Self Driving Models"[1]:数据从车辆传感器日志进入系统,经过数据挖掘/主动学习筛选有价值样本,由标注员(或自动标注系统)创建标注数据,用于模型开发,模型经过测试验证后部署到车辆,车辆继续收集数据,最终形成完整闭环。为什么数据闭环如此重要?
自动驾驶面临的核心挑战是长尾分布(Long-tail Distribution):99% 的常规驾驶场景可以通过有限数据快速覆盖,但真正决定系统安全边界的,是占比不足 1% 的极端 Corner Case(如逆行车辆、掉落货物、极端天气)。数据闭环的目标,就是持续发现并解决这1%的问题。
但数据价值并非线性增长:前 10% 的核心场景,仅需亿级里程即可完成覆盖;而剩余的长尾场景,每提升 1% 的覆盖率,都需要指数级增长的数据量支撑。当行业集体迈入百亿里程时代,单纯堆砌行驶里程的 “粗放式闭环” 边际收益正在快速递减,竞争的核心已经转向 “高价值数据的挖掘效率”。
关键洞察:2026年,数据闭环已从"采集-标注-训练"的线性流程,演进为"世界模型+强化学习"的生成式闭环。传统闭环依赖真实路测发现问题,周期长、成本高;而新一代闭环通过 3D 重建与生成式 AI,将真实场景转化为可编辑、可遍历的仿真环境,在虚拟空间中批量生成长尾场景、完成策略优化,再反哺真实系统。例如 NVIDIA Omniverse 合成数据引擎基于 3D Gaussian Splatting 技术,可将真实路测数据自动重建为可交互仿真场景,手工建模成本降低超 90%,大幅缩短了场景迭代周期[2]。
二、数据闭环的六大环节与技术演进
一个成熟的数据闭环包含六个关键环节,每个环节在2025-2026年都发生了技术跃迁:1. 数据采集(Collection):从"大海捞针"到"精准钓鱼"
并非所有数据都有价值。车端需要进行触发式智能筛选(Trigger-based Collection):当系统检测到不确定性高、预测偏差大、或预定义的特殊场景(如急刹、接管、施工路段)时,才触发数据记录。- 特斯拉影子模式3.0:在人类驾驶员操控车辆时,FSD算法在后台同步运行并独立做出决策判断,但不控制车辆。系统实时比对算法判断与驾驶员实际操作,一旦两者出现显著分歧,自动触发数据回传。这种机制将人类驾驶员的日常操作作为免费的真值参照[3]。
- 小鹏汽车:在具备数采能力的车辆上设置超300个触发信号,系统可判断当前怎样的Corner Case是对系统有用的,然后上传[4]。
- 华为乾崑:通过量产车数据采集网络与云基础设施配合,实现端云协同的定向数据筛选,其智驾数据闭环模型可以低成本、快速获取高价值训练和仿真数据[3]。
2. 数据回传(Upload):带宽与合规的双重挑战
车端数据通过4G/5G网络回传至云端。涉及数据压缩、脱敏、安全加密等技术。特斯拉拥有超过400万辆搭载HW3.0/HW4.0的车辆,构成全球最大的数据回传网络。中国特有的数据合规壁垒:《汽车数据安全管理若干规定(试行)》对地理信息、车辆运行数据等提出严格限制,跨境传输受到管制。这意味着国内车企无法简单复制特斯拉的全球数据闭环模式,必须建立本土化的数据存储与处理体系[5]。3. 数据标注(Labeling):从人工标注到AI自动标注
标注是数据闭环中人力成本最高的环节。传统方式依赖人工标注,成本高昂。2025-2026年的技术突破在于自动标注(Auto-Labeling)[6]:- 自动标注普及:特斯拉的多摄像头自动标注系统,将 8 路视频的同步标注成本大幅压缩,支撑了 FSD 的周更节奏;国内中汽创智等人机协同标注系统,自动化率超 90%,人工介入率可降至 8%。
- 端到端范式重构标注逻辑:端到端模型无需分模块标注,仅需人类驾驶轨迹、车辆状态序列即可作为监督信号,标注成本较模块化时代下降 90% 以上,海量驾驶日志可直接转化为训练数据。
需要澄清的是,Google 的 SimCLR 属于自监督对比学习框架,其 “1% 标注达到全监督 92% 准确率” 的结论来自 ImageNet 通用图像分类任务,无法直接套用到自动驾驶多模态感知、预测场景中。智驾场景的标注维度、空间精度要求远高于通用分类,自监督学习更多用于模型预训练以降低标注依赖,而非替代全量监督。4. 模型训练(Training):算力军备竞赛进入EFLOPS时代
在云端GPU集群进行模型训练。2025-2026年,车企算力储备呈现“指数级跃迁”。为便于横向对比,以下统一采用FP8 精度下的有效训练算力(EFLOPS)作为对标口径: | | |
|---|
| 特斯拉 | 超 230 EFLOPS(等效 H100,两处 AI 训练集群) | |
| 华为乾崑 | 60 EFLOPS(ADS 5,2026 年 4 月) | |
| 小鹏汽车 | | |
| 理想汽车 | 13 EFLOPS(3EFLOPS 推理 + 10EFLOPS 训练) | |
| 蔚来汽车 | 端云联合算力超 306.9 EOPS(2024 年 7 月) | |
注:蔚来公布的 “端云联合算力 306.9 EOPS” 为混合口径,包含端侧推理、整数运算等多维度算力,与云端训练算力不属于同一统计维度,仅供参考。
算力对比:特斯拉2026年Q1财报显示,其两处用于AI训练的超级计算集群总共储备了超过23万张H100等效GPU能力,合计对应的训练算力储备超过230 EFLOPS。横向对比,华为乾崑ADS 5公开披露的云端算力为60 EFLOPS,小鹏"云端模型工厂"为10 EFLOPS。特斯拉在云端训练基础设施上的储备仍然明显领先。
5. 仿真验证(Simulation):从"重建"到"生成"的范式转移
真实路测成本高、周期长、危险性大。2025-2026年,仿真技术呈现"重建占比逐步降低、生成式仿真占比持续提升"的趋势:- 理想汽车 Hierarchy UGP 4D 动态重建模型(ICCV 2025 收录):通过根、子场景和图元三层结构,用 4D 统一高斯图元实现大规模动态场景的精准建模,在 Waymo 数据集上达到 SOTA 水平 [2]。
- 商汤绝影开悟智能驾驶世界模型:2024 年推出,2025 年 7 月正式发布生成式世界模型产品平台,可覆盖加塞、碰撞预警、占道急刹、环岛绕行等 20 余类核心危险场景的全链路仿真 [12]。
- 英伟达 Omniverse:基于 3D Gaussian Splatting 技术,可将真实路测数据自动重建为可交互仿真场景,将手工建模成本降低 90% [2]。
6. 车端验证与OTA部署(Deployment):灰度验证与快速迭代
模型通过仿真测试后,需经过 “内部测试车→小批量灰度用户→全量 OTA” 的三级验证,确保无性能回退与安全风险后,再推送给全量用户。闭环效率的核心指标,是从发现一个 Corner Case 到完成 OTA 修复的全周期:2023 年行业平均周期约 30 天,2026 年头部队伍已压缩至 3-7 天。其中小鹏 “云端模型工厂” 实现平均 5 天一次全链路迭代,华为乾崑 ADS 5 迭代周期可缩短至 4 天 [9]。
三、影子模式:特斯拉的"秘密武器"与进化
在所有数据闭环策略中,特斯拉的影子模式(Shadow Mode)最为独特,也最具争议。2026年3月,特斯拉官方确认影子模式已进化到第三代。- 车辆在人工驾驶模式下,自动驾驶系统仍在后台“影子运行”
- 系统实时计算“如果是我,会怎么开”,并与人类驾驶员的实际操作对比
- 近期更新的“强制接管原因填写功能”,为每一条接管数据赋予明确的分类标签,进一步提升数据标注质量
需要澄清的是,影子模式并非全量回传所有分歧数据:车端会经过至少 3 层价值筛选,最终回传比例不足万分之一,避免无效数据占用带宽与存储资源。影子模式的价值:
- 被动数据变主动数据:不需要专门的测试车队,每一辆特斯拉都是数据采集车
- 自然分布覆盖:数据来自真实驾驶场景,而非人工构造的测试场景
- 持续发现 Corner Case:人类驾驶员的“干预”本身就是系统失败的信号
影子模式的争议:
- 隐私问题:持续记录车辆周围环境(包括其他车辆、行人、车牌)引发隐私担忧
- 数据偏见:人类驾驶员并非总是正确的,模型可能学到人类的不良驾驶习惯
- 地域差异:中国交通场景与美国差异巨大,特斯拉在中国的影子模式数据价值有限
数据规模:截至2026年5月,特斯拉FSD(监督版)车队行驶总里程已突破100亿英里(约160.93亿公里),4月下旬日均行驶里程约2900万英里(约4667.1万公里),较年初的1400万英里翻倍 [13,14]。
四、中国车企的数据闭环:各具特色的"中国路径"
与特斯拉单一的纯视觉全球闭环路线不同,中国车企基于本土市场特征,演化出四条差异化的数据闭环路线,各有侧重与优势。1. 华为乾崑:生态协同的"数据飞轮"
- 数据规模:截至 2026 年 4 月,累计辅助驾驶里程突破 100 亿公里,搭载车辆超过 190 万辆,预计到 2026 年底将达 300 万辆 [13]。
- 算力投入: 2026 年智驾领域研发投入超 180 亿元(其中算力投入近百亿元),未来 5 年累计投入 700-800 亿元。
- 技术特色:ADS 5 采用新一代端到端智驾架构,云端引入多智能体博弈强化学习,车端叠加安全风险场技术;依托多车企合作的 “朋友圈” 生态,快速扩大数据底盘,实现场景的快速覆盖。
2. 小鹏汽车:规模法则的激进验证者[9]
- 数据规模:训练基座模型的视频数据量已达 2 亿 clips,完成量级跨越。
- 算力储备:10 EFLOPS,集群利用率常年高达 90% 以上,高峰时期运行效率达 98%。
- 技术突破:首次验证规模法则(Scaling Law)在自动驾驶 VLA 模型上持续生效,模型参数量越大、数据越多,性能越强。已启动 720 亿参数超大规模世界基座模型研发,参数量是主流端到端模型的数十倍,走大模型、大数据的激进技术路线。
3. 理想汽车:VLA架构与生成式数据 [10,15]
- 数据规模:截至 2025 年 8 月,用户辅助驾驶总里程达 49 亿公里;截至 2025 年 11 月,累计收集近 15 亿公里有效驾驶数据。
- 算力储备:13 EFLOPS(3 EFLOPS 推理 + 10 EFLOPS 训练),拥有 5 万张训练和推理卡。
- 技术特色:世界模型采用 “真实重建 + AI 生成” 双路线,生成数据占比约 10% 且持续提升;可模拟天气、光照变化,批量生成危险场景,平衡训练数据的场景分布,缓解长尾场景数据稀缺问题。
4. 蔚来汽车:群体智能与世界模型 [11]
- 数据规模:截至 2024 年 7 月,智能驾驶累计行驶里程超 11.29 亿公里;NT2.0 平台车型超 20 万台,每月获取 500 万 + 接管数据。
- 技术特色:NWM(NIO World Model)世界模型具备“空间 + 时间”双重理解能力,能在 100 毫秒内推演 216 种可能场景。2026 年 6 月推送全新版本,升级为“世界模型 + 监督微调 + 闭环强化学习”三层架构,超 70 万用户同步升级。
整体来看,四大路线形成了清晰分野:华为靠生态扩规模,小鹏靠大模型冲上限,理想靠生成式补长尾,蔚来靠用户群体做精细化迭代。
五、数据引擎的"中国困境"与突破
国内车企在数据闭环上面临独特挑战,但也正在形成差异化突破:1. 数据合规壁垒 [5]
中国《汽车数据安全管理若干规定(试行)》对地理信息、车辆运行数据等提出严格限制,跨境传输受到管制。这意味着国内车企无法简单复制特斯拉的全球数据闭环模式,必须建立本土化的数据存储与处理体系。数据跨境管制看似提高了行业门槛,实则构成了本土车企的制度性优势:外资品牌无法将中国区数据接入全球训练体系,中国市场的模型迭代只能依赖本土数据池,闭环效率被大幅拆分;而本土车企可以完整覆盖中国全场景数据,在本土化适配上天然领先。从长期看,基于中国复杂场景训练的模型,在东南亚、中东等新兴市场的泛化能力反而更强,形成 “中国场景→全球输出” 的逆向优势。2. 数据孤岛与标准化 [6]
不同品牌、不同传感器配置的数据标准不一,曾是行业规模化的核心阻碍。当前行业正在推动《智能驾驶数据标注标准 V3.0》等统一规范,明确定义 32 类核心标注要素;同时华为、百度等平台型企业通过输出完整工具链,推动行业数据格式、标注规范的统一,数据孤岛问题正在逐步缓解。3. 标注成本与自动化 [6]
中国道路的复杂性(混合交通、非标道路、密集行人)导致标注难度和成本远高于美国。传统模式下,标注一帧数据成本约17元,50万帧标注需850万元。自动标注技术将成本从每帧0.5美元降至0.02美元,但开放世界场景的泛化能力仍是瓶颈。4. 算力缺口与国产化 [16]
训练大模型需要万卡级GPU集群。特斯拉拥有Dojo+英伟达双集群,国内车企的算力储备仍有差距。但华为、小鹏等正在通过自研芯片(如华为昇腾、小鹏图灵芯片)和国产化算力布局,降低对英伟达的依赖。
六、思考:数据闭环的终极形态与现实约束
数据闭环的终极形态,可能是“世界模型驱动的自进化系统”:1. 世界模型成为闭环核心基座
未来的闭环体系中,世界模型将承担三大核心职能:区域级仿真评估、合成数据生成、强化学习环境引擎,成为连接虚拟训练与真实行驶的核心纽带。VLA(视觉-语言-行动)模型与世界模型深度融合,前者负责复杂语义理解与人机交互,后者负责长尾场景生成与长时序决策推理 [2]。2. 生成式仿真占比持续提升
未来,仿真技术将呈现“重建占比逐步降低、生成式仿真占比持续提升”的趋势,最终将实现90%以上训练场景由AI自动生成,而非依赖真实路测数据 [2]。3. 从“数据驱动”到“知识驱动”
当前的数据闭环依赖海量人类驾驶数据,但人类驾驶行为并非最优。未来的方向是通过强化学习(RL)和自我对弈(Self-Play),让模型在虚拟环境中自主探索最优策略,而非简单模仿人类。小鹏的“云端模型工厂”已采用强化学习+模型蒸馏的技术路线,蔚来NWM新版本也引入闭环强化学习 [4,17]。4. 数据资产的价值重估
当智驾成为标配,单纯靠软件订阅收费的模式将面临挑战。数据资产的价值将更多体现在:- 模型性能壁垒:谁的数据闭环效率更高,谁的模型迭代更快
- 安全认证门槛:L3/L4 法规要求充分的数据验证与仿真测试
- 生态协同效应:华为通过扩大数据“朋友圈”规模,特斯拉通过车队规模建立壁垒
六、结语
数据闭环不是“有多少数据”的问题,而是“如何高效利用数据”的问题。特斯拉的100亿英里、华为的100亿公里、小鹏的2亿clips,这些数字背后是一场关于算力、算法、工程能力的综合较量。在端到端时代,数据资产的重要性只会愈发凸显。算法可以复制,但数据无法速成。而当世界模型与生成式仿真成熟,自动驾驶或许将真正摆脱对“人类驾驶数据”的依赖,走向自主进化的智能体时代。
从“数据闭环”到“决策自进化”:无人驾驶的智能跃迁
参考链接汇总
[1] Active Learning, Data Selection, Data Auto-Labeling, and Simulation in Autonomous Driving — Part 3
https://kargarisaac.medium.com/active-learning-data-selection-data-auto-labeling-and-simulation-in-autonomous-driving-part-3-24e2711e2ba3
[2] NVIDIA吴新宙:世界模型是自动驾驶最本质的一环
[4] 小鹏汽车启动720亿参数自驾基模研发,初步验证自动驾驶规模法则
https://www.xiaopeng.com/news/company_news/5462.html
https://www.gov.cn/zhengce/zhengceku/2021-09/12/content_5640023.htm
[6] 国家数据局:强化数据标注、数据合成等核心技术攻关
https://sh.ccic.com/xwdt/yndt/art/2025/art_b9e97a55a0434b26ba2882b38aff46e7.html
[7] 中国自动驾驶追赶美国?经验主义的评价已经过时
[8] 60EFLOPS云端算力:华为乾崑如何加速自动驾驶进化
https://www.toutiao.com/article/7633436239219180032/?wid=1784613487116
[9] 小鹏汽车启动720亿参数自驾基模研发,初步验证自动驾驶规模法则
https://www.xiaopeng.com/news/company_news/5462.html
[10] VLA司机大模型筑基 理想向“具身智能企业”战略升维
https://www.ncsti.gov.cn/kjdt/kjrd/rgzn_kjrd/202601/t20260130_236833.html
[11] 智能汽车系列深度(十九):从小鹏、理想、蔚来布
局,看自动驾驶发展趋势
https://pdf.dfcfw.com/pdf/H3_AP202408201639367464_1.pdf
[12] 2025 NOA标配化普及与精细化深耕并行,2026 竞争格局添核心变量
https://www.eefocus.com/article/1954504.html
[13] 特斯拉 FSD 行驶里程突破 100 亿英里,马斯克“无监督自动驾驶”数据里程碑达成
https://www.ithome.com/0/946/230.htm
[14] 各智驾企业是如何进行数据飞轮工程落地的?
https://www.leiphone.com/category/transportation/jfZtoB9s9gld1xyI.html
[16] 马斯克:特斯拉将重启Dojo 3超级计算机项目
https://finance.sina.com.cn/stock/t/2026-01-19/doc-inhhuzix2873811.shtml
[17] 蔚来世界模型全新版本开启推送,超70万用户同步升级
https://finance.sina.com.cn/roll/2026-06-18/doc-inicuupv6630142.shtml