一、本周关键新技术速览
学术前沿
发布日期 | 技术/论文 | 核心突破 | 意义 |
2026-07-09 | Post-Training in End-to-End Autonomous Driving | 提出端到端自动驾驶的后训练范式 | 为E2E模型提供系统化的后训练优化框架 |
2026-07-20 | SparseDriveV2: Scoring is All You Need | 可扩展离散词表+打分策略,证明离散动作空间可达SOTA | ECCV 2026接收,端到端量产路径新选择 |
2026-04-10 | VLA-World: VLA World Models for AD | 统一预测想象与反思推理的VLA世界模型 | 弥合VLA与世界模型的鸿沟,提升驾驶预见性 |
2026-06 | DLWM: Dual Latent World Models | 双潜在世界模型+高斯中心预训练 | CVPR 2026,世界模型预训练新范式 |
2026-02 | NoRD: Data-Efficient VLA without Reasoning | Dr.GRPO算法,仅需40%数据+无推理标注 | CVPR 2026,降低VLA训练成本门槛 |
工业动态
发布日期 | 公司/产品 | 关键进展 | 影响 |
2026-07-28 | 华为乾崑ADS 5 | WEWA 2.0架构,新增漫游巡航、后向防撞等 | 全球最大规模城区领航OTA,软件定义汽车标杆 |
2026-07-28 | 萝卜快跑 | 全球首个右舵全无人测试,携手Uber/Lyft入伦敦 | 右舵市场 breakthrough,与Waymo正面交锋 |
2026-07-26 | 特斯拉FSD | Robotaxi车队搭载v15,累计38万英里无人监督 | FSD迭代加速,Robotaxi扩张在即 |
二、值得关注的研究方向
1. 端到端自动驾驶的量产落地
华为ADS 5基于WEWA 2.0架构开启全球最大规模城区领航OTA;特斯拉FSD v15早期版本已在Robotaxi车队运行,规划七项重大改进;学术端SparseDriveV2证明离散动作空间在覆盖足够广泛时可达甚至超越连续空间性能,为车端部署提供新思路。端到端正从"技术验证"进入"规模交付"阶段。
2. VLA大模型在自动驾驶中的应用
VLA-World将视觉-语言-动作模型与世界模型统一,通过自生成未来帧进行反思推理;NoRD仅需40%训练数据且无推理标注即可达到竞争性性能。VLA方向正从"堆数据"转向"提效率",数据高效与推理轻量化成为新焦点。
3. 世界模型与仿真技术
Waymo在CVPR 2026披露基于DeepMind Genie 3的世界模型训练框架(预训练→中期训练→后训练),全面借鉴LLM范式;华为WEWA 2.0云端引入多智能体博弈+在线强化学习,车端安全风险场理论降低碰撞风险50%。世界模型正从仿真工具升级为认知引擎,成为连接数据闭环与长尾泛化的核心基础设施。
三、行业动态
头部公司动态
特斯拉
FSD v15早期测试版已搭载于Robotaxi车队(改装版Model Y),累计完成超38万英里无人监督行驶,内部测试指标达目标。v15规划七项重大改进,当前已实现约40%。本月Robotaxi服务扩展至迈阿密、奥兰多、坦帕三座新城。FSD买断制取消,统一99美元/月订阅;北美付费用户达148万,新车选装率超半数。法国交通部长公开反对当前版本FSD在欧盟投入使用,FSD入华仍在等待审批。Q2交付超48万辆,同比增长约25%。
华为
7月16日乾崑媒体日公布ADS 5年度OTA路线图:7月推送V5.0(后向主动防撞、AR-HUD雨雾预警、RCA漫游巡航、守位泊车等),9-10月推送V5.X(会车倒车脱困、凹坑绕行),2027年初推送紧急逃生。基于WEWA 2.0架构,进化为面向自动驾驶的AI智能体。累计辅助驾驶里程突破128亿公里(预计年底达200亿),智驾搭载量超190万台(预计8月底破200万)。2026年研发投入180亿元,未来五年算力投入700-800亿元。启境GT7首发完整ADS 5。
萝卜快跑
7月23日获香港首个全无人驾驶测试牌照,7月27日启动全球首个右舵左行全无人测试。7月28日宣布携手Uber及Lyft旗下Freenow在伦敦启动公开道路测试,成为唯一进入伦敦Robotaxi测试的中国企业,将与Waymo正面交锋。全球27座城市落地,累计超2200万次出行。英国市场预计2027年起面向市民提供服务。
小鹏/理想/蔚来/小米
华为ADS 3.0以96.2分位列CNPP排名第一。2026年7月智驾系统稳定性排名:华为>理想>小鹏>蔚来>小米。智驾普惠化加速,华为ADS Pro增强版下探至15万级车型。高阶智驾收费持续收紧,回归合理定价。
技术路线观察
端到端路线分化
特斯拉纯视觉端到端(FSD v15)vs 华为多传感器融合+世界模型(WEWA 2.0)vs VLA路线(学术探索为主)。华为路线在安全性上更保守,云端博弈强度提升10倍,车端碰撞风险降低50%;特斯拉路线更激进,依赖数据规模与算力迭代。
L3商用加速 vs L4长期主义
华为ADS 5以L2+形式通过OTA实现功能持续进化,近200万辆车规模验证;萝卜快跑在L4层面实现全球化突破(香港全无人+伦敦测试)。两条路线并行:华为走"渐进式量产",萝卜快跑走"全球化运营"。
高阶智驾普惠化
华为智驾从高价位下探,ADS Pro增强版15万级车型标配。乾崑ADS Max高阶包7月1日起涨价(1.2万→1.6万),但新增智驾保障权益。行业整体从"功能竞赛"转向"体验定价"。
监管与政策
中国
7月全球首部L3级及以上自动驾驶统一技术法规由中国、欧盟、英国、美国等共同牵头发布,中国全程主导技术背景与核心依据编制。香港运输署批准首个全无人测试牌照,标志右舵市场破冰。
美国
特斯拉Robotaxi在加州湾区推出计划被CPUC叫停——特斯拉尚未申请必要许可证。FSD v15在Robotaxi车队运行属测试性质,大规模商业化仍待监管批准。
欧洲
法国交通部长明确反对当前版本特斯拉FSD入欧,担忧超速与驾驶员注意力涣散。英国《自动驾驶汽车法》2024年已通过,为萝卜快跑伦敦测试提供法律框架。
四、本周推荐论文详解(3篇)
论文1:Post-Training in End-to-End Autonomous Driving【学术型】
- 发布日期: 2026-07-09
主要内容
本文提出端到端自动驾驶的后训练(Post-Training)范式。传统端到端模型通常在大量数据上进行监督学习后部署,但面对真实世界中长尾场景和分布偏移时性能下降明显。作者系统研究了后训练阶段对E2E模型的优化方法,包括持续学习、对抗训练和领域自适应等策略,以提升模型在开放环境下的泛化能力。
核心创新点
1. 提出端到端自动驾驶的系统化后训练框架,填补E2E模型"训练-部署"间隙的方法论空白。
2. 设计针对驾驶场景的领域自适应机制,有效缓解仿真到真实(sim-to-real)的域差距问题。
3. 通过后训练优化,在不增加推理开销的前提下提升模型对长尾场景的鲁棒性。
推荐理由/落地价值
后训练是连接学术模型与工业部署的关键环节。本文框架可直接应用于已量产的端到端系统(如华为ADS、特斯拉FSD),通过OTA方式持续优化模型性能,而无需重新训练基础模型。对于自动驾驶售后技术服务体系,后训练提供了"轻量级迭代"路径,降低模型更新成本。
论文2:VLA-World: Learning Vision-Language-Action World Models for Autonomous Driving【学术型】
- 发布日期: 2026-04-10
主要内容
VLA-World提出一个简单但有效的VLA世界模型,统一预测想象(predictive imagination)与反思推理(reflective reasoning)以提升驾驶预见性。模型首先使用动作派生的可行轨迹引导下一帧图像生成,捕捉描述环境演化的丰富时空线索;随后对自生成的未来想象帧进行推理,细化预测轨迹。为支撑该流程,作者构建nuScenes-GR-20K生成推理数据集,并采用预训练→监督微调→强化学习的三阶段训练策略。
核心创新点
1. 首次将VLA模型与世界模型统一:VLA负责感知-推理-控制,世界模型负责未来场景生成,二者闭环迭代。
2. 动作引导的下一帧生成机制:用轨迹而非纯视觉预测驱动未来帧生成,提升时间一致性。
3. 三阶段训练策略(预训练/SFT/RL)与专用数据集nuScenes-GR-20K,为VLA世界模型研究提供基准。
推荐理由/落地价值
VLA-World弥合了VLA(强推理但弱时序)与世界模型(强预测但弱推理)之间的鸿沟。对工业界而言,该框架为"认知型智驾系统"提供了可落地的技术路径:车辆不仅能规划轨迹,还能"想象"未来并评估其合理性,这对安全关键场景(如交叉口博弈、行人意图预测)具有直接价值。
论文3:SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving【工业落地型】
- 发布日期: 2026-03(arXiv),2026-07-20宣布ECCV 2026接收
主要内容
端到端自动驾驶方法以传感器数据为输入直接输出轨迹。驾驶行为通常被建模为多模态分布。本文对多模态方法中的静态词表进行了规模研究,发现现有方法的性能瓶颈:动作空间覆盖不足时,离散词表方法性能受限。提出可扩展词表结构(scalable vocabulary structure)和可扩展打分策略(scalable scoring strategy),证明在对动作空间覆盖足够广泛的前提下,离散动作空间的静态词表类方法也可以达到甚至超越连续动作空间的动态生成类方法。
核心创新点
1. 首次系统量化离散动作词表规模对端到端性能的影响,发现"覆盖度"是核心瓶颈。
2. 提出可扩展词表结构与打分策略,使离散方法在足够大的词表下匹敌连续方法。
3. 为车端部署友好的离散化方案提供理论支撑——离散推理比连续生成更易加速和验证。
推荐理由/落地价值
离散动作空间在车端部署中具有天然优势:推理确定性高、易于通过形式化方法验证安全性、硬件加速友好。SparseDriveV2证明离散方案不必然是性能妥协,为量产端到端系统(尤其是资源受限的车规平台)提供了关键技术支持。智驾新程表示将以学术突破反哺产品迭代,加速端到端智驾方案的工程化落地与规模化量产。
参考文献
- Yang R, Wang M, et al. Post-Training in End-to-End Autonomous Driving. arXiv:2607.08072, 2026.
- Wang G, et al. VLA-World: Learning Vision-Language-Action World Models for Autonomous Driving. arXiv:2604.09059, 2026.
- neueHCT. SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving. ECCV, 2026.
- Rawal I, Gupta S, Hu Y, Zhan W. NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning. CVPR, 2026.
- Zhu Y, Xue Y, Zhang H, et al. DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving. CVPR, 2026.
- Wang Z, Jiang H, Dong S, et al. Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving. CVPR, 2026.
- Liao B, Chen S, Yin H, et al. DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving. CVPR 2025 Highlight.