一、本周关键新技术速览
技术/论文 | 核心突破 | 意义 |
MindDrive: VLA via Online RL | 首次将在线强化学习应用于VLA模型,LLM配备两组LoRA(决策专家+动作专家),离散语言决策替代连续动作空间探索 | Bench2Drive DS 78.04/80.59,开创VLA+RL新范式 |
FlowAD: Ego-Scene Interactive Modeling | 显式建模自车运动对未来观测的反馈,将自车-场景交互表示为相对于自车的场景流 | nuScenes碰撞率降低19%,ICLR 2026,端到端新视角 |
ResWorld: Temporal Residual World Model | 时序残差世界模型,将动态物体与静态背景分离建模 | ICLR 2026,提升端到端驾驶的长时预测精度 |
VLGA: Vision-Language-Geometry-Action | 首次将3D几何作为独立模态引入VLA,构建统一几何动作空间 | 解决VLA空间推理能力不足的根本短板 |
GuideFlow: Constraint-Guided Flow Matching | 首个基于约束流匹配的端到端规划框架,显式嵌入安全约束 | NavHard EPDMS 43.0 SOTA |
VADv2: Vectorized Scene Representation | 向量化场景表示v2版本,端到端统一范式 | ICLR 2026,显著提升推理速度 |
DriveVLA-W0: World Models Amplify Data Scaling | 世界模型预测未来图像生成密集自监督信号,放大VLA数据缩放定律 | ICLR 2026,解决VLA监督赤字问题 |
LVLDrive: LiDAR-Vision-Language | 将LiDAR点云作为额外模态引入VLM,提升3D度量空间理解 | CVPR 2026 Workshop |
工业动态
发布日期 | 公司/产品 | 技术/动态 | 关键进展 | 影响 |
2026-06-29 | 特斯拉 FSD v14 Lite | HW3重大升级 | 将HW4 V14驾驶行为蒸馏至HW3,支持泊车/倒车/速度配置/目的地选项 | 数百万HW3车主获得核心功能,为无监督FSD铺路 |
2026-07-01 | 小鹏汽车 | 6月交付及GX产能 | 6月交付40,126台,GX第10,000台下线,MONA L03首秀 | 品牌高端化突破,L4 Robotaxi量产车型落地 |
2026-06-30 | 华为乾崑 ADS 5.0 | 行业总结 | WEWA 2.0架构,896线激光雷达 | 2026年超80款车型搭载 |
2026-06-16 | 理想汽车 | 马赫VLA规划 | 第三季度推送新版本,第四季度能力对齐特斯拉FSD V14 | 全栈自研芯片+算法+系统,具身智能落地加速 |
二、值得关注的研究方向
1.VLA与强化学习的融合: MindDrive(ECCV 2026)首次将在线强化学习引入VLA框架;DriveVLA-W0(ICLR 2026)用世界模型生成自监督信号解决VLA监督赤字。VLA正从模仿学习向试错学习+世界模型增强的双轨进化。
2.自车-场景交互建模: FlowAD(ICLR 2026)显式建模自车运动对未来观测的反馈,将交互表示为场景流。这是端到端自动驾驶从”静态感知”向”动态交互”的范式转变,碰撞率降低19%验证了该方法的有效性。
3.时序残差世界模型: ResWorld(ICLR 2026)将动态物体与静态背景分离建模,提升长时预测精度。世界模型正从统一架构走向精细化建模,为安全关键型决策提供更可靠的环境推演。
4.端到端自动驾驶的量产落地: 特斯拉FSD v14 Lite向HW3推送,华为ADS 5.0、小鹏XNGP 4.0均实现端到端架构上车,L3级量产成为2026年行业核心主题。
三、行业动态
头部公司动态
·特斯拉: FSD v14 Lite于6月29日正式向HW3车主推送(固件2026.20.5.1),通过蒸馏将HW4 V14驾驶行为迁移至HW3。v14.3.4于6月26日推送,升级强化学习训练阶段、神经网络视觉编码器(MLIR重写,反应时间快20%)。北美Robotaxi已扩展至奥斯汀全都会区。订阅制统一为$99/月。
·华为: 乾崑ADS 5.0采用WEWA 2.0架构,搭载896线双光路激光雷达。2026年预计超80款车型搭载。
·小鹏: 6月交付40,126台(+15.9% YoY),Q2累计103,295台。GX上市即爆款,6月交付6,739台,7月1日第10,000台下线。L4 Robotaxi基于GX量产,搭载4颗自研图灵芯片,本地3000TOPS。
·小米: MindDrive(ECCV 2026)被接收,Bench2Drive DS 80.59。此前14篇论文入选CVPR 2026(DriveLaW世界模型、ParkGaussian泊车重建、SimScale仿真等),3篇入选ICLR 2026。小米XLA基础模型已于2026年3月发布。
·百度: 与上海交通大学合作的FlowAD(ICLR 2026)提出自车-场景交互建模,碰撞率降低19%。百度Apollo持续迭代,L4 Robotaxi在全国多城运营。
·理想: 马赫VLA三季度推送新版本,四季度对齐特斯拉FSD V14。MindVLA-o1采用原生3D ViT。
技术路线观察
·VLA路线分化与融合: 小鹏坚持VLA量产,华为坚持WA世界行为模型,小米MindDrive以VLA+RL开辟新路径,DriveVLA-W0以世界模型增强VLA。多条路线并行探索,尚未收敛。
·世界模型精细化: ResWorld的时序残差建模、FlowAD的自车-场景交互、DriveVLA-W0的自监督信号生成,代表世界模型从统一架构向精细化、任务导向演进。
·L3商用加速: 工信部首批L3准入牌照已发放,2026年成为L3量产元年。
监管与政策
·中国:工信部首批L3车型准入已发放,23城完成L3路测认证。
·美国:德州奥斯汀允许特斯拉Robotaxi无监督测试,NHTSA持续调查FSD事故。
·欧洲:WP.29批准DCAS UNR 171 series 02,2026年底生效。何小鹏明确提及此法规,预示2026年底自动驾驶可合法进入欧盟市场。
四、本周推荐论文详解(3篇)
论文1:【学术型】FlowAD
发布日期: 2026-06
机构: 上海交通大学、百度 -
发表: ICLR 2026
主要内容
提出FlowAD,一种自车-场景交互建模框架。与传统方法孤立处理每个时间戳不同,FlowAD显式建模自车运动对未来观测的反馈,从根本上提升对驾驶过程的理解和规划能力。受人类感知启发,FlowAD将自车-场景交互表示为相对于自车的场景流,在潜在特征空间内捕捉相对运动。这使得可以使用现有的log-replay数据集建模自车运动反馈,无需复杂的场景仿真。
核心创新点 1. 显式建模自车运动对未来观测的反馈,而非孤立处理每个时间戳。 2. 将自车-场景交互表示为场景流,在潜在特征空间内捕捉相对运动。 3. 无需复杂仿真,利用现有log-replay数据集即可训练。
推荐理由/落地价值
FlowAD在nuScenes上实现碰撞率降低19%,FCP指标提升60%,Bench2Drive闭环驾驶分数51.77。对百度等工业界玩家而言,该方法可直接应用于端到端系统的规划模块,通过显式建模自车-环境交互提升系统在复杂城市路况下的安全性和舒适性。
论文2:【学术型】ResWorld
发布日期: 2026-06 - 发表: ICLR 2026
主要内容
提出ResWorld,一种时序残差世界模型用于端到端自动驾驶。核心思想是将动态物体与静态背景分离建模:通过时序残差建模,在潜在BEV空间中分离动态元素和静态背景。这与FRGB3D背景减除的概念相关,但应用于端到端规划的潜在空间。ResWorld提升长时域预测的精度和稳定性,为端到端驾驶提供更可靠的未来场景推演。
核心创新点 1. 时序残差世界模型,显式分离动态物体与静态背景。 2. 在潜在BEV空间中应用残差建模,提升长时预测精度。 3. 为端到端自动驾驶提供更可靠的未来场景推演能力。
推荐理由/落地价值
ResWorld在nuScenes开环和闭环评测中均表现优异。对自动驾驶产业而言,该方法可显著提升端到端系统在复杂动态场景下的预测能力,降低碰撞风险,是 world model 从统一架构向精细化建模演进的重要里程碑。
论文3:【工业落地型】MindDrive
发布日期: 2026-06-20
机构: 小米EV、华中科技大学
发表: ECCV 2026
主要内容
当前VLA范式主要依赖模仿学习(IL),存在分布偏移和因果混淆等固有问题。MindDrive提出一种VLA框架,为LLM配备两组独立的LoRA参数:一组作为决策专家(Decision Expert),负责场景推理和离散语言驾驶决策;另一组作为动作专家(Action Expert),将语言决策动态映射为可行轨迹。通过将轨迹级奖励反馈到推理空间,MindDrive在有限离散语言决策集上实现试错学习,而非直接在连续动作空间操作。
核心创新点 1. 首次将在线强化学习应用于VLA模型,解决模仿学习的分布偏移与因果混淆。 2. 提出”语言即动作”范式,用离散语言决策替代连续动作空间探索,大幅提升RL探索效率。 3. 双专家LoRA架构:决策专家负责高层推理,动作专家负责低层轨迹生成。
推荐理由/落地价值
MindDrive在Bench2Drive上取得DS 78.04(0.5B)和80.59(3B)的SOTA成绩,是首个验证在线RL对VLA有效性的工作。对小米及其他车企而言,该方法可直接应用于VLA模型的后训练阶段,通过RLHF式迭代提升驾驶策略的鲁棒性和安全性。
参考文献:
1.Guo, M. et al. FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving. ICLR, 2026.
2.Zhang, J. et al. ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving. ICLR, 2026.
3.Fu, H. et al. MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning. ECCV, 2026.
4.Li, Y. et al. DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving. ICLR, 2026.
5.VADv2: Vectorized Scene Representation for Efficient Autonomous Driving. ICLR, 2026.
6.Wei, W. et al. Spatial-aware Vision Language Model for Autonomous Driving. CVPR Workshop, 2026.
7.VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving. arXiv:2606.12396, 2026.
8.Liu, L. et al. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving. CVPR, 2026.
9.特斯拉FSD v14 Lite发布说明. Tesla Oracle, 2026-06-29.
10.小鹏汽车2026年6月交付公告. 小鹏集团, 2026-07-01.
11.华为乾崑智驾ADS 5.0发布. 新浪财经, 2026-06-30.
12.小米多篇论文入选CVPR 2026. 新浪财经, 2026-05-16.