一、本周关键新技术速览
学术前沿
发布日期 | 技术/论文 | 核心突破 | 意义 |
2026-07-09 | WCog-VLA: Dual-Level World-Cognitive VLA | 双层级世界认知VLA:语义层面Game-theoretic CoT推理 + 生成层面ADDT扩散模型合成多智能体轨迹 | NAVSIM PDMS 92.9 SOTA,从反应式驾驶转向主动式预测 |
2026-07-06 | PixelPilot: Scalable VLA | 解耦规划与提升范式:2D-to-2D规划在确定性提升到3D,GRPO策略优化 | 开环+闭环双SOTA,解决VLA收敛到ego-status trivial解的问题 |
2026-06 | ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving | 将VLM认知能力与扩散规划器结合,引入DiffGRPO强化学习微调 | NAVSIM和Bench2Drive SOTA,开源545+ Stars |
2026-06 | U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences | 不确定性感知的”由难到易”4D LiDAR生成策略 | CVPR 2026 Highlight,世界模型几何保真度提升 |
2026-06 | FastDriveVLA: Efficient End-to-End Driving via Token Pruning | 基于重建的视觉token剪枝框架,专为VLA模型定制 | nuScenes SOTA,FLOPs降7.5倍,预填充时间减3.7倍 |
2026-06 | Drive My Way: Preference Alignment of VLA for Personalized Driving | 个性化VLA驾驶策略,学习用户嵌入匹配长期驾驶风格 | CVPR 2026,推动人本化自动驾驶 |
2026-06 | VLA-World: Learning Vision-Language-Action World Models | 将世界模型能力内化为VLA原生能力,统一生成与推理 | 架构层面深度融合VLA与世界模型 |
工业动态
发布日期 | 公司/产品 | 关键进展 | 影响 |
2026-07-14 | 享界G9 (北汽新能源) | 获批北京市L3级自动驾驶道路测试牌照,时速120公里,北京市首款 | 北汽极狐、享界均完成L3全流程布局,抢占产业制高点 |
2026-07-09 | 小鹏汽车 | 何小鹏完成首单体验,线上叫车、自动接驾、行程送达首次跑通 | 从2025年11月官宣到内测仅8个月,L4商业化提速 |
2026-07-10 | 新浪汽车智驾评测 | 华为ADS 4.1断层第一(接管间隔608.5km),小鹏XNGP 5.0/理想AD Max 7.0位列T1 | 第三方实测验证头部玩家技术差距,纯视觉vs激光雷达路线分化明显 |
2026-07 | 小鹏汽车 | 无图城区NOA覆盖全国4万+城镇,实现”有路就能开” | 纯视觉路线覆盖效率领先,硬件成本下探至18万级 |
2026-07-16 | 特斯拉 | 在奥斯汀开始测试无方向盘无踏板Cybercab量产版 | Robotaxi商业化进入实测阶段,对标小鹏/waymo |
2026-07-01 | 深圳市 | 正式施行,首次授权”有序探索全域开放” | 地方立法为更大范围测试提供法律依据 |
2026-07-01 | 公安部 | 《智能网联汽车道路测试与示范应用安全通行规范》正式实施 | 全国统一安全规范落地,回应武汉萝卜快跑百车故障事件 |
二、值得关注的研究方向
1.端到端自动驾驶的强化认知与个性化: ReCogDrive和Drive My Way代表了VLA模型向”认知驱动”和”个性化适配”演进的方向。前者通过VLM+扩散规划器+DiffGRPO实现认知与规划的统一,后者通过学习用户嵌入实现长期驾驶风格匹配。这预示着端到端模型正从”通用驾驶能力”向”类人推理能力”和”千人千面”升级。
2.VLA与世界模型的架构融合: VLA-World和Wayve GAIA-3表明,世界模型不再是独立的外部仿真工具,而是正在内化为VLA的原生能力。轨迹感知条件化、统一生成与推理、GRPO端到端对齐等设计,让视觉生成始终服务于决策质量。这一趋势可能重塑自动驾驶训练范式——从”真实数据+仿真”走向”认知引擎内嵌”。
3.VLA模型的车端部署效率: FastDriveVLA针对VLA模型视觉token冗余问题,提出基于重建的剪枝框架,实现FLOPs降7.5倍、推理延迟大幅下降。在VLA大模型参数规模持续膨胀的背景下,轻量化与高效推理是量产落地的关键瓶颈,token剪枝、模型蒸馏、量化等技术将成为下一阶段竞争焦点。
三、行业动态
头部公司动态
·特斯拉: 2026年6月4日在中国大陆推出监督版FSD,支持城市与高速智驾。7月16日,无方向盘无踏板的Cybercab量产版在奥斯汀开始道路测试,配有安全监督员。FSD入华后算法针对密集路口、混行场景、非标准标识进行了本地化优化,更新周期预计比美国慢3-4个月。
·华为: 乾崑ADS 4.1在第三方实测中接管间隔达608.5公里,无保护左转成功率92%,稳居行业第一。奇瑞与华为引望签署L3/L4深度合作协议。享界G9于7月14日获批北京市120km/h L3路测牌照。
·小鹏: 第二代VLA物理AI大模型实现端到端直接映射,决策延迟压缩至80毫秒。XNGP 5.0于7月灰度推送,无图NOA覆盖全国4万+城镇。7月9日Robotaxi启动员工内测,何小鹏完成首单。何小鹏目标2026年8月对齐特斯拉FSD V14.2,并计划跳过L3直接推进L4。
·理想: 发布自研AI芯片马赫M100(1280 TOPS)与马赫VLA架构,目标2026年Q4对齐特斯拉FSD V14。AD Max 7.0在第三方评测中获评”家庭场景最优”,舒适性强但接管间隔153.7公里,弱于华为和小鹏。
·蔚来/小米/其他: 蔚来采用世界模型路线,自研神玑NX9031芯片已量产,搭载于ET9。小米汽车与天津大学合作VGGDrive(CVPR 2026),推进跨视角几何VLM。DeepRoute.ai CEO周光指出小模型”跷跷板效应”难题,行业须全面转向大模型和基座模型。
技术路线观察
·端到端路线分化: 纯视觉端到端(小鹏XNGP、特斯拉FSD)vs 多传感器融合+VLA(理想AD Max)vs 世界模型路线(华为ADS、蔚来NWM、Wayve GAIA-3)。第三方实测显示华为激光雷达融合方案在稳定性上断层领先,小鹏纯视觉方案在覆盖范围和成本上占优。
·L3商用加速 vs L4长期主义: 享界G9获批120km/h L3路测牌照,我国首部L3/L4强制性国标报批稿公示,拟2027年7月实施。小鹏直接跳过L3推进L4 Robotaxi。技术法规与商业落地节奏正在同步加速。
·高阶智驾普惠化: 小鹏P7+搭载XNGP起步价18.68万。第三方供应商市场中Momenta与华为形成”双强主导”,合计占第三方供应商约八成。城市NOA渗透率约15%,用户粘性仍待提升。
监管与政策
·中国: 深圳7月1日施行修订版智能网联汽车管理条例,首次授权”有序探索全域开放”。公安部GA/T 2388-2026于7月1日实施,统一道路测试安全规范。首部L3/L4强制性国标(报批稿)6月17日公示,引入Safety Case安全档案机制,拟2027年7月1日实施。北京自动驾驶示范区升级至3.0版本,覆盖600平方公里。
·美国: 特斯拉依据得州新法自我认证Model Y Robotaxi符合L4标准。NHTSA持续调查FSD安全性。Waymo在旧金山、洛杉矶、凤凰城部署第六代Waymo Driver,推出Premier会员计划(月费30美元)。
·国际: 中国、欧盟、英国、美国、加拿大和日本共同牵头的联合国自动驾驶系统全球技术法规于6月正式获批发布,为L3/L4跨区域准入提供统一框架。文远知行Robotaxi驶入全球第12城(西班牙、瑞士苏黎世计划)。
四、本周推荐论文详解(5篇)
论文1:【学术型】WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model主要内容
现有VLA模型要么缺乏全面的世界认知能力,要么世界预见能力碎片化,本质上被限制在反应式驾驶。WCog-VLA提出双层级世界认知VLA框架,成功桥接语义世界预测与生成式世界演化,实现主动式自动驾驶。在语义层级,WCog-VLA统一世界认知与推理,注入3D空间感知和agent token捕获世界动态,同时启用Game-theoretic Chain-of-Thought (Game-CoT)推理。在生成层级,引入Aligned Decoupled Diffusion Transformer (ADDT)作为强大的生成式世界模型,合成物理合理的多智能体联合轨迹。通过场景表征对齐,ADDT减少所需去噪步数,显著加速推理。构建85k Game-CoT标注的大规模数据集。NAVSIM基准测试PDMS 92.9 SOTA。
核心创新点 1. 双层级世界认知:语义层级(Game-CoT推理)+ 生成层级(ADDT扩散模型),实现从反应式到主动式驾驶的跨越 2. Aligned Decoupled Diffusion Transformer (ADDT):通过场景表征对齐减少去噪步数,加速推理 3. 85k Game-CoT标注数据集:为博弈论推理在自动驾驶中的应用提供数据基础
推荐理由/落地价值
WCog-VLA代表了VLA模型从”感知-反应”向”认知-预测-规划”的架构升级。Game-CoT引入博弈论推理,使VLA能够预测其他交通参与者的策略性行为,这是传统VLA缺乏的关键能力。NAVSIM 92.9的SOTA成绩验证了其有效性。ADDT的加速特性对车端部署具有直接价值。
论文2:【工业落地型】PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
发布日期: 2026年7月6日
主要内容
现有VLA模型通常从2D图像预测和优化3D轨迹,这种2D-to-3D预测与相机参数固有纠缠,导致跨异构驾驶数据集的数据可扩展性受限。此外,直接在3D空间优化导致严重的收敛到trivial解,VLA依赖ego-status而非视觉场景理解。PixelPilot提出解耦规划与提升范式:规划阶段将场景理解和轨迹预测重新表述为图像平面中的传感器无关2D-to-2D任务,便于跨多样数据集的可扩展训练;规划的2D轨迹仅在推理时确定性提升到3D,确保充分利用视觉线索和跨不同车辆的泛化。提出知识注入策略学习策略,通过GRPO施加密集中间奖励,强制执行从视觉感知到空间规划的严格因果链。
核心创新点 1. 2D-to-2D规划范式:将轨迹预测从相机参数纠缠中解放,提升跨数据集可扩展性 2. 推理时3D提升:仅在推理时将2D轨迹提升到3D,避免训练时的trivial解收敛 3. GRPO知识注入策略:通过密集中间奖励强制执行视觉感知到空间规划的因果链
推荐理由/落地价值
PixelPilot解决了VLA训练中的一个深层问题:模型收敛到依赖ego-status而非真正视觉理解的trivial解。2D-to-2D范式使VLA能够跨不同数据集(不同相机、不同车型)训练,这是实现大规模数据闭环的关键。开环和闭环双SOTA验证了其可扩展性和视觉推理能力。对于量产VLA系统,跨车型泛化能力直接影响落地成本。
论文3:【学术型】ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
发布日期: 2026年6月
机构: 华中科技大学、小米汽车
发表: 技术报告/arXiv
主要内容
现有端到端自动驾驶系统中,直接让视觉语言模型(VLM)输出物理动作常导致格式错误或动作不可行。ReCogDrive提出一种将驾驶理解与规划统一起来的强化认知框架。核心思路是将VLM的认知能力与扩散规划器结合:首先通过”生成-细化-质量控制”三阶段层次化数据流水线,将人类驾驶认知注入VLM;随后将VLM学习到的驾驶先验注入扩散规划器,高效生成连续且稳定的轨迹。为进一步提升安全性,引入扩散组相对策略优化(DiffGRPO)阶段,对规划器进行强化学习微调。
核心创新点 1. VLM认知能力与扩散规划器的深度融合,解决VLM直接输出动作不可行的问题 2. 层次化数据流水线(生成-细化-质量控制),将人类驾驶认知系统注入模型 3. DiffGRPO强化学习微调阶段,显著提升规划安全性与稳定性
推荐理由/落地价值
ReCogDrive在NAVSIM和Bench2Drive等基准测试上均取得SOTA成绩,且已开源(545+ Stars)。该工作展示了VLM的认知推理能力如何与端到端驾驶有效结合,为”大模型+自动驾驶”提供了可落地的技术路径。小米汽车的深度参与也表明该方向具备工业量产价值。
论文4:【学术型】U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences
发布日期: 2026年6月
机构: 南京理工大学、南洋理工大学等
发表: CVPR 2026 Highlight
主要内容
对于构建自动驾驶仿真环境,4D LiDAR序列(带时间维度的3D点云)生成具有重要意义。现有框架对所有空间区域采用相同处理方式,导致语义复杂区域(行人密集区、路口)出现几何伪影。U4D提出不确定性感知的4D LiDAR世界建模框架,核心设计是”由难到易”的生成策略:利用预训练分割模型估计空间不确定性地图,定位高熵区域;优先重建高不确定性区域以保证几何保真度;在学习到的结构先验下补全剩余区域。为保证时间连贯性,引入时空混合(MoST)块,在扩散过程中自适应融合空间和时间表示。
核心创新点 1. “由难到易”的不确定性感知生成策略,优先处理语义复杂的高熵区域 2. 时空混合(MoST)块,自适应融合空间与时间表示以保证时间连贯性 3. 在几何保真度和时间一致性上均优于现有基线
推荐理由/落地价值
U4D获得CVPR 2026 Highlight认可,代表了世界模型从”均匀生成”向”认知驱动生成”的重要演进。高质量4D LiDAR仿真对自动驾驶数据闭环、长尾场景覆盖和模型验证具有关键价值。该工作为构建更真实、更多样的自动驾驶仿真环境提供了新范式。
论文5:【工业落地型】FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
发布日期: 2026年1月(AAAI 2026录用)
机构: 小鹏汽车、北京大学计算机科学学院
发表: AAAI 2026
主要内容
现有VLA模型将视觉输入转换为大量视觉token,导致巨大计算开销和推理延迟,对车端部署提出重大挑战。FastDriveVLA提出专为自动驾驶VLA模型定制的基于重建的视觉token剪枝框架。受人类驾驶员主要关注前景区域的启发,团队假设与前景信息相关的视觉token比背景token更有价值。为此构建大规模自动驾驶标注数据集nuScenes-FG(24.1万个图像-掩码对),通过MAE风格像素重建策略和对抗性前景-背景重建策略,训练出可即插即用的视觉token剪枝器ReconPruner。
核心创新点 1. 基于重建的视觉token剪枝框架,无需重新训练整个模型即可即插即用 2. 构建nuScenes-FG数据集(24.1万图像-掩码对),专门用于自动驾驶前景-背景区分 3. 在nuScenes开环规划基准上取得SOTA,同时FLOPs降7.5倍、预填充时间减3.7倍
推荐理由/落地价值
FastDriveVLA直接回应了VLA大模型车端部署的核心痛点——计算效率。小鹏汽车与北大的产学合作表明该方向兼具学术创新性和工业落地价值。在VLA模型参数规模持续膨胀的背景下,token剪枝、模型轻量化是实现”大模型上车”的关键路径。该工作为其他VLA模型的效率优化提供了可复用的技术方案。
参考文献
·华中科技大学、小米汽车. ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving. arXiv, 2026.
·南京理工大学、南洋理工大学等. U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences. CVPR 2026.
·小鹏汽车、北京大学. FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning. AAAI 2026.
·加州大学河滨分校、密歇根大学. Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving. CVPR 2026.
·上海交通大学、华为. VLA-World: Learning Vision-Language-Action World Models for Autonomous Driving. 技术报告, 2026.
·Wayve. GAIA-3: A Controllable Multi-View Generative World Model for Autonomous Driving. CVPR 2026.
