学术界
发布 日期 | 技术/论文 | 机构 | 核心突破 | 意义 |
2026-06-14 | Metis: World-Action Model | 理想+复旦+港大 | 大解耦视频生成与动作预测,NAVSIM SOTA | 世界-行动模型效率突破 |
2026-06-11 | Human-like autonomy from self-play | NYU+普林斯顿 | 30分钟人类数据+自博弈RL超越全量模仿学习 | 数据效率范式革命 |
2026-06-09 | 理想12篇CVPR 2026入选 | 理想汽车 | SparseWorld-TC/Oral/PlannerRFT/CogDriver | 具身智能全链路布局 |
2026-06-05 | 小鹏CVPR 2026世界模型图谱 | 小鹏汽车 | VLA+世界模型双支柱,X-Mind/X-World/X-Foresight | 物理AI基座成型 |
2026-06-03 | Waymo世界模型首次曝光 | Waymo | 基于Genie 3的三阶段训练框架 | 自动驾驶进入基础模型时代 |
2026-05-29 | IDOL: Inverse-Dynamics-Guided Planning | 清华大学 | 逆动力学桥接世界模型与规划,NAVSIM v2 SOTA | 世界模型可执行化关键突破 |
工业界
发布日期 | 公司/产品 | 技术/动态 | 关键进展 | 影响 |
2026-06-23 | 华为乾崑ADS | ADS Max涨价+智驾兜底 | 7月1日起涨至1.5万,推出ADS辅助驾驶无忧权益 | 智驾进入"保障"时代 |
2026-06-12 | 特斯拉FSD v14.3.4 | 推送 | HW4.0专属,反应速度提升,Cybertruck智能召唤 | FSD持续快速迭代 |
2026-06-05 | 小鹏汽车 | CVPR 2026演讲 | 世界模型技术图谱首曝,Robotaxi量产下线 | L4物理AI基座落地 |
2. 本周推荐论文详解
【学术型】Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation
- 类型:世界-行动模型 / 端到端规划
主要内容
Metis提出了一种解耦视频生成与动作预测的世界-行动模型(World-Action Model, WAM)框架。现有WAM方法存在两大瓶颈:(1)推理时需显式生成未来观测导致高延迟;(2)视频与动作建模紧耦合导致表示不匹配、泛化下降。Metis采用Mixture-of-Transformers架构,设置视频生成专家(Video Generation Expert)和动作预测专家(Action Expert),并通过非对称注意力掩码实现训练时联合优化、推理时动作专家直接绕过视频生成。
核心创新点
1. 解耦推理范式:训练时联合建模未来视频与动作,推理时仅需当前观测即可输出轨迹,消除高维视频生成的推理开销
2. 非对称注意力掩码:允许视频token关注动作token,但禁止反向关注,确保动作预测仅依赖当前上下文,同时保持训练-推理一致性
3. 跨任务泛化:在NAVSIM自动驾驶和CityWalker城市导航两个截然不同任务上均取得SOTA,并验证真实机器人零样本部署
推荐理由/落地价值
Metis在NAVSIM-v2 navtest上取得EPDMS 89.5(单摄像头设置),超越所有VLA和WAM基线;在CityWalker上L2误差降至0.71m(对比之前SOTA 1.11m)。更重要的是,Metis已在真实四足机器人上完成零样本部署验证。对于理想汽车而言,这是其VLA+世界模型双支柱战略的技术底座之一,直接支撑L4级物理AI基座的构建。
【学术型】Human-like autonomy emerges from self-play and a pinch of human data
- 类型:自博弈强化学习 / 自动驾驶

数据效率对比
主要内容
该论文提出"spiced self-play"方法:将少量人类驾驶数据作为行为锚点,通过KL散度正则化引导自博弈强化学习策略。核心发现:仅需30分钟人类驾驶数据(占Waymo Open Motion Dataset的0.04%),配合约60年合成自博弈经验(200亿步),即可训练出与人类轨迹高度协调的驾驶策略,at-fault碰撞率比全量模仿学习方法低2.5倍。
核心创新点
1. 数据效率突破:30分钟人类数据 vs. 传统模仿学习需52天全量数据,人类数据用量减少2500倍
2. 无奖励工程:仅使用稀疏的安全目标到达奖励(+1到达/-1碰撞),无需手动设计复杂奖励函数
3. 行为对齐:正则化策略不仅碰撞率更低,碰撞严重程度也显著下降(平均冲击速度从2.09m/s降至1.71m/s)
推荐理由/落地价值
这篇论文对自动驾驶行业具有范式级意义。它证明自博弈RL+极少人类数据的组合可以颠覆"海量数据驱动"的固有认知。对于数据获取成本极高、长尾场景覆盖不足的中国城市道路,这一路线可能大幅降低对大规模采集车队的依赖。训练仅需15小时单GPU,意味着中小团队也能快速迭代驾驶策略。
【工业落地型】小鹏CVPR 2026世界模型技术图谱:VLA+世界模型双支柱驱动L4级物理AI基座
- 类型:工业技术路线 / 物理AI基座
主要内容
小鹏在CVPR 2026上首次完整展示世界模型技术图谱,明确第二代VLA与世界模型并非竞争关系,而是共同构成物理AI基模底座。第二代VLA从人类驾驶行为中学习"如何行动",世界模型通过对未来状态的预测学习"行动之后世界会如何变化"。技术成果包括:X-Mind(主动推理)、X-World(可控生成式世界模型)、X-Foresight(视觉-动作因果预测)、X-Cache(推理加速)。
核心创新点
1. 双支柱架构:VLA负责行动决策,世界模型负责状态演化预测,二者互补而非替代
2. 量产验证:第二代VLA已实现量产交付,首月用户辅助驾驶里程占比突破50%,车端推理速度提升12倍
3. 万卡级训练:单GPU训练效率一年提升1010%,GPU利用率从40%升至90%
推荐理由/落地价值
小鹏是唯一在CVPR 2026主会做演讲的中国车企(同台包括特斯拉Ashok Elluswamy、Waymo Dragomir Anguelov、英伟达Jan Kautz)。Robotaxi已量产下线,GX车型搭载4颗图灵芯片(3000TOPS),年内开展示范运营。这标志着中国车企在L4级物理AI基座上的工程落地进度已不逊于Waymo和特斯拉。刘先明表示"只有能做基座模型的公司,才有可能真的做到L4",暗示行业将进入基础模型能力竞赛阶段。
3. 值得关注的研究方向
3.1 世界模型的"可执行化"瓶颈
2026年CVPR的核心趋势之一:世界模型从"能生成逼真视频"转向"能支撑可靠规划"。WorldLens的评测揭示了一个残酷现实——6大主流世界模型闭环导航成功率不足14%。Metis和IDOL的共同价值在于,它们不再满足于预测未来状态,而是建立了从"预测"到"行动"的显式桥梁。未来半年,世界模型的核心竞争力可能不再是生成质量(FID/LPIPS),而是动作遵循度(action adherence)和下游任务适配性。
3.2 数据效率的路线分化
行业正在出现两条数据策略的分歧:
- 海量数据派:特斯拉FSD依赖数十亿英里真实数据,华为乾崑积累10亿公里训练数据
- 高效学习派:spiced self-play证明30分钟人类数据即可,SimScale通过仿真数据扩展实现性能平滑提升
这两条路线并非互斥,但资源约束不同的团队需要做出选择。对于数据获取成本极高的中国复杂城市场景,"高效学习+大规模仿真"的组合可能更具可行性。
3.3 智驾商业化的"兜底"时代
2026年6月,华为和比亚迪先后推出智驾兜底权益,将保障范围从泊车扩展至城区NCA和高速NCA。这一变化的深层含义:
- 技术层面:厂商对智驾系统的安全性有足够信心才敢兜底
- 商业层面:智驾从"功能选装"转向"服务订阅+保险"的复合商业模式
- 法规层面:为L3级责任认定积累案例和数据基础
预计2026年下半年将有更多车企跟进兜底策略,智驾保险和责任认定框架可能加速成型。
4. 行业动态
4.1 特斯拉FSD最新进展
- v14.3.4推送(6月12日):HW4.0专属OTA,距v14.3.3不到一个月。新增"到达目的地时地图显示停车选项",Cybertruck首次获得一键智能召唤
- FSD入华(5月21日官宣):产品更名为"特斯拉辅助驾驶",严格定性为L2级。首批适配2024年9月后HW4.0国产Model 3/Y,城市功能预计Q3获监管批准后分批推送
- 九城招聘(5月19日):在北京、上海、广州等九城急聘智驾测试人员,全力冲刺Q3 FSD在华商用
- 订阅制转型:北美已终止FSD一次性买断,统一99美元/月订阅
4.2 华为乾崑智驾
- ADS Max涨价(6月22日):限时优惠6月30日截止,7月1日起终端到手价从1.2万涨至1.5万(涨幅25%)
- 智驾兜底权益(6月23日):推出"ADS辅助驾驶无忧",覆盖高速NCA、城区NCA及泊车场景,对使用智驾过程中发生意外事故造成的人身、财产损失提供保障。7月1日前购买老用户获赠1年,7-12月购买最高享3年
- 双地图服务:车机原生支持高德和百度双地图切换
- 竞品对比:涨价后ADS Max(1.5万)仍仅为特斯拉FSD(6.4万)的四分之一
4.3 小鹏汽车
- CVPR 2026演讲(6月5日):第三次受邀,唯一演讲中国车企。首次披露世界模型技术图谱,明确VLA+世界模型双支柱路线
- Robotaxi量产:以小鹏GX为原型车的Robotaxi已量产下线,搭载第二代VLA,整车有效算力3000TOPS,年内开展示范运营
- 人形机器人IRON:量产版本预计年底量产,2027年Q1进入门店
- 万卡集群:单GPU训练效率一年提升1010%,GPU利用率从40%提升至90%
4.4 Waymo与行业格局
- 世界模型(6月3日):CVPR 2026主题演讲中首次披露基于DeepMind Genie 3的三阶段训练框架(预训练→中期训练→后训练),将自动驾驶从软件工程问题转变为基础模型问题
- Robotaxi规模:车队突破3500辆,中国军团(百度、小马、文远等)全面追赶
- CVPR风向:自动驾驶研究权重继续向"通用驾驶智能"倾斜,经典检测/分割/跟踪占比收缩,具身AI、端到端驾驶、世界模型、生成式仿真比重持续抬升。
*本报告仅供技术交流参考,不构成投资建议。*