一、 本周关键新技术速览
ICML 2026于7月初举行,部分论文发布时间较早。
论文名称 | 核心技术突破 | 行业意义与评价 |
DynVLA: Dynamics CoT | 引入 Dynamics CoT(动态思维链)范式:将未来世界动态压缩为一组离散的 dynamics token,解耦自我中心与环境动态。 | 首次证明 compact dynamics token 比传统文本或像素级 CoT 更高效,在 NAVSIM/Bench2Drive 双榜取得 SOTA。 |
AutoMoT: Async VLA | 提出异步 VLA 端到端模型,采用异步 Mixture-of-Transformers 架构进行并发感知与控制流计算。 | 成功在架构层面大幅降低端到端模型的控制延迟,Bench2Drive 220条路线开源验证。 |
Drive World-VLA | 构建统一的潜空间(latent-space)世界建模与 VLA 动作导出架构,实现长时程可控生成。 | 在 NAVSIM 取得 86.8 的高分表现,通过统一架构有效减少了传统模块间的跨模态信息损失。 |
TIC-VLA | 构建“控制中思考”(Think-in-Control)框架,引入延迟语义-控制接口,专门解决 VLA 大模型语义推理延迟与实时控制的解耦。 | GitHub 已完全开源,大幅提升了 VLA 模型在人机共存等复杂动态轨迹场景下的高频控制精度。 |
ForgeDrive | 基于统一自回归扩散框架,提出“双向交叉条件化(Bidirectional Cross-Conditioning)”,使视觉生成与动作预测在去噪过程中相互引导。 | 本周最新成果。首次将视觉生成与动作预测深度闭环耦合,从底层架构上解决端到端系统“感知正确但决策错误”的割裂问题。 |
工业界与政策动态
发布日期 | 主体 | 核心动态与关键进展 | 行业影响与趋势 |
2026-06-17 | 工信部 | 公示首部 L3/L4自动驾驶系统安全要求强标(报批稿):拟于 2027年7月1日 正式实施。 | 标志着我国智驾行业正式从“鼓励探索”走向“有法可依”,进入商用倒计时。 |
2026-06-15 | 理想汽车 | 首席技术官披露自研 马赫 M100 智驾芯片 细节:专门为新一代智驾平台打造,算力达 1280 TOPS,原生支持端到端大模型。 | 标志着头部车企从“外采芯片+自研算法”全面向“全栈软硬件一体化自研”转型。 |
2026-06-06 | 高通 | 发布骁龙 8797 车载芯片,单片算力高达 1280 TOPS,支持端到端 Transformer 与 VLA 模型,已获 18 个车型定点。 | 智驾算力竞赛进入新阶段,为第三方方案商提供了极强的标配算力底座。 |
二、 本周推荐论文深度解析
1. DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
发表平台: ICML 2026 (本周于会议引发集中讨论)
核心机构: 中科院自动化所、银网智能
核心创新: 传统的 VLA 模型要么依赖文本思维链(Textual CoT),推理延迟高;要么依赖像素级像素生成(Visual CoT),数据冗余极大。DynVLA 另辟蹊径,首次证明了紧凑的动态 Token(Compact Dynamics Token) 是最契合智驾大模型的中间表示。它利用向量量化(VQ)机制解耦了主车动态与环境动态,在保证物理一致性的同时,大幅压缩了计算开销。
落地价值: 针对量产级端到端系统,它在 NAVSIM 和 Bench2Drive 上均取得 SOTA。该架构在降低推理延迟的同时提升了时空物理理解,为车端大模型的实时性落地提供了极具价值的代际升级方案。
2. ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation
发表平台: arXiv (2026-06-30 最新发布)
核心机构: 上海人工智能实验室、商汤科技
核心创新: 传统端到端模型中,感知和决策往往是单向串联或弱耦合的(即视觉特征传给动作解码器,但动作不反向影响感知)。ForgeDrive 提出了双向交叉条件化(Bidirectional Cross-Conditioning) 框架,将未来场景生成与轨迹规划统一在同一个自回归扩散生成模型中,让视觉表征与动作表征在去噪过程中互为条件、深度闭环。
落地价值: 该工作直击端到端大模型在长尾场景中“感知正确但决策错误”的割裂痛点。这种双向耦合的架构设计,未来极有可能像 ResNet 的残差连接一样,成为端到端 VLA 模型的标准范式组件。
三、 值得关注的前沿研究方向
1. VLA 模型的车端在线强化学习(Online RL):
以华科与小米联合发表的 MindDrive 为代表,在线 RL 在仿真(Bench2Drive)中已被证实有效。但工业界下一步需攻克如何安全地利用车端真实回传数据进行策略异步更新,解决分布偏移与实时安全约束。
2. 世界模型作为 VLA 推理内环的架构演进:
无论是华为的 WEWA 世界模型架构 还是学术界的 DynVLA,世界模型都已不再是独立的生成模块,而是直接嵌入 VLA 的决策内环。如何在高物理一致性与低推理延迟之间取得帕累托最优是关键。
3. 软硬件协同的端侧高效推理:
随着高通 8797 与理想马赫 M100 等 1280 TOPS 算力芯片的量产定点,算法层面的 Token 剪枝(如 Fast DriveVLA)、KV-Cache 压缩以及多帧时序融合的内存优化,将直接决定大模型能否在车端实现量产高频控制。
4. 强标倒计时下的安全验证体系(Safety Case):
距工信部 L3/L4 强标正式实施仅剩约一年时间。行业正被迫从“测试案例通过制”转向“形式化安全论证制”, CARVE(可验证经济修复)等针对安全关键场景的形式化验证方法论将从学术圈快速走向工业界工程化落地。
本周信号显示,行业竞争正从”高阶智驾配置”升级为”芯片 + 模型 + 座舱 Agent+L3/L4 合作”的体系能力竞争。华为(ADS 5.0+自研芯片 + 引望合作)、理想(马赫 M100+VLA)、小鹏(图灵芯片 + 第二代 VLA)均沿此路径布局。高通 8797 的 1280 TOPS 量产则为第三方方案商提供新算力基座。L3 强制国标的倒计时(距实施约 1 年)正在加速这一竞争节奏。