
极市导读
针对传统世界模型仅预测未来图像导致缺乏几何与语义理解的痛点,EponaV2 首次提出全面未来推理框架,同步预测未来深度与语义,并结合 Flow-GRPO 强化学习,在无需人工标注的前提下刷新了自动驾驶轨迹规划的性能上限。>>加入极市CV技术交流群,走在计算机视觉的最前沿
过去几年,自动驾驶模型经历了从 BEV 到 VLA,再到 Driving World Model 的快速发展。
早期的 BEV 和 VLA 方法通过显式感知周围环境,再完成轨迹规划,在多个自动驾驶基准上取得了优秀的性能。然而,这类方法通常依赖人工标注的检测、分割或占用信息进行训练,使得数据获取成本较高,也限制了进一步利用海量驾驶数据进行 Data Scaling。
因此,越来越多研究开始关注世界模型(World Model)。
不同于传统感知驱动的方法,世界模型不再依赖人工设计的感知任务,而是直接根据历史观测预测未来世界,并利用未来预测学习环境动态,再完成驾驶规划。由于未来视频天然就是监督信号,这类方法无需人工标注,更容易利用大规模视频数据持续训练,因此被认为是自动驾驶迈向更强泛化能力的重要方向。
然而,一个新的问题随之出现。
虽然世界模型摆脱了人工标注,但它真的已经学会了"理解驾驶世界"吗?

世界模型的核心训练任务,是预测未来图像。听起来,这似乎已经足够。毕竟,如果模型能够准确预测下一帧画面,那么它应该已经理解了世界如何变化,自然也应该知道如何驾驶。
但事实并非如此。
预测未来图像,并不等于理解未来世界。原因在于,RGB 图像中的信息高度耦合。一张图像同时包含纹理、颜色、光照、阴影、材质、背景等大量视觉信息,而真正决定驾驶决策的,却只有其中极少一部分。
例如,当驾驶员看到前方画面时,他真正关心的问题往往只有几个:
这些信息,本质上对应着两类关键环境知识:三维几何信息(Geometry) 和 语义信息(Semantics)。
遗憾的是,仅通过未来 RGB 图像预测,这两类信息都只是隐式存在于像素之中。模型虽然能够"看见"未来画面,却未必真正理解物体之间的空间关系,也未必知道哪些目标才是真正影响驾驶决策的关键对象。换句话说,现有世界模型更多是在学习:
未来的图像长什么样。
而不是学习:
未来的世界为什么会变成这样。
这也是当前世界模型自动驾驶始终难以超越传统感知方法的重要原因。缺少人工标注虽然降低了训练成本,但也让模型失去了关于三维空间和环境语义最直接、最有效的监督信号。模型能够预测未来,却无法真正理解未来。
于是,一个更加本质的问题摆在研究者面前:
如果未来图像提供的信息仍然不够,那么模型究竟应该预测什么,才能真正建立对驾驶世界的理解?
EponaV2 正是围绕这一问题,重新设计了世界模型的未来推理过程。
它的核心思想并不是放弃未来预测,而是进一步回答了一个此前几乎所有世界模型都忽略的问题:
未来,不仅仅是一张图像。

既然问题出在未来图像提供的监督信息不足,那么解决思路也就变得清晰了。这正是 EponaV2 的核心思想:
如果未来图像不能完整描述未来世界,那就让模型预测更加接近驾驶本质的信息。
相比现有世界模型仅预测未来 RGB 图像,EponaV2 首次提出了 Comprehensive Future Reasoning(全面未来推理) 的框架:不仅预测未来图像,还同时预测未来的深度(Depth)和语义(Semantics),让模型能够同时学习场景的几何结构、语义信息以及动态变化规律,从而真正建立对未来驾驶环境的理解。
整个系统采用两阶段训练策略。

和上一代 Epona 相似,输入历史图像 和对应的相对运动轨迹 。首先图像输入基于 DINO 的自编码器,得到特征 ,世界模型根据特征和轨迹,预测未来状态 :
得到的未来状态特征 被 Flow-Matching 轨迹规划头 和未来图像生成头 ,用于预测未来的轨迹 和未来的图像特征 ,损失函数为
其中 是用于控制图像生成的轨迹控制量,在训练中使用数据集的真值代替,在推理中使用模型预测的未来轨迹获得。
这种训练方式虽然简单,却要求模型仅凭 RGB 像素同时学习几何关系、物体类别、运动规律等多种知识,无疑增加了学习难度。EponaV2 则将这些知识显式拆解出来。
除了未来图像预测之外,模型新增了两个未来预测任务:
这两个任务并不是独立外挂的辅助模块,而是直接约束世界模型生成未来表示,使未来表示必须同时包含几何信息和语义信息。也就是说,EponaV2 不再只是要求模型回答:"未来画面是什么样?"。而是进一步要求它回答:"未来物体距离我有多远?","未来哪些区域是车辆?哪些是行人?"。未来世界因此变得更加"可理解"。
具体的,对于深度预测,EponaV2 将世界模型预测的未来状态 通过一个小解码器 解码为深度图 和置信度图 :
用于训练的深度图伪标签 通过一些预训练的大型单目深度估计模型获得,对应的损失函数为:
在深度预测任务中,模型通过输入的图像,理解 3D 信息,同时预测未来深度而非当前深度的任务设计,隐式地让模型进一步理解和推理了场景中物体的运动规律。
未来语义图预测让模型理解环境中物体的语义。大型的图像分割模型,如 SAM3,能够精确提取语义信息,因此 EponaV2 利用 SAM3 构建改任务。和深度预测类似,EponaV2 将未来状态 通过一个小型编码器 ,根据给定的 SAM3 语言提示特征 ,解码为大语言模型 SAM3 对应的图像分割特征 :
用于训练的伪标签 通过 SAM3 获得,损失函数为:
在语义预测任务中,模型根据图像预测未来的语义图,同时隐式推理了物体的运动规律。同时,不同于直接预测图像分割,预测分割语义特征图能够让模型理解的语义信息更加精细丰富。
第一阶段训练时,三个任务共同优化世界模型:
其中,轨迹损失保证规划能力,图像预测帮助学习环境动态,而深度与语义预测则进一步补充三维空间和语义理解。三种监督共同作用,使世界模型获得远比传统未来图像预测更加丰富的未来表示。
第一阶段训练得到的轨迹,本质上仍然来自模仿学习。模仿学习能够逼近人类驾驶轨迹,却很难突破数据本身的上限。现实驾驶中,同一个场景往往存在多种合理轨迹,而数据集中的驾驶员选择未必就是全局最优。因此,EponaV2 在第二阶段引入了 Flow-GRPO 强化学习。
EponaV2 中首先将 Flow Matching 的轨迹生成过程重新表示为随机微分方程(SDE)的形式,从而能够在同一场景下采样多条不同轨迹:
其中 为预测的最终轨迹, 为高斯噪音,, 是一个超参数用于控制随机程度。
在 SDE 的形式中,Flow-Matching 的去噪过程可以看做为一系列高斯决策过程 ,从而通过设计的一些简单的奖励函数 ,便可以利用 GRPO 算法实现强化学习。
GRPO 的损失函数为:
其中 为一个衰减超参数, 为 Flow-Matching 的去噪步数, 为 GRPO 算法中每一组的轨迹数量。
为了保证强化学习训练的稳定,EponaV2 额外增加了一个模仿学习的损失函数:
在第二阶段,EponaV2 冻住世界模型的部分,利用强化学习方法只训练 Flow-Matching 轨迹规划头,其损失函数为 .
至此,EponaV2 构建起了一条完整的技术路线:
利用更加全面的未来预测建立环境理解,再利用强化学习不断优化轨迹规划。
如果说第一阶段赋予模型"理解未来"的能力,那么第二阶段,则让模型真正学会了"驾驶未来"。

在 NAVSIM V1 基准上,EponaV2 在多个核心指标上均取得了领先成绩,其中 PDMS 达到 90.4,相比此前最优世界模型进一步提升 1.3 个百分点。

当测试进一步升级到更加困难的 NAVSIM V2 基准时,EponaV2 的优势更加明显。在更具挑战性的 Hard 场景测试集上,模型依然保持领先,其中 EPDMS 相比已有方法提升 5.5 个百分点,展现出更强的复杂场景决策能力和泛化性能。
论文通过一系列消融实验,对每一个关键模块进行了验证。

首先,作者依次加入未来图像预测、未来深度预测以及未来语义预测三个训练任务。实验结果显示,随着三个未来预测任务逐步加入,模型性能持续提升。
其中,仅增加未来图像预测任务,PDMS 就获得了明显改善;进一步加入未来深度预测后,车辆碰撞率和驾驶安全性继续提升,说明模型开始真正学习场景的三维几何结构;最后加入未来语义预测后,驾驶舒适性和整体规划质量再次提高,证明环境语义能够进一步帮助模型完成更加合理的驾驶决策。
这一结果充分说明,未来图像、深度和语义并不是彼此独立的辅助任务,而是共同构成了完整的未来环境表示。三种监督相互补充,使世界模型能够同时理解场景动态、空间结构以及环境语义,从而建立更加符合驾驶需求的环境认知。
除了更加全面的未来推理之外,第二阶段引入的 Flow-GRPO 强化学习同样带来了稳定收益。

实验表明,当移除强化学习训练后,模型在 DAC、EP、TTC 和 PDMS 等多个指标上均出现不同程度下降。其中,EP 指标下降尤为明显,说明仅依赖模仿学习时,模型生成的轨迹更加保守,也更容易偏离最优驾驶策略;而经过 Flow-GRPO 优化后,模型能够在保持安全性的同时,生成更加高效、更加平滑的轨迹规划。
世界模型正在成为自动驾驶发展的重要方向,但如何让模型真正理解未来环境,仍然是这一领域面临的关键挑战。
针对这一问题,EponaV2 提出了更加全面的未来推理框架,在未来图像预测的基础上,引入未来深度和未来语义预测,使模型能够同时学习场景的动态变化、三维几何和环境语义,并引入强化学习和结合两阶段训练策略进一步优化轨迹规划性能。实验结果表明,EponaV2 在多个自动驾驶基准上均取得了领先性能,充分验证了该方法的有效性。
未来,随着世界模型能力的不断提升,更全面、更高质量的未来推理有望进一步推动自动驾驶向更加安全、更加智能的方向发展,而 EponaV2 也为这一方向提供了新的思路和实践。
公众号后台回复“数据集”获取100+深度学习各方向资源整理
极市干货

点击阅读原文进入CV社区
收获更多技术干货