自动驾驶的评价体系,正卡在一个不太容易被察觉的瓶颈上。
端到端规划模型跑得越来越顺,标准场景的分数也一轮高过一轮,但有一个根本问题始终悬在头顶:我们用来给驾驶行为打分的那些指标,本身到底靠不靠谱?
想想看。一辆自动驾驶汽车遇到前方施工区,车道被锥桶压缩到只剩一半。人类司机会怎么做?大概率是借道对向车道绕过去,短暂地偏离车道中心线,但整体行为安全且合理。
可这套动作在现行规则评估体系下,很可能被判成一次严重的车道保持违规。
这就是 NVIDIA 研究团队在这项工作中指出的核心困境:基于规则的驾驶评估指标,比如被广泛采用的 EPDMS,虽然在标准场景下透明且可复现,但它们是场景盲的。它们不知道什么时候该严格执法,什么时候该睁一只眼闭一只眼。
而另一端,最近兴起的 VLM 直接打分方案,虽然能理解场景,却受限于视觉语言模型本身空间精度不足的硬伤,让“碰撞检测”这种毫米级别精度要求的安全判断,变成了大模型的模糊直觉。
NVIDIA 提出了 DriveJudge,一个将视觉语言模型的场景理解能力与确定性规则函数的物理精度结合起来的驾驶评估智能体。
这条思路的起点,是一个朴素但关键的观察:驾驶质量评估中,哪些规则应当被激活,本身就是场景决定的。
现有驾驶评估指标的隐性枷锁
自动驾驶评估指标大致分为两派。
仿照指标,比如平均位移误差 ADE 和终点位移误差 FDE,用轨迹与专家驾驶的相似度来打分。它们假设专家的驾驶永远是唯一正确答案,这显然不成立。人类司机也可能走子优路线,而且在长尾场景里,“唯一正确路径”这个前提本身就是个伪命题。
规则指标是当前主流。EPDMS 将驾驶评估拆解成几个明确定义的子维度:安全性方面包括碰撞检测和碰撞时间 TTC,车道合规方面包括车道保持、驾驶方向合规和可行驶区域合规,再加上前进效率与舒适性,每一个维度都由确定性函数给出一个在 0 到 1 之间的分数,最后加权求和。
这种机制的好处很明显:透明、可复现、维度拆解细腻。但问题也同样明显。加权求和的内在假设是所有规则在所有场景下具有同等重要性,这显然不成立。
长尾场景中,合理的驾驶行为往往意味着有选择地放松某些规则约束。为了避开障碍物而借道,为了给紧急车辆让路而短暂停车,这些是安全且合理的行为,却在 EPDMS 的框架下被过度惩罚。
而另一类方案,用 VLM 直接给驾驶行为打一个笼统分数,虽然具备场景感知能力,却把安全评估这种需要空间精确性的任务交给了一个本质上不擅长精确定位的模型。
研究团队在论文中给出了一个典型例子:一辆左转车辆短暂压到了对向车道线,直接打分的 VLM 完全没有察觉这次车道违规,而 DriveJudge 通过调用精确的规则函数,清晰地捕捉并扣分了这一行为。
DriveJudge:让规则评估具备场景感知
DriveJudge 的设计核心,是一个智能体决策框架。
具体来说,DriveJudge 由两个层次构成。上层是一个视觉语言模型,它接收多模态输入——前视摄像头画面和鸟瞰视角渲染图,然后对当前场景进行语义理解。基于这个理解,VLM 输出一个门控向量,决定七个评估维度中哪些应该被激活,哪些在当前场景下不具备评估意义。
下层则是 EPDMS 中那套经过充分验证的规则函数。VLM 说“这个场景下别用车道保持约束”,车道保持就被排除在加权计算之外;VLM 说“这个场景里碰撞检测是绝对红线”,碰撞检测的权重就被放到最大。
用更直观的方式理解:EPDMS 是一位不懂变通的交通执法者,不管什么情况都按统一标准开罚单。DriveJudge 则是一个理解路况的驾校教练,知道什么时候该严格,什么时候该给学员一些试错空间。
最终驾驶分数由那些被门控选中的规则函数产出,经过加权平均得到。这套机制保留了规则评估的全部物理精度,同时通过 VLM 的场景理解,把“哪些规则适用”这个关键决策交给了能读情境的智能引擎。
如何给评估指标本身打分
这听起来思路清楚,但马上暴露了一个难题:你怎么证明一个评估指标是更好的?
评估自动驾驶的指标本身,在过去几乎没有被系统性地研究过。研究团队为此提出了两个下游基准任务。
第一个是驾驶质量分类。给定一段人类驾驶视频,由人类标注这个驾驶行为在当前场景下是否合理。一个好的评估指标应该给合理行为打高分,给不合理行为打低分。评估标准包括受试者工作特征曲线下面积 AUC、合理驾驶检测的平均精度,以及对失效案例的检测能力。
第二个是轨迹偏好选择。给定同一场景的两条候选轨迹和人类的偏好标答,一个好的评估指标应该给人类偏好的轨迹打更高分。这个任务直接测量指标与人类判断的对齐程度。
为了支撑这两个基准任务,研究团队构建了 DriveJudge 数据集。
数据的构造逻辑非常巧妙。他们从 NVIDIA 公开的 PhysicalAI-Autonomous-Vehicles 数据集中挖掘出那些人类驾驶在 EPDMS 下得分异常低的长尾片段,然后找人类标注者回答一个简单问题:在当前场景下,这个驾驶行为是否仍然合理?
标注结果涵盖了 10732 个片段,提取成 33577 个标准化的 2 秒窗口,其中 15.3% 被标为驾驶失效。这些失效案例被细分为五类:车道保持违规、交通规则违反、前进效率不足、舒适性问题,以及安全缓冲不足。
这个数据集的独特价值在于,它专挑规则指标容易翻车的场景下手。在那些人类合理驾驶却被 EPDMS 误判的片段里,正是 DriveJudge 这类上下文感知评估指标的用武之地。
从零样本到后训练:SFT 与 RL 的协同进化
有了数据集,接下来是如何强化 DriveJudge 的上下文推理能力。研究团队采用了一个标准的两阶段后训练管线:监督微调加上强化学习。
监督微调阶段的训练信号来自一个巧妙的推理。对于训练集中的每个片段,如果人类标注为“合理驾驶”,但某个规则函数却给出了低分,那说明在当前场景下这条规则不应该被激活。研究团队据此自动推导出每个片段对应的真实门控标签,然后用交叉熵损失直接监督 DriveJudge 的门控预测。
强化学习阶段的目标则是优化轨迹偏好选择能力。研究团队采用了 GRPO 算法,在 128 种可能的门控组合中进行探索,通过 8 次采样计算相对优势。奖励函数很简单:DriveJudge 给两条候选轨迹的打分排序,是否与人类偏好一致。
需要特别指出的是,研究团队发现强化学习必须建立在监督微调的基座上。从零样本模型直接开始 RL,准确率从 56.38% 到 56.50%,几乎纹丝不动。而从 SFT 初始化,RL 能把准确率从 58.82% 拉升至 80.63%。
这个发现揭示了一个关键洞见:在复杂的决策空间里,RL 的随机探索如果没有先验策略引导,几乎不可能撞出有效的门控策略。SFT 提供了让 RL 起飞的初始速度。
实验:DriveJudge 重塑驾驶评估格局
实验对比涵盖了仿真指标、通用 VLM、监督分类器,以及最近的 VLM 评判模型。
在驾驶质量分类任务上,DriveJudge-8B 斩获 78.90 AUC,把 EPDMS 的 57.67 AUC 远远甩在身后,差距高达 21.23。更值得注意的是对失效案例的检测能力:DriveJudge 的平均精度达到 59.04,而 EPDMS 只有 26.34,翻了一倍多。
这组数字的潜台词是:在战场上真正重要的是不放过危险行为,而 DriveJudge 在这项指标上展现出了显著的优势。同时,消融实验也证实了三个组件的协同价值。去掉规则调用、只让 VLM 直接打分,AUC 从 77.95 暴跌到 68.67。去掉 VLM、只用一个训练好的视觉分类器,AUC 进一步下降到 58.39。
在轨迹偏好选择任务上,DriveJudge-8B 达到了 82.83% 的准确率,超越了专为这个任务设计的 DriveCritic 6.5 个百分点。
这个差距的来源,可以从一个定性案例中清晰看到。DriveCritic 在判断两条轨迹时,错误地认为前方没有阻挡车辆,认为借道加速前进是合理的,还错误地声称两条轨迹都满足车道保持约束。正是这些源于空间推理能力不足的事实错误,让 DriveCritic 做出了与人类相反的偏好选择。
重新校准对现代规划模型的认知
研究团队还做了一个颇有启发的额外实验:用 DriveJudge 重新评估当前最先进的规划模型。
在相同测试集上,所有模型在 DriveJudge 下的得分均高于 EPDMS 下的表现。例如 ZTRS-ViT-L 从 EPDMS 的 0.865 上升到 DriveJudge 的 0.924。
这意味着,现行规则指标可能系统性地低估了现代规划模型的能力。很多被 EPDMS 扣分的行为,在上下文感知评估下其实是合理的驾驶决策。
与此同时,领先模型之间的 DriveJudge 分数差距很小,暗示 navtest 这样的主流基准可能正在趋近饱和。未来的研究不应该只围绕着在 EPDMS 上刷零点几分,而需要关注那些真正体现驾驶智能的长尾推理能力。
局限与未来的可能性
研究团队坦诚指出,目前 DriveJudge 的验证限于开环设定,尚未进行闭环实验。这留下了两个关键问题值得追踪:在闭环模拟器中,DriveJudge 的上下文感知评估能否正向迁移?如果把它用作训练自动驾驶策略的奖励函数,能否催生出更安全且更灵活的驾驶行为?
另一条值得关注的线索是数据规模的缩放行为。监督微调随着训练数据增加呈现接近线性的性能增长,而强化学习在相对较少的高质量偏好数据上就能取得大幅收益,之后趋于饱和。这暗示未来在类似任务上,可以考虑将更多资源投向偏好数据的质量标注而非数量增长。
当然,DriveJudge 最重要的贡献在于它回答了一个方向性问题。驾驶评估不应该在“规则僵化”和“大模型直觉”之间二选一。把前者的精确性交给前者,把后者的上下文理解交给后者,用智能体的方式编排它们的协作,这可能才是通往可靠自动驾驶评估的路径。