
扫描下方二维码,添加交流群深入交流
提到自动驾驶,大家的第一反应往往是:“这模型怎么还不更新?” 在这个领域,我们一直在疯狂地堆数据、做模仿学习(IL),试图让模型完美复刻老司机的操作。但残酷的现实是:哪怕你的模型在离线测试里跑得再溜,一上真车,稍微的误差累积就会让车变成“画龙高手”,甚至直接冲下路沿。
读完这篇文章,你将彻底打通自动驾驶从“感知”到“决策”优化的任督二脉,掌握让模型在复杂路况下像人一样学会“反思”和“纠错”的核心机密。
❓ 核心痛点:为什么你的自动驾驶模型“中看不中用”?
在自动驾驶的数据海洋里,我们习惯了喂给模型海量的人类驾驶日志,用行为克隆(Behavior Cloning)让它“鹦鹉学舌”。这就是我们熟知的模仿学习。公式很简单:
模型只要尽量拟合专家轨迹,把位移误差降到最低就行了。但这套逻辑有个致命的逻辑漏洞:它根本无法刻画“安全”与“舒适”。
试想一下,两个模型预测的轨迹和专家轨迹的物理距离可能是一样的,但一个平稳丝滑,另一个却急刹急加速,让你晕车晕到怀疑人生。更可怕的是,开环测试(Open-loop)里的微小误差,在闭环(Closed-loop)执行中会像雪崩一样累积,“差之毫厘,谬以千里”,直接导致碰撞。因为在真实的物理世界里,模型的每一个错误决策都会改变环境的状态。
这就引出了我们今天的核心命题:后训练(Post-training)。它被明确定义为:在初始模仿学习获得策略 之后,利用超出原有离线数据的监督信号进行的全部优化工作。它的目标不是为了在榜单上刷分,而是为了闭环行为负责。这背后的优化逻辑可以用一个统一框架来概括:
这个公式虽然看着复杂,但思想非常直觉化:我们要在原始模型参数 的附近寻找一个新参数,让它不仅能看懂观测值,还能根据“信号”做出符合人类价值观的行动。
按照这部分额外的监督信号从哪来,综述把这波新兴的“黑科技”分为了四大流派:蒸馏、偏好对齐、强化学习和测试时精炼。
在深入这些硬核细节之前,我们先通过一张全景图,把这套端到端自动驾驶后训练的两阶段范式刻进DNA里。这张图直接道出了从“像专家”到“超专家”的进化秘密。
图1:论文提出的两阶段训练全景图,左半部分的模仿学习Stage 1构建基础能力,右半部分的蒸馏、偏好对齐、强化学习等后训练Stage 2,是解锁模型极限潜力的关键所在。🚀 原理拆解:四大天王,重塑驾驶灵魂
你可能会问,后训练的优化目标听起来如此宽泛,到底要怎么落地?别急,下面我们就顺着论文的结构,从最稳扎稳打的“蒸馏”开始,一直讲到最前卫的“测试时反思”,看看这四大流派是如何把驾驶模型一步步调教成老司机的。
💡 蒸馏:找个“贴身私教”倾囊相授
在初始训练阶段,模型学的是“人类开车的样子”。而后训练中的蒸馏(Distillation),则是给模型找了一位强得多的“私教老师”。这个老师可以是更大规模的VLM、传统的专家规划器,或者是模型自己的历史稳定版本。
蒸馏的本质是用更密集、更鲁棒的目标来优化学生模型 ,目标函数可以简化为:
这里的核心在于构建训练数据 。如果只是在原来的专家数据集上做知识迁移,那跟传统的微调没什么区别。真正的精髓在于 “DAgger 风格”的在线蒸馏:让模型自己先跑一圈轨迹展开(Rollout),面对那些因为误差累积导致的“诡异视角”,教师再去做出示范。
这就好比教练不会只让你在训练场打方向盘,而是直接陪你上路,在你手忙脚乱快要撞车时,一把扶住方向盘,告诉你应该怎么修正。例如 CRAFT就用模型自身的指数移动平均(EMA)作为老师,通过 KL 散度约束策略不要自我膨胀;PaIR-Drive 则在强化学习分支旁边,并行挂了一个模仿专家演示的分支,实时纠正。
这种策略解决了两个致命伤:一是缓解了闭环下的分布偏移,二是避免了单纯靠RL时复杂的奖励函数设计。
💡 偏好对齐:教会模型“高情商”的驾驶品味
如果说蒸馏是教模型“怎么做对”,那么基于偏好的对齐(Preference-based Alignment) 就是在教模型在多个“对”的方案里,怎么选得“更漂亮”。
在很多驾驶场景下,诸如变道时机的选择、让行的礼让程度,不存在绝对的对错,只有“好不好”。偏好对齐引入的正是这种比较级的信号:给定一组数据对 (分别是喜欢的和拒绝的轨迹),让模型学会区分。
这类方法中最经典的是 DPO(直接偏好优化)。它跳过了显式的奖励模型训练,直接让策略从偏好对中学习。损失函数看起来有点唬人,但逻辑很清晰:
这就像给模型浏览“错题本”,但不是告诉它标准答案,而是把两份试题放在它面前,一份带有潜在风险的“鬼探头型操作”,一份“防御性驾驶型操作”,然后直接指出哪份才是人类更偏好的。
DriveDPO利用规则安全评分和模仿相似度来构建数据;VL-DPO则更聪明,直接用视觉语言模型自动找出高质量的行为对,省去了大笔人工标注费用。不过要注意,这种方法的瓶颈在于数据本身——如果被比较的轨迹没有展示出在安全与舒适之间的真实权衡,模型就学不到有意义的进步。
💡 强化学习后训练:解开自动驾驶的“无限游戏”
这是四类方法中最为庞大,也是看起来最有“未来感”的一个流派。它通过与环境交互产生的奖励信号 来最大化期望回报:
自动驾驶是一项多维度(安全、舒适、进度、合规性)且长时序的任务,传统的点式标签在这里彻底失灵。而强化学习的后训练,让我们可以精细地去设计“什么是好行为”的度量衡。这个复杂的设计空间,包括奖励设计、数据收集以及策略更新的完整技术路线,一篇综述性论文的架构图就能让我们一目了然。
图3:自动驾驶后训练中的强化学习设计空间全景图,涵盖了奖励设计、数据收集与策略优化三大核心模块及其细分技术路线。顺着这张设计空间图,我们逐一拆解它的三大核心支柱。
1. 奖励设计:到底什么才是“好司机”?奖励定义了什么行为值得被记住。论文将奖励的来源分为了五类:
- • 基于规则的奖励:直接可观测的低成本信号,比如碰撞、离路、进度。这些通常被整合成类似 NAVSIM 的 PDMS 分数,但它们往往无法捕捉让行是否礼貌等交互语义。
- • 学习的奖励模型:用数据学一个评判器。比如DriveCritic 基于人类偏好训练一个 VL M 评估器,或者利用世界模型的不确定性来引导探索。这能捕捉固定规则难以形式化的内容。
- • 世界模型耦合奖励:想象一下,如果能预见未来就好了。像CoPhy 和 DreamerAD 做的,就是从预测的 BEV 潜在空间中提取物理误差作为奖励,让模型知道当前的微小动作会引发几步之后的严重后果。
- • 反事实奖励:这是最聪明的一点。很多场景下,我们不知道选A有多好,但我知道没选B避免了多大的灾难。CRAFT 将稀疏的闭环优势分解为密集的反事实项,让模型在“无事发生”的场景下也能获得有效的批判信号。
- • 推理一致性奖励:对于带着“脑子”开车的 VLA 模型,不仅操作要对,思考过程也得对。Alpamayo-R1就惩罚那些“操作对但解释是歪理”的偶然正确,防止模型瞎猫碰上死耗子。2. 数据收集与多样性:别让模型只看“歌舞升平”。没有足够丰富且严苛的数据,再好的奖励函数也是纸上谈兵。最典型的GRPO 算法之所以有效,在于基于一群样本算出相对优势。但如果这组样本都是高分不犯错的数据,优势值就彻底消失了。因此,数据和探索成了胜负手。
- • 行为增强:DIAL 通过意图标签引导模型生成不同操纵动作的样本,主动引入变道、急刹等多样性。
- • 负样本挖掘:SpanVLA 和 TakeVLA极其注重真实接管数据和恢复事件的挖掘。让大家看到模型在险境中是怎么死的,以及怎么从鬼门关爬回来,这比 100 个普通样本都管用。3. 策略优化:把分数变成肌肉记忆。当信号传达后,优化算法负责更新参数。除了 GRPO 在 token 序列策略大杀四方,论文还指出了一些更激进的玩法。例如Flow-GRPO 开始将群体相对优化应用到基于流匹配的生成器上,这意味着模型可以直接在连续的轨迹分布上进行优化,完全解耦了传统的自回归解码。
💡 测试时精炼:临场发挥的“灵光一闪”
最后这一类特别有意思,因为它不改变模型参数。测试时精炼(Test-time Refinement)的核心思路用公式概括就是:
在推理的瞬间,模型会快速生成 K 个候选轨迹,然后用一个验证器或重排序器选出得分最高的那一个。这就像考试交卷前花两分钟快速检查一遍,把明显的涂改错误揪出来。
最著名的玩法是 Best-of-N,但这有个限制:如果基础策略太烂,生成的 K 个选项全是菜鸡,再怎么挑也挑不出花来。所以它永远是微调后的锦上添花,而不是雪中送炭。另一个方向是自我反思,比如ReflectDrive 会在推理时审视自己输出的轨迹 Token,发现不安全的部分就立刻替换掉。
但请别忽略这背后沉重的车载算力枷锁。和语言模型可以“加钱加显卡”不同,自动驾驶对延时有物理极限的要求。Fast-dDrive 里的块扩散解码,正是在这种极致算力约束下的求生之道。
📊 实验验证:是骡子是马,拉出来遛遛
技术讲得再花哨,不上路都是空谈。后训练到底能带来多少真实收益?我们来看硬碰硬的开放环路对比。
表1:在 nuScenes 和 WOD-E2E 开放环路测试下的 SOTA 性能对比,这是检验基础驾驶精度和低碰撞风险的试金石。从表1的开放环路对比中,我们可以看到不同侧重的方法在各项指标上展开了激烈角逐。在极其强调轨迹拟合精度的 nuScenes 基准上,AutoDrive-R2以 0.19 的 L2 误差和 0.07 的极低碰撞率登顶,这证明了经过精调的后训练策略在复刻人类轨迹精准度上的强大实力。而在 WOD-E2E 这种更关注人类反馈和长期预测的数据集上,Poutine 凭借 7.990 的 RFS 评分和最低的 5 秒位移误差稳坐头把交椅,说明它在捕获人类真实驾驶偏好上有着独到的后训练设计。
这表明:后训练的目标不再是单纯拟合,而是根据应用场景选择最适合的“性格特质”进行强化。
如果说开放环路是武术套路表演,那闭环和伪闭环就是硬桥硬马的无限制格斗。在更具挑战性的、允许环境反馈影响未来的测试里,后训练的收益被进一步放大。
表2:基于基础模型与非基础模型方法在 NAVSIM 及 Bench2Drive 闭环/伪闭环基准上的全面对决,展示了后训练的价值与现阶段的评估瓶颈。这张表2的信息量非常大。先看跨数据集的“王者”:在 NAVSIM 下,AutoDrive-P3 和 EponaV2分别在标准环境和极具挑战的 navhard 难度上封神;而一旦切换到完全闭环的 Bench2Drive,TakeVLA 则以 89.72 的驾驶分数和 73.73 的成功率一骑绝尘。为什么会有这种反差?因为不同数据集不仅在测模型的后训练效果,更在测试它们背后的基础模型和训练策略对整个闭环反馈的适应能力。
我们从图表中也能直观看出,带有 Foundation Model 背书的策略在 DS 和 SR 上普遍比传统方法高出一大截,这背后的原因正是大模型那种抗干扰的语义理解能力在做支撑。但同时,一个严峻的问题也被摆上了台面:无论是 PDMS 还是在特定数据集上的 SR,顶尖方法之间的分差已经越来越小,基准测试的 “天花板效应” 出现了。单纯的综合分已无法区分方法的优劣,我们必须把目光转向更细粒度的组件分析和长尾分布。
⚖️ 客观评价与未来方向:后训练的“另一面”
尽管后训练展现出了惊人的潜力,但作为一枚硬币的两面,它在当前阶段也有我们必须正视的局限性。
1. 基准饱和与评估难题:当我们看表2里那串 92.6 或 89.9 的 NAVSIM 分数时,就像只看重本率一样,已经很难区分谁是真正的学霸了。最终的模型需要把报告重心转移到 navhard 这种地狱模式以及实车接管率上,而且推理成本的报告必须标配化。如果模型推理一次要 500 毫秒,在 60km/h 的车上这意味着半盲开 8 米多,这是致命的。**2. 奖励黑客与耦合困境:**如果奖励设计不当,复合奖励可能会被模型通过最简单的子项刷到满分。比如为了追求“舒适度”而把车开得极其缓慢,虽然没错,但完全失去了通行效率。如何将安全性、舒适性和进展进行解耦设计,是 RL 后训练的下一个核心挑战。3. 从世界模型到行为失真的鸿沟:目前很多世界模型提供的反事实预测,主要在像素或传感器层面做文章。但后训练极度渴求的是行为级的信号。世界模型必须精准预测如果我不刹车,对方驾驶员会不会让,交通规则会不会被触发,否则生成的反事实就是一堆高清的“废片”。4. 走向持续学习的闭环:目前的流程还是太“学院派”了,基本是从数据到训练的瀑布流。真正的未来是构建一个数据飞轮:车辆每天在路测中的接管、急刹和风险博弈,直接在线转化为新的偏好对或奖励信号,下次 OTA 升级时,后训练阶段针对这些血泪教训进行专项特训。这才是从辅助驾驶进化到全无人驾驶的质变点。
🌟 价值升华
读完这篇综述,它的价值不在于让你记住哪个模型的分数高,而是提供了一套审视自动驾驶进化的元认知框架:
- • 跳出模仿的陷阱:深刻理解为什么没有后训练,模型永远只是数据集的“背书机器”;
- • 掌握监督信号的主动权:从密集的蒸馏标签,到稀疏的反事实奖励,再到侧面的偏好对比,你知道了在不同的场景下应该“用什么魔法打败什么魔法”;
- • 直面评估的终极拷问:不再被好看的 KPI 蒙蔽双眼,学会关注
navhard、车载延迟和真实的接管率。
🤔 深度思考:端到端自动驾驶已经从“大力出奇迹”的阶段,进入了目标导向的“精细活”阶段。在四大后训练路线中,你是更看好“反事实推理”这种高维度思考能力,还是觉得在线世界模型带来的“朴素直觉”才是通往量产的捷径?欢迎在评论区留下你的真知灼见,我们一起思想碰撞!
💝 支持原创:如果这篇深度拆解为你翻开了自动驾驶进化论的新篇章,恳请你动动手指,点赞+在看,把它分享给正在为模型优化而头秃的战友们。你的支持,是我深挖前沿硬核技术的最大动力!
🔔 关注提醒:还没上车的老铁,记得点个关注加星标,这里有最硬核的技术解读,站在学术与产业的十字路口,你看不见的深度,我带你一起看见。
#AI技术 #深度学习 #自动驾驶 #强化学习 #后训练 #论文解读
参考
Post-Training in End-to-End Autonomous Driving: A Unified View