想象一下:让一个大模型做数学题,但先把正确答案给它看,再让它写解题过程。
它会写出完全合理的步骤,每一步都"顺理成章"地指向那个答案。但仔细看就会发现,这些步骤很可能是编的——模型不是真的会做这道题,而是看到答案之后,倒推了一套说辞。
这不叫推理,叫事后合理化。
自动驾驶模型也会犯这个毛病。
现在很多自动驾驶方案用视觉-语言-动作模型(VLA),让大模型通过思维链做驾驶决策:先描述看到的场景,再推理该怎么开。
问题出在训练环节。训练时,教师模型手里有日志记录的真实未来轨迹。如果教师模型在推理之前就先看到了这个真实轨迹,就会产生一种偏差:不再从场景证据出发推导决策,而是围绕已知结果编造推理过程。
论文把这种失败模式叫做"轨迹锚定偏差"。模型学会了"先看答案,再倒推过程",而不是真正理解场景。
危险之处在于:评测的时候,这类模型表现往往很好——推理过程头头是道,决策结果也和真实轨迹一致。但到了真实路况,没有"标准答案"可看,它立刻露馅。训练时的高分,是虚假繁荣。
解法:把推理和答案隔离开
这篇论文(DEFT-RLVR)提出了两个组件。
第一个叫 AD-MCQ。它把"轨迹规划"这个开放式问题,改造成选择题:给出一组显式的轨迹候选,让模型从中选择。刹车、速度、横向几何这些关键差异都能保留在选项中;答案离散了,可以精确验证对错,不需要让模型生成一长串坐标再去比对。
第二个叫 DEFT,是核心思路:延迟暴露。推理过程严格分成三个阶段——先推理场景,再揭示候选轨迹,最后验证决策。模型必须先基于场景证据给出推理,然后才看到候选答案,这样它就没有机会"先看答案再编过程"。
简单说:先让模型"闭卷考",再给它"对答案"。
这为什么值得关注
大模型的思维链推理,到底可信度有多高?这两年很多人开始追问这个问题。推理过程和最终答案,并不总是因果一致。模型可能先蒙对答案,再编一段推理;也可能推理全对,答案却错了。在自动驾驶这种安全攸关的场景里,"编推理"的模型是不能上路的。
DEFT-RLVR 的做法是把"推理过程可验证"这件事变成训练目标。用可验证奖励的强化学习(RLVR),配合"延迟暴露"的数据组织方式,逼着模型真正基于场景推理,而不是基于答案倒推。
项目已开源了代码、模型权重和 AD-MCQ 数据集。论文编号 2608.01755,挂在 arXiv 上。做自动驾驶、VLA 模型或者 RLVR 训练的人可以直接上手。