读论文-ASSCG:给自动驾驶快慢双系统装上“智能开关”
论文:ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous DrivingarXiv:2606.25509(ECCV 2026 接收)单位:清华 AIR / 中科大自动化系 / 北航 / 联想集团项目页:williamxuanyu.github.io/asscg摘要
现有自动驾驶快慢双系统(快=实时规划器每帧跑,慢=LLM/VLA 低频给高层指导)的调度大多靠固定间隔或人工规则(场景复杂度估计、难度阈值等),结果是要么在简单路段浪费 LLM 调用,要么在复杂路段漏调,甚至慢系统在"失效区间"给出幻觉建议反而拖累规划。ASSCG(Adaptive Slow-System Control Gate)把"何时调慢系统"建模成资源受限的序贯决策问题,每帧输出三档动作——Query(调慢系统刷新缓存)/ Cache(复用上次指导)/ Drop(丢弃慢指导,避免帮倒忙),RWKV 做骨干(线性复杂度,适合长序列在线决策),先 SFT 模仿最优固定策略,再做 GRPO 风格的计算感知强化微调,把"调用成本"写进 reward。nuPlan Hard20 上 AsyncDriver 分数 65.00→67.28,端到端延迟 0.80→0.32 秒/帧(降约 60%);NAVSIM 上 RecogDrive 双系统 PDMS91.4(+0.6),平均速度提升约 25%。一、动机:快慢调度为什么一直是拍脑袋
快慢双系统这几年各家都在做(GameFormer 异步、VLMPlanner、扩散双分支等),但"慢系统多久调一次、什么时候调"基本两种解法:固定频率:每 N 帧调一次,或某些场景类别下调得密一点。问题是简单路段浪费、复杂路段不够,且同一场景内部的时间动态被忽略了。启发式触发:用规则估场景复杂度,复杂就调。但 VLMPlanner 那篇自己验过——各种规则门控在最终分数上都打不过"每帧都调"的基线,最好的效率-精度折衷来自一个 learned complexity gate,分数仍略降。作者在大量驾驶片段里观察到一个更细的现象,引出三个区间概念(论文自己的定义):EI(Equivalent Interval,等价区间):慢系统指导在后续若干帧保持稳定,重复查询冗余;EfI(Effective Interval,有效区间):慢指导真正被利用、起效的段;FI(Failure Interval,失效区间):慢系统因误判距离/遮挡产生幻觉,此时介入反而有害。问题从"这帧难不难"变成了"这帧慢指导是在 EfI 还是 FI"——这是 ASSCG 的切入角度。二、三档门控:Query / Cache / Drop
ASSCG 是架构无关的——只假设有 fast 分支 + 可选 slow 分支 + 缓存的指导表示,不挑底层规划器也不挑大模型种类。当前场景编码:Attention Pool 提的快系统侧场景特征;缓存相似度:当前场景编码和缓存里上次慢指导的余弦相似度(衡量"上次指导还管不管用");Query:调慢系统,刷新缓存(对应 EfI 到来或缓存已失效);Cache:不调,继续用上次慢指导(对应 EI);Drop:不调,且把慢指导置零向量(对应 FI,慢系统在帮倒忙,干脆屏蔽)。选 RWKV 而非 Transformer 的原因很务实:驾驶场景一跑几百帧,RWKV 状态维护 O(1)、推理延迟线性,门控本身不能成为新的瓶颈——这点对车载部署很关键。三、两段训练
第一阶段 SFT:用"性能最优的固定调度策略"的轨迹当伪标签,监督微调门控,拿到一个能用的初始策略。第二阶段 GRPO-style RL:把"调用成本"显式写进 reward,直接优化闭环驾驶指标(TTC、舒适度、碰撞率、通行效率)。相当于让门控学会"精打细算"——该花的花(复杂博弈、失效前兆),该省的省(直线巡航、缓存还稳),该砍的砍(慢系统 hallucinate 时)。四、实验要点
nuPlan Hard20 闭环(AsyncDriver 基线):平均端到端延迟:0.80 →0.32 秒/帧,降约60%;论文里给了一个直观案例:直线行驶段 ASSCG 只在第 0、22、89 帧调了慢系统(基线每帧都调),结果没掉链子,反而避了一次碰撞——"少即是多"。NAVSIM(RecogDrive 改的双系统:ViT 快规划 + LLM 慢规划):平均速度提升约25%(慢系统不再在简单段拖节奏,快系统敢走)。泛化性:论文在 GameFormer 异步系统、扩散双分支系统上都嵌了一遍,都能涨——"架构无关"不是口号。五、对国内落地的参照
ASSCG 的产业味比学术味重,几个点主机厂和 Tier1 会感兴趣:"架构无关"这四个字值钱:不绑规划器、不绑大模型(LLaVA/LLM/VLM 都能挂),意味着可以当成一个通用中间件卖,联想车计算挂这个名字很顺——他们本来就是做计算平台的。RWKV 选得巧:车载芯片上 Transformer 每帧门控都跑不满,RWKV 线性复杂度 + O(1) 状态,门控本身 0.32 秒那档延迟里占的份额极小,符合车规"不能因为加了调度反而更慢"的硬约束。GRPO 把调用成本写进 reward这条路,后面各家快慢系统论文估计会跟——单纯"SFT 模仿最优固定策略"是不够的,因为"最优固定策略"本身就不是全局最优,必须让门控自己在闭环指标上学会"省"。对照看小米 DriveVA / 小鹏 X-Foresight / 理想 SGDrive 那几条快慢线,目前公开的还都是"固定频率慢系统 + 偶尔 CoT"的路子,门控这块没见系统化答。ASSCG 给的是一个可插拔的参考答案,联想车计算 + 清华 AIR 这组下一步大概率会往车规平台上做 demo