点击下方卡片,关注“人工智能AI与算法”公众号
BLUE 是目前把自动驾驶 VLA 模型中“要不要想”的决策成本与“能不能跑”的部署约束之间鸿沟拉得最平的一篇 CVPR 2026 论文。
端到端自动驾驶领域,Vision‑Language‑Action(VLA)模型正成为主流范式。其核心假设很直观:模型看一帧图像,生成一段自然语言推理(比如“前方有行人,我减速”),再基于此输出油门、刹车、转向。这个链条符合人类驾驶的“先想后做”,几乎成了默认设计。
但博世团队最新发表的 BLUE(Better Language Use in Efficient Vision‑Language‑Action Models)却系统性地挑战了这一前提。他们用闭环仿真环境(Bench2Drive)做了大规模对照实验,得到一个令人警醒的结论:每一帧都强制生成语言,不仅不是“安全保守”的做法,反而在近四分之一的场景下直接损害了驾驶性能,而真正受益的场景仅占 14.5%。
更重要的是,BLUE 并未试图通过增大模型或增强推理来改善语言质量,而是另辟蹊径——用一个仅 0.11M 参数的轻量级门控网络,动态决定每一帧是否值得生成语言。在不改动任何 VLA 骨干参数的前提下,该方法将驾驶成功率提升至 76.2%(+8.9%),同时推理速度达到原来的 2.54 倍,并在两个主流闭环评测基准(Bench2Drive 和 Longest6 v2)上取得了新的 SOTA。
语言不是免费午餐:14.5% 有益 vs 23.6% 有害
为了量化“语言生成”对驾驶决策的真实影响,BLUE 团队设计了一套严谨的对比框架。他们选取了当时性能领先的 VLA 模型 SimLingo,在 Bench2Drive 的 44 类场景(共 2000+ 条路线)上运行闭环测试。对于每条路线,分别执行两种推理模式:
通过比较两种模式下最终驾驶成功率(route completion)的差异,将每条路线归类为“语言有益”、“语言无影响”或“语言有害”。结果分布如下:
| 语言影响类别 | 路线占比 |
|---|
| 有益(Helpful) | 14.5% |
| 无影响(Neutral) | 61.8% |
| 有害(Harmful) | 23.6% |
也就是说,超过 85% 的路线中,生成语言要么没用,要么起了反作用。尤其值得注意的是“有害”比例高达 23.6%——这意味着每四到五条路线就有一条,因为生成了语言而导致最终驾驶失败(例如碰撞、偏离路线、超时等)。
团队进一步更换了不同的视觉骨干(如 CLIP、EVA‑CLIP)、不同的语言标注语言(中文 vs 英文)、不同粒度的指令(详细 vs 简要),结果上述分布比例始终稳定。这说明:“每帧都生成语言”的低效性,不是某个特定模型的偶然缺陷,而是当前 VLA 设计范式的系统性问题。
外部复杂度无法预测语言效用,hidden states 才是关键
一个自然的改进思路是:根据场景复杂度决定是否生成语言——复杂路口多想想,直道空路少想想。BLUE 对此做了详尽验证,结论是:行不通。
他们把 Bench2Drive 中标注的 44 类典型场景(如“无保护左转”、“跟车”、“环岛”等)逐类分析,发现语言的有益/有害分布并不会稳定地绑定在某一类“难场景”上。同一个场景类别,换成不同的语言标注风格或不同的视觉 backbone,语言效用的排序就会剧烈变化。换言之,场景的“外部几何复杂度”与“当前帧生成语言对动作的净收益”之间没有稳定的映射关系。
那什么能预测?BLUE 发现,预训练 VLA 模型内部的 hidden states(即视觉编码器输出的中间特征)天然编码了这种信息。具体地,他们在大规模闭环 rollout 中收集每一帧的 hidden states,并记录该帧在“带语言”与“不带语言”两种模式下最终驾驶表现的差异(作为标签)。然后训练一个简单的二分类器(门控网络),输入是当前帧的 hidden states,输出是“是否应该生成语言”。
这个分类器在验证集上达到了 85%+ 的准确率,而同期尝试的基于场景标签、运动学状态(速度、加速度)、甚至融合多种外部特征的规则分类器,准确率均显著低于 65%。这充分说明:模型内部表征已经隐含了“当前是否需要语言辅助”的判断能力,外部可解释特征反而捕捉不到这个信号。
BLUE 架构:冻结骨干,只训练 0.11M 的门控
基于上述洞察,BLUE 的整体设计极为简洁且工程友好:
冻结 VLA 骨干(视觉编码器 + 动作解码器),不更新任何权重。
在骨干的某一层 hidden states 后接入一个 轻量级二分类门控网络(MLP,参数量仅 0.11M)。
训练阶段:在闭环环境中让 VLA 执行带语言/不带语言的对比 rollout,收集 (hidden state, 最优决策标签) 对,训练门控网络。
推理阶段:每帧先经过视觉骨干得到 hidden state,门控网络实时输出决策:
由于门控网络极轻,推理时额外开销可忽略。而一旦决定跳过语言,整个前向过程省去了自回归语言生成(通常占 VLA 推理时间的 60%~70%),从而带来显著加速。
BLUE 的训练数据完全来自闭环仿真,不需要任何额外的人工标注——他们巧妙地利用“带语言 vs 不带语言”的驾驶表现差异作为监督信号,无需人工判断每帧是否适合生成语言,实现了自动数据采集。
在 Bench2Drive 和 Longest6 v2 两个权威闭环自动驾驶评测集上,BLUE 均取得了新的最高水平:
| 评测基准 | 指标 | 基线 VLA | BLUE | 提升 |
|---|
| Bench2Drive | 路线成功率 | 67.3% | 76.2% | +8.9% |
| Longest6 v2 | 驾驶评分(满分 100) | ~30 | 36.0 | SOTA |
| 推理速度(相对) | 帧/秒 | 1.0× | 2.54× | +154% |
成功率:从 67.3% 跃升至 76.2%,提升幅度在闭环自动驾驶领域相当显著,意味着更多路线能完整跑完且无碰撞。
驾驶评分:Longest6 v2 综合考量了路线完成度、驾驶舒适性、交通规则遵守等指标,BLUE 取得 36.0 分,超越了同期所有已发表的 VLA 方法。
推理加速:由于动态跳过语言,实际测试中平均有约 60% 的帧被门控判定为“无需语言”,整体推理速度提升至 2.54 倍,这对实车部署具有实质意义。
此外,论文还做了详尽的消融实验:
门控网络放置在不同层(浅层 vs 深层)的效果对比;
训练标签的阈值敏感性分析;
与固定比例跳过(如随机或按规则)的对比,证明 BLUE 的学习策略远优于任何静态策略;
泛化性测试:在未见过的场景类型上,门控准确率依然保持 80% 以上。
BLUE 的研究成果,对于端到端自动驾驶的实用化提供了两条核心思路:
第一,语言生成不应是 VLA 的必选路径,而应视为一种可调用的“计算资源”。当前大多数工作只关注“如何让语言更准确”,却忽略了“何时需要使用语言”这个同等重要的问题。BLUE 首次以闭环性能为锚点,量化了语言生成的实际收益,并证明通过模型内部状态可以可靠地预测该收益。
第二,轻量级调度器可以低成本解决大模型效率瓶颈。0.11M 的门控网络,相对于 7B 甚至更大的 VLA 骨干,参数占比不足十万分之一。这种“大模型 + 小路由器”的设计模式,在推理效率和任务性能之间取得了极佳平衡,且无需改变已有模型的预训练权重,移植性极强。
论文所有代码、训练日志、评估数据均已开源,可以轻松复现并迁移到其他 VLA 架构上。对于正面临车载算力约束和实时性要求的自动驾驶研究者而言,BLUE 提供了一个立即可落地的优化方向——不是加大模型,而是聪明地决定何时“动脑”,何时“凭直觉”驾驶。