关注我,帮你了解自动驾驶最新动态!

自动驾驶最难的,不只是识别已经出现在镜头里的车。更麻烦的是:货车、建筑、路牌后面可能还藏着一个目标,但它到底会不会影响自己的行驶路线?
如果系统把所有遮挡都当成高风险,就会变得过度保守,动不动就减速甚至停住;如果它只靠补全场景去猜,又可能编出并不存在的目标。真正的问题是:哪些看不见的目标,才是规划必须关心的目标?
IROS 2026 论文 What’s Hidden Matters 给出的思路,是把遮挡判断和下游规划直接连起来:先用 Planning KL-divergence 找出会显著改变 ego 车辆轨迹的隐藏目标,再用这些样本训练 VLM 做结构化风险推理。论文报告,PKL 选样比随机选样带来约 30% 的表现提升。
▍团队与论文信息
团队
Honda Research Institute;Drexel University
论文
IROS 2026;arXiv:2607.00283
作者
Amirhosein Chahe、Tyler Naes、Jovin D’sa 等
数据
nuScenes + Occ3D;GPT-5 生成结构化标注
任务
识别会影响规划的隐藏交通参与者
▍不是所有遮挡都同样值得刹车
路边停着一辆大货车,后面可能有行人,也可能什么都没有。直觉上,我们会说“有遮挡,要小心”。但自动驾驶系统不能只停留在这个层面。
有些遮挡离自己很远,或者即使出现目标也不会改变当前轨迹;有些遮挡则刚好在路口、车道汇入点或施工区域,一旦目标突然出现,ego 车必须立刻调整速度和方向。

所以,这篇论文不是让 VLM 泛泛地回答“有没有遮挡”,而是让它回答一个更接近驾驶规划的问题:这个隐藏目标如果真的存在,会不会改变我接下来几秒的轨迹?
▍论文怎么找到真正关键的隐藏目标
研究者把场景里的所有交通参与者分成两类:可见集合 V,和被遮挡的隐藏集合 H。然后比较两种规划分布:如果知道所有目标,ego 车会怎么走;如果只知道可见目标,它又会怎么走。

这就是 PKL 的作用。它不是直接判断“这个目标像不像车”,而是衡量“忽略这些隐藏目标后,规划分布偏离了多少”。偏离越大,说明这些隐藏目标越关键。
▍关键公式只回答一个问题:看不见它,路线会变多少
论文里最值得保留的是下面两行。第一行衡量隐藏目标导致的规划分布差异;第二行衡量单个隐藏目标被“看见”后,能让这个差异减少多少。

这里的 A 表示所有交通参与者,V 表示当前可见参与者,x 是 ego 车未来姿态分布。直观说,如果把某个隐藏目标加入可见集合后,规划分布明显更接近“全知道”的情况,那么这个目标就更值得优先关注。
▍它不是让 GPT-5 随便看图写答案
数据生成流程分三步。第一步,用 nuScenes 和 Occ3D 找出被遮挡目标;第二步,用 PKL 给隐藏目标排序,只保留真正会影响轨迹的高风险样本;第三步,把多相机时间序列和目标信息交给 GPT-5,生成结构化 JSON 标注。

结构化标注包含目标类别、可见线索、遮挡物类别、遮挡类型、动作假设、优先级和所在 BEV 方位。这样的输出比一句“可能有危险”更有用,因为它可以继续传给驾驶辅助、协同感知或下游规划模块。
▍结果一:小模型微调后,反而超过大模型零样本
论文构建了 1,250 个场景窗口,包括 22,500 帧相机图像和 3,750 条 GPT-5 结构化标注。随后,研究者在 Qwen2.5-VL、InternVL3.5、Gemma-3、MiniCPM-V 和驾驶领域模型上做了评测。

一个很有传播点的结果是:InternVL3.5-1B 的平均准确率从 0.092 提升到 0.545;Qwen-3B 微调后达到 0.478,超过 Qwen-72B 零样本的 0.440。
这说明,遇到这种高度特化的驾驶遮挡任务,模型规模并不是唯一答案。更关键的是训练数据是否真的围绕“会影响规划的遮挡”来构造。
▍结果二:模型开始学会看间接线索
遮挡场景往往没有完整目标,只有一点车头、反光、运动痕迹,或者旁边交通参与者的反应。论文的定性结果显示,微调后模型更容易把这些局部线索和隐藏目标的类别、方位、优先级联系起来。


▍结果三:PKL 选样比随机选样更有效
论文还做了一个关键消融:如果不用 PKL,只随机选择隐藏目标来训练,会怎么样?结果很直接。

Qwen-7B 的平均准确率从随机选样的 0.405 提升到 0.543,提升约 34%;InternVL3.5-8B 从 0.429 提升到 0.565,提升约 32%。论文把这个总结为:PKL-guided selection 提供约 30% 更好的结果。
▍这项工作为什么值得关注
自动驾驶里的 VLM 不能只会描述画面,还要知道哪些视觉不确定性会传导到规划风险。否则,它可能把无关遮挡讲得很严重,也可能漏掉真正会逼车改道的目标。
这篇论文的价值在于,把“看不见的风险”从一个感知问题,往规划问题推进了一步。它让模型优先学习那些会改变下游轨迹的遮挡,而不是学习所有遮挡的平均规律。
▍也要谨慎看边界
这还不是自动驾驶遮挡风险已经解决。论文主要在 nuScenes 上构建和验证,结构化标注依赖 GPT-5 生成并经过审查;真正的闭环规划收益,还需要在更多数据集和驾驶系统中验证。
另外,VLM 推理仍有延迟。论文报告不同架构推理大约在 47 到 323 ms 范围内,小模型已经接近低频并行推理的可能,但离严格实时安全闭环还有距离。
▍最后想问
如果你在设计自动驾驶系统,遇到路口货车遮挡时,你更倾向于让车对所有遮挡都保守减速,还是只对真正可能改变轨迹的遮挡重点处理?
如果你想持续看机器人、具身智能和自动驾驶论文的可读版拆解,可以关注本号。
▍往期精选
1. 大模型不是来开车,而是来出难题:TrafficAlign 让自动驾驶碰撞率降了 36.1%