Armor推荐理由 恶劣天气评测常把所有错误压成一个分数。ObsDriveBench 逐级检查传感器是否看清目标、模型是否理解空间关系、决策是否避开风险,让模型“选择减速仍然找错危险位置”的问题可以被单独识别。
原论文信息
论文标题: ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness
发表日期: 2026年7月
发表单位: 香港中文大学计算机科学与工程系;香港中文大学医学智能与扩展现实研究所
期刊: arXiv 预印本
原文链接:arXiv:2607.23537[1]
开源代码:ObsDriveBench 仓库入口[2]
通讯作者: Jiaqi Xu,香港中文大学
恶劣天气先破坏观测,错误随后传到决策
自动驾驶多模态模型遇到雾、雪、雨夹雪和低照度时,每种传感器受到的影响并不相同。相机容易丢失纹理和颜色,激光雷达会因散射出现稀疏点云,雷达受天气影响较小,提供的几何细节也更粗。不同传感器还可能对同一个目标给出互相矛盾的信息。
许多现有基准只在正常天气中评测,或者给图像添加合成噪声。最终轨迹分数可以说明模型答错了,无法指出错误从哪里开始。模型可能没有识别出某个传感器已经失真,也可能看到了目标并判断错相对位置,还可能理解了道路关系并选错轨迹。
ObsDriveBench 把错误来源分成可观测性感知、空间可靠性和风险感知决策三个维度。这个划分把模型的处理过程变成一条可检查的证据路径:先确认每种传感器看到了什么,再检查多模态空间关系,随后判断风险区域和候选轨迹。
图1:模型可能给出保守驾驶动作,同时在目标可观测性、空间位置或风险区域上答错。
三层诊断怎样从真实多传感器数据中建立
论文使用 K-Radar 的同步相机、激光雷达和雷达数据。每个样本覆盖 21 帧,对应过去 1 秒、当前时刻和未来 1 秒。激光雷达与雷达点云先被渲染成鸟瞰图,再与相机图像一起送入视觉语言模型。
基准先给每个物体在每种模态中的可观测程度分级。0 表示不可观测,1 表示部分可观测,2 表示完全可观测。这个元标注为后续问题提供了参照,模型不能只靠常识猜测天气或道路类型,还需要对照传感器输入判断目标是否可靠。
三组任务分别检查不同环节:
可观测性感知检查单个模态是否看清目标,以及多个模态的判断是否一致。空间可靠性检查 2D 与 3D 对齐、相对位置和交通参与者之间的交互关系。风险感知决策检查风险区域、保守回退动作和候选轨迹是否安全。元标注和问题由多个大模型生成、修订,再交给计算机与工程领域的博士级标注者核验。论文报告的人工核验通过率分别为 99.96%、97.20% 和 99.96%。基准共有一千四百多个训练帧、一千三百多个测试帧,生成一万四千多道训练题和一万三千多道测试题。
图2:真实恶劣天气数据依次经过可观测性元标注、场景描述和三组选择题构建。
基准验证:保守动作答对了,风险位置仍会答错
论文先让 14 个现成模型参加评测,不使用 ObsDriveBench 训练数据做适配。结果显示,多数模型最先在可观测性感知上失分,跨模态对照和雷达输入尤其困难。GPT-5 在三个维度的平均分为 41.89、61.04 和 66.80,Gemini-3.1-Pro 为 54.72、88.04 和 80.22,Qwen3VL-32B 为 41.44、67.10 和 79.71。
更有工程含义的结果来自风险题。许多模型的保守回退动作准确率超过 90,说明它们经常会选择减速或停车。风险识别和轨迹评估的分数明显较低。GPT-5 的保守回退得分为 92.22,风险识别与轨迹评估分别只有 53.30 和 54.48。车辆动作看起来谨慎,并不能证明模型找对了风险来源。
图3:模型在可观测性感知、空间可靠性和风险感知决策上的得分差异较大。
作者随后以 Qwen2.5VL-7B-Instruct 为基础训练 ObsDrive。正常天气监督微调版本的三组平均分为 54.99、79.79 和 84.85;加入雾、雪、雨夹雪和雨天数据做 GRPO 强化学习后,分数提高到 65.31、83.85 和 86.44。增幅主要来自可观测性感知,说明训练数据包含退化观测后,模型更容易识别传感器是否可靠。
雷达仍是薄弱输入。GPT-5 对相机、激光雷达和雷达可观测性的得分分别为 48.80、46.55 和 35.31。ObsDrive-RL 的对应得分提高到 69.58、64.85 和 64.53。这里评测的是雷达鸟瞰图的视觉理解,不能据此判断模型处理原生雷达张量的水平。
图4:多数模型对雷达可观测性的判断弱于相机和激光雷达,针对性训练缩小了差距。
跨数据集评测提供了另一组约束。ObsDrive 在 DriveBench 的 20 个天气任务上都高于原始 Qwen2.5VL-7B,DriveLMM-o1 夜间与雨天子集也保持小幅提高。跨数据集增量低于同域评测,现有证据支持训练策略有效,还不足以证明它能适应不同传感器配置、地区和天气分布。
诊断结果不能替代车辆规划评测
ObsDriveBench 采用选择题,用于定位观测、空间理解和风险判断中的错误。它没有让模型控制车辆,也没有测量连续轨迹执行、控制延迟或碰撞率。论文作者明确说明,选择题准确率不能替代车辆实际运行中的规划指标。
激光雷达和雷达都以鸟瞰图形式进入视觉编码器。视觉化接口方便沿用现有视觉语言模型,也改变了原始传感器信息的表达方式。原生点云密度、雷达速度信息和张量级融合能否得到相同结论,需要另行验证。
基准还依赖单一 K-Radar 数据源。大模型先生成元标注和问题,人工核验减少了明显错误,题型与表述仍可能保留生成模型的偏好。论文已经给出仓库入口,数据和评测代码的完整发布状态仍待确认,复现条件目前没有完全明确。
Armor三问
1. 雷达在恶劣天气下相对稳定,为什么模型对雷达的可观测性判断仍然较弱?
这里的稳定指传感器受雨雾影响较小,不代表视觉语言模型已经学会读取雷达。ObsDriveBench 把雷达点云渲染成鸟瞰图,模型需要从稀疏、几何细节有限的图像中识别目标。现有视觉语言预训练主要来自自然图像,雷达鸟瞰图与训练分布差异较大。
2. 三层选择题能否说明自动驾驶模型已经具备安全规划水平?
不能。选择题可以指出模型在哪个理解环节答错,无法测量连续驾驶中的轨迹执行、控制响应和碰撞风险。它可以作为模型进入车辆规划评测前的诊断工具。
3. 强化学习把三组分数都提高了,是否说明恶劣天气泛化问题已经解决?
现有结果只支持针对性训练可以改善同域表现。可观测性感知从 54.99 提高到 65.31,增幅最明显;跨数据集增量较小,其他地区、传感器配置和真实车辆运行仍缺少证据。
Armor测评
学术/科研价值: ★★★★☆
论文把恶劣天气多模态失效分成可观测性、空间理解和风险决策三个可测环节,并使用真实同步传感器数据建立诊断基准。单一数据源和模型辅助构题限制了结论范围。
工业/工程价值: ★★★☆☆
基准可以在车辆实测前筛查模型对退化观测和跨模态冲突的理解问题。选择题、鸟瞰图输入和缺少车辆控制实验,使它目前主要用于模型评测与数据迭代。
商业/产品价值: ★★☆☆☆
论文交付的是评测基准与参考模型,尚未形成可部署的驾驶功能。商业使用还需要完整数据许可、稳定评测工具、更多地区数据和车辆规划指标。
可能的问题: 模型可能学到题目结构或特定数据集中的天气特征。传感器输入经过视觉化处理,选择题高分也不能保证车辆运行安全。
主要参考文献
Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng. (2026). ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness. arXiv:2607.23537.
本文仅代表个人理解及观点,不构成任何论文审核或项目落地推荐意见,具体以相关组织评审结果为准。论文内容如有理解偏差,以原文为准。欢迎就论文内容交流探讨,理性发言哦~
对自动驾驶多模态感知与恶劣天气评测感兴趣的朋友,欢迎关注Armor知道公众号!
[1] arXiv:2607.23537:https://arxiv.org/abs/2607.23537[2] ObsDriveBench 仓库入口:https://github.com/russellyq/ObsDriveBench