✨导读:自动驾驶里的多模态模型不能只理解当前画面,还要预判“如果接下来这样开,会发生什么”。FSU-QA/FSU-Bench 用 nuScenes 构建 850 段真实驾驶视频、21K+ QA,覆盖 9 类低/中/高层前瞻任务。实验显示,13 个 VLM 在高层反事实推理上普遍吃力,而针对性微调能把 Qwen3-VL-8B 从 41.48 提升到 59.59。
• 作者: Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li
• 单位: Nankai University;The University of Hong Kong;NKIARI, Shenzhen Futian;A*STAR Institute of Advanced Intelligence and Computing, Singapore
• 论文标题: Thinking Ahead: Foresight Intelligence in MLLMs and World Model
• 论文链接: https://arxiv.org/abs/2511.18735
• 发表信息: ECCV 2026
• 数据集链接: https://huggingface.co/datasets/Gong-Grant/FSU-QA
🔍 行业背景:看懂现在,不等于能推演未来
自动驾驶场景里的 VLM 如果只会描述当前画面,还远远不够。真实道路上,安全决策依赖对未来的语义判断:前车会不会变道,行人是否要穿行,如果自车强行左转会不会发生碰撞,高风险区域是否会进入行驶路径。
论文把这种能力称为 Foresight Intelligence。它区别于普通 planning benchmark:不是问“现在该怎么开”,而是问“在给定历史观察、轨迹和假设动作后,未来语义后果是什么”。这需要模型做多智能体交互建模、长时域推演和反事实因果判断。
图注:原文 Figure 1。该图概览 FSU-QA 与 FSU-Bench:从 800+ 场景生成 9 类任务、21K+ QA,并把低层动态推理、中层风险评估和高层反事实预测组织成一个前瞻智能评测体系。
💥 新任务:3 秒历史,看 12 秒未来
FSU-QA 的输入不是完整未来,而是历史前视视频与历史轨迹。论文基于 nuScenes,把每段约 15 秒前视视频切成 3 秒历史观察窗口和 12 秒未来窗口。模型需要根据历史帧、轨迹和问题,回答未来相关的多选题。
9 类任务被分为三层:
1.低层时空动态推理:Speed Change、Turn Change、Lane Change、Relative Distance、Relative Position。
2.中层 VRU 风险评估:Pedestrian Intent、Ego-VRU Relative Position、Risk Area。
3.高层因果推理:Counterfactual Prediction,要求模型判断假设动作会不会带来碰撞或其他安全后果。
图注:原文 Figure 2。该图展示 FSU-Bench 的任务可视化:黄色框表示历史帧,绿色框表示未来帧,问题模板覆盖自车运动趋势、相对位置、行人意图、风险区域和反事实预测。
表注:原文 Table 1。对比 NuScenes-QA、DriveLM、OmniDrive、DriveGPT4 等驾驶 VQA benchmark,FSU-QA 独有 12 秒长时域推理、9 层级认知任务、multi-agent-aware 反事实 QA 和 World Model 语义评估。
🧱 数据构建:850 段视频,21K+ QA,人工复核兜底
FSU-QA 用自动标注生成规模,再用人类专家把关键质量风险压下去。论文从 nuScenes 的前视相机、轨迹、3D 标注和 HD map 中生成问题答案。每个场景根据可回答性过滤,通常产生 18 到 28 个问题。
最终数据包含 850 段真实驾驶视频和 21K+ QA。其中 18K QA、700 个场景用于训练,3K+ QA、150 个场景作为 FSU-Bench 测试集。任务分布上,低层任务占 72.94%,中层风险任务占 7.76%,高层反事实预测占 19.29%。
质量控制上,作者随机抽取 45 个场景,约占 FSU-Bench 的 30%,由 3 名自动驾驶领域专家独立审查。经过三轮迭代,最终修订或删除 654 个 QA。高层 CFP 标注还通过专家抽样验证,自动标签与人工判断一致率为 89%,Cohen’s κ 为 78%。
图注:原文 Figure 3、Figure 4。两张图展示 FSU-QA 的数据构建流程和任务统计:系统先用轨迹、HD map、关键帧和规则生成 QA,再经过 human-in-the-loop 审查保证反事实与风险类问题可靠。
📊 硬核实测:GPT-5 第一,但整体也只有 48.66
零样本评测说明,当前 VLM 的前瞻能力还很有限。论文评测 13 个 VLM,包括 Qwen2.5-VL、Qwen3-VL、Llama 4、GPT-4o Mini、GPT-5、Gemini、Claude 等。GPT-5 总分最高,为 48.66;Claude-Sonnet-4.5 为 46.38;开源模型中 Qwen2.5-VL-72B 为 45.86。
从任务看,模型在低层 maneuver 预测上相对强,比如 Qwen2.5-VL-72B 的 Turn Change 为 90.17,Lane Change 为 97.50。但高层 Counterfactual Prediction 很弱:GPT-5 只有 20.75,Qwen2.5-VL-72B 为 10.31,Qwen3-VL-8B 只有 5.35。
表注:原文 Table 2。主结果表展示 13 个 VLM 在 9 类 FSU-Bench 任务上的准确率。它揭示了一个典型断层:短期动作趋势可以做,复杂多主体关系和反事实安全后果仍然难。
针对性训练效果非常明显。作者用 FSU-QA 微调 Qwen3-VL-8B,得到 Qwen3-VL-8B-FI,总分从 41.48 提升到 59.59;Counterfactual Prediction 从 5.35 提升到 50.20,Risk Area 从 45.33 提升到 66.00。这说明前瞻智能不是不可学,而是常规预训练语料覆盖不足。
🧪 World Model 评估:未来视频/轨迹有没有语义价值
这篇论文还把 FSU-Bench 用作 World Model 的语义一致性评估器。标准 FVD、FID 更偏像素质量,难以回答“生成的未来是否对下游驾驶推理有帮助”。FSU-Bench 的 proxy protocol 是:把 World Model 生成的未来视频或未来轨迹喂给 VLM,如果 QA 准确率提升,就说明这些预测包含可用语义信息。
论文评估了 Epona 和 DrivingWorld 两类 World Model,并做了 shuffled control:把某个场景的预测未来随机替换成其他场景的预测。结果显示,乱序未来会降低准确率,说明真实提升并非来自“多给了 token”,而是来自预测内容本身的语义信息。
图注:原文 Figure 5、Figure 6。两张雷达图比较 Epona 与 DrivingWorld 生成的视频、轨迹、视频+轨迹对 VLM 的增益。总体看,视频更补运动线索,轨迹更补关系线索,两者融合通常更全面。
补充表中也能看到这种趋势。以 DrivingWorld 预测轨迹为例,Qwen3-VL-8B-FI 总分从 baseline 59.59 提升到 67.11;Epona 预测轨迹设置下提升到 66.38。论文认为 DrivingWorld 在时间一致性和 agent-agent 关系上带来的收益更稳定。
✅ 全文总结:前瞻智能需要数据、评测和世界模型一起推进
FSU-QA 把自动驾驶多模态理解从“当前场景问答”推进到“未来语义推演”。它的贡献不只是一个数据集,而是把 VLM 的前瞻能力和 World Model 的语义一致性放在同一个 QA 框架里测。
这也给工程实践一个清晰提醒:真正安全的驾驶智能不能只依赖漂亮的当前帧理解。模型必须能基于历史、轨迹、地图和假设动作,提前推演多主体互动及其风险后果。