别再只让自动驾驶“看见世界”了,它还得懂物理
自动驾驶最难的地方,从来不只是识别红绿灯、车道线和行人。
真正难的是:
车看见了这个世界之后,能不能推演接下来会发生什么。
前车会不会变道? 行人会不会横穿? 路口车辆会不会突然左转? 模型在一个城市训练好,换到另一个城市还能不能用?
这就是自动驾驶里的核心问题之一:
trajectory prediction,轨迹预测。
最近看到一篇 2026 年的工作,很适合放在“车辆 + AI4S + 机器学习”的交叉方向里看:
A Generalizable Physics-guided Causal Model for Trajectory Prediction in Autonomous Driving
论文提出了一个 Physics-guided Causal Model,PCM,目标不是单纯把轨迹预测误差刷低,而是解决一个更本质的问题:
自动驾驶模型怎么在没见过的新城市里继续做出合理预测?
1. 现在很多自动驾驶模型,最大问题不是不会学,而是太会“背题”
现在的自动驾驶轨迹预测模型,大多是典型机器学习路线。
给模型输入:
然后让模型预测未来几秒的轨迹。
这个路线看起来很合理。
但问题在于,纯数据驱动模型很容易学到数据集里的“表面规律”。

比如在城市 A 训练时,模型可能学到:
这个路口宽度是这样的。 这个车道布局是这样的。 这个转弯半径大概是这样的。 这个城市的车一般这样开。
然后换到城市 B,车道宽度、道路走向、交通密度、驾驶习惯都变了。
模型就开始失效。
这不是模型没有能力,而是它学到的东西不够本质。
它学到了“这个数据集里经常这样”,但没有真正理解:
车为什么会这样运动。
论文把这个问题说得很直接:纯数据驱动机器学习方法容易受到 spurious correlation,也就是虚假相关的影响,因此在 unseen domains 上泛化困难。
这句话放在自动驾驶里,其实很要命。
因为真实道路永远是 open world。
你不可能把所有城市、所有路口、所有交通状态都采一遍。
所以模型必须具备一种能力:
不是记住场景,而是提取跨场景不变的规律。
2. 这篇文章的核心想法:让模型同时学“因果不变性”和“车辆物理”

这篇论文的关键点不是简单加一个 Transformer,也不是把模型堆大。
它的核心是两个东西:
第一,domain-invariant scene representation。也就是提取跨城市、跨数据集仍然稳定的场景表示。
第二,vehicle kinematics。也就是车辆运动学规律。
简单说:
自动驾驶模型不应该只学“地图长什么样”,还应该学“车辆在物理上怎么动”。
比如一辆车转弯,不是随便画一条曲线就行。
它要受速度、航向角、转向角、加速度、轴距等因素约束。
如果模型预测出一条看起来误差不大,但物理上非常别扭的轨迹,那在真实自动驾驶系统里仍然危险。
所以 PCM 的核心思想可以概括成一句话:
用因果表示学习去过滤场景里的伪相关,用车辆运动学去约束轨迹预测的物理合理性。
这就是它和普通轨迹预测模型的区别。
普通模型更像是在回答:
根据历史数据,未来轨迹大概率是什么?
PCM 更像是在回答:
在这个场景中,哪些信息是跨域稳定的?在车辆运动学约束下,未来轨迹应该怎么演化?
这就开始有 AI4S 的味道了。
因为 AI4S 不是简单用 AI 做预测,而是把科学规律、物理约束、因果机制和机器学习结合起来。
3. PCM 的结构:一个解耦场景编码器,一个 CausalODE 解码器
论文里的 PCM 主要包含两个模块:
Disentangled Scene EncoderCausalODE Decoder
第一个模块负责“去伪相关”。
第二个模块负责“懂车辆物理”。
论文明确写到,PCM 由两个核心组件构成:Disentangled Scene Encoder 使用 intervention-based disentanglement 从场景中提取 domain-invariant features,CausalODE Decoder 使用 causal attention 把运动学模型和上下文信息融合起来。
4. Disentangled Scene Encoder:不要把城市特征当成通用规律
自动驾驶数据里有很多信息并不是通用规律。
比如:
这些东西可能在训练集里很有用。
但到了新城市,它们反而会误导模型。
所以论文做了一件事:
把场景特征拆成两部分。
一部分是 domain-invariant features,也就是跨城市稳定的信息。
另一部分是 domain-variant features,也就是和具体城市、具体数据集强相关的信息。
然后通过 intervention 的方式,模拟“移除域特定特征”之后模型还能不能预测稳定轨迹。
这背后其实是因果表示学习的思路。
模型不能只依赖训练环境里的偶然相关性,而要尽量学习对环境变化更稳定的因果因素。
对自动驾驶来说,这件事很关键。
因为现实部署不是在测试集上跑分,而是在没见过的道路上行驶。
5. CausalODE Decoder:轨迹不是画出来的,是被动力学推出来的
第二个模块更有意思。
论文没有只用一个普通 decoder 直接输出未来轨迹,而是引入了车辆运动学。
它使用的是 bicycle kinematic model,也就是常见的车辆自行车运动学模型。
车辆状态包含位置、航向角和速度等信息,同时转向角、加速度和轴距等因素影响车辆未来状态。论文把这种车辆运动学嵌入 neural ODE 中,用来学习车辆动力学,并把它作为 decoder 的 trajectory query 初始化。
这一步很关键。
因为普通深度模型预测轨迹,很多时候像是在“画线”。
而加入车辆运动学之后,它更像是在做:
[ x_{t+1}=f(x_t,u_t) ]
也就是从当前状态出发,按照车辆运动规律推演未来状态。
当然,真实驾驶环境非常复杂,不可能只靠一个简化物理模型解决所有问题。
所以 PCM 没有完全依赖物理模型,而是把物理模型和神经网络结合起来。
这就是典型的 physics-guided ML:
物理模型负责提供稳定先验,神经网络负责学习复杂场景中的未知项。
这比纯物理模型更灵活,也比纯神经网络更可靠。
6. 为什么这篇文章适合AI4S?
很多人理解 AI4S,容易只想到蛋白质、材料、天气、流体。
但车辆其实也是非常典型的科学智能系统。
车辆里面有:
自动驾驶轨迹预测,本质上不是普通时间序列预测。
它涉及:
物理约束下的多智能体未来状态推演。
所以这篇文章有几个明显的 AI4S 特征:
第一,它不是只看数据相关性,而是强调物理规律。
第二,它不是只追求单数据集精度,而是关注跨域泛化。
第三,它不是只做黑盒预测,而是加入车辆运动学机制。
第四,它把因果表示学习和物理建模结合起来。
这几个点加在一起,就比“我换了一个更强的 Transformer backbone”更有研究价值。
7. 实验怎么做?它看的是 zero-shot 泛化
这篇文章的实验设置也比较对味。
它不是只在一个数据集里 train/test split,然后报告 ADE、FDE。
论文做了 zero-shot cross-domain evaluation。
包括:
- 在 nuPlan 上训练,在 nuScenes 上测试
- 在 Waymo Open Motion Dataset 上训练,在 nuPlan 上测试
也就是说,模型在训练时没有见过目标域,直接去新数据集测试。
这比普通同域测试更接近真实部署。
因为真实自动驾驶系统不可能只在训练城市里工作。
一个模型如果只是在单一数据集上高分,但换个城市就崩,那工程意义有限。
论文结果显示,PCM 在 zero-shot setting 下优于多个竞争性 baseline。作者认为性能提升来自两个关键知识:physics knowledge 和 domain-invariant features。
这也说明一个问题:
物理规律和因果不变性,可能是自动驾驶泛化能力的重要来源。

8. 这篇文章最值得借鉴的,不是模型本身,而是选题叙事
如果只是复现 PCM,价值有限。
真正值得学的是它的选题逻辑。
它不是说:
我提出一个新模块,让 ADE 降了多少。
而是说:
现有自动驾驶轨迹预测模型存在跨域泛化不足的问题。 这个问题来自纯数据驱动模型对虚假相关的依赖。 车辆运动学是跨场景稳定的物理知识。 因果表示可以帮助模型提取 domain-invariant features。 所以我们构建一个 physics-guided causal model。
这个叙事就非常清楚。
问题不是“缺一个模块”。
问题是“自动驾驶模型缺少跨域稳定的科学规律”。
这就是 AI4S 和普通深度学习论文的区别。
普通深度学习论文经常是:
我设计了一个模块,所以效果更好。
AI4S 导向论文更应该是:
这个科学系统存在某种机制性约束,现有 AI 模型没有利用它,所以泛化和可靠性不足。
这也是后续想冲 AAAI、IJCAI、NeurIPS workshop 或者自动驾驶方向顶会时更应该采用的写法。
9. 如果继续往顶会导向改,可以怎么做?
比如可以做:
Physics-Grounded Causal World Model for Autonomous Driving
不只是预测一条轨迹,而是学习一个更完整的 world model。
输入当前场景,模型不只输出未来轨迹,还能回答:
如果前车突然刹车会怎样? 如果路面摩擦系数降低会怎样? 如果当前车辆速度提高 20% 会怎样? 如果左侧车辆强行并线,ego vehicle 应该如何反应?
这就从 trajectory prediction 走向了 counterfactual driving reasoning。
这会更接近 AAAI 关心的问题:
也可以把评价指标从 ADE/FDE 扩展到:
- counterfactual consistency
- domain generalization gap
- safety-aware planning performance
这样就不只是自动驾驶预测论文,而是更像“物理因果世界模型”论文。
10. 这篇文章也有局限
当然,这篇工作也不是完美的。
论文自己也提到,目前实现依赖 simplified bicycle model,可能无法完全刻画真实车辆复杂动力学,未来可以引入更复杂的运动学模型来提高 physical fidelity。
这个局限反而给了后续研究空间。
比如:
- 从 prediction 扩展到 planning 和 control
如果目标是做车辆 + AI4S,这些方向都比单纯换网络结构更有价值。
11. 总结:自动驾驶不是只需要更大的模型,而是需要更懂物理的模型
这篇 PCM 给我的最大启发是:
自动驾驶轨迹预测不能只依赖数据拟合。
模型要想真正泛化到没见过的城市和道路环境,必须学到更稳定的规律。
这些规律可能来自三个层面:
第一,物理规律。车辆不能随便运动,它要满足运动学和动力学约束。
第二,因果规律。模型不能被城市、地图、数据集偏差中的伪相关带偏。
第三,场景规律。道路拓扑、交通规则、多智能体交互中存在跨域稳定结构。
所以未来自动驾驶模型的发展,不只是“更大规模的数据 + 更大的 Transformer”。
更关键的是:
让模型知道什么是相关性,什么是因果性,什么是物理上不可能。
这正是车辆方向和 AI4S 结合的核心价值。
一句话概括这篇文章:
它不是让自动驾驶模型多看几个城市,而是让模型学会哪些规律换一个城市也不会变。
这才是自动驾驶真正需要的泛化能力。