如果你一直关注自动驾驶,可能会发现一个有趣的现象:现在的车在封闭高速上开得比谁都稳,但一到人车混行的复杂老城区,或者遇到前方突然掉落的奇形怪状的货物,它可能就会突然“犯傻”,甚至一脚急刹把你吓出冷汗。
为什么?因为过去的自动驾驶,本质上是个 “做题家”。
01 为什么“做题家”搞不定复杂路况?
目前主流的 “端到端自动驾驶”(比如经典的UniAD、VAD等),虽然把感知、预测和规划揉进了一个神经网络里,但它们的主要学习方式是 “模仿学习”(行为克隆)。
简单来说,就是给AI看几百万个小时的老司机开车视频,让它死记硬背:“看到这种画面,方向盘该打多少度,油门踩多深”。
- 优点是: 学得快,常规路况开得很溜。
- 致命缺点是: 缺乏常识,不会推理。遇到训练集里没见过的“超纲题”(长尾场景/Corner Case),它根本不知道为什么要这么开,只会不知所措。
为了让汽车拥有像人类一样的“常识”和“逻辑思考能力”,科学家们请出了今天的终极主角——VLA模型。
02 什么是VLA模型?
VLA(Vision-Language-Action,视觉-语言-动作),你可以把它理解为给汽车装上了一个 “拥有常识的超级大脑”。它由三个部分组成:
- 👁️ V (Vision 视觉):汽车的眼睛。通过摄像头、激光雷达看清周围的车、人、红绿灯和路况。
- 🧠 L (Language 语言):汽车的大脑(常识与推理)。这里接入了“大语言模型(LLM)”的能力。语言模型不仅会聊天,它更吸收了全人类互联网上的物理常识和逻辑推理能力。
- 🕹️ A (Action 动作):汽车的手脚。直接输出方向盘转角、刹车力度、加速等控制指令。
VLA 是怎么开车的?我们来看一个极端的例子:
🎈 场景: 前方路边突然滚出来一个皮球。 ❌ 传统端到端模型: 训练集里没见过这么花哨的皮球,识别不出是什么障碍物,可能直接撞上去。 ✅ VLA 模型(思维链推理):
- (V 视觉):看到路边滚出一个球状物。
- (L 语言思考):“常识告诉我,有皮球滚出,大概率后面会跟着一个捡球的小孩冲出来。所以我不能只盯着球,必须减速并准备向左侧避让。”
- (A 动作):输出“轻踩刹车、向左微调方向”的控制指令。
这种“先想清楚,再动手”的过程,在AI领域被称为思维链(Chain-of-Thought)推理。它不仅知道怎么开,还能用人类语言告诉你 “我为什么这么开”,大大提升了自动驾驶的安全感和可解释性!
03 目前有哪些“明星” VLA 模型?
在学术界和工业界,VLA已经成为自动驾驶最前沿的“兵家必争之地”。以下是目前最具代表性的几个“老司机”模型:
1. AutoVLA:边想边开的“自回归”老司机
AutoVLA将“思维链推理”和“动作生成”完美融合在一个自回归框架中openreview.net。它就像人类司机一样,脑子里一边嘀咕(生成语言推理),手上同步就在打方向盘(生成轨迹),让思考和动作高度同频。
2. DriveVLM:清华系出品的“场景理解大师”
DriveVLM巧妙地将强大的视觉大模型(VLM)与自动驾驶规划器结合。它非常擅长处理那些“难以用规则定义”的复杂场景,比如前方发生连环车祸、或者交警在路口打着手势,DriveVLM能像人一样看懂这些复杂的视觉语义,并规划出安全的绕行轨迹。
3. GPT-Driver:Waymo的“语言开车”脑洞
这是谷歌Waymo团队提出的一个极具颠覆性的想法:他们直接把“运动规划”变成了一道“语言填空题”!GPT-Driver把车辆未来的行驶轨迹,翻译成了一种“特殊的语言词汇”。这意味着,大语言模型不仅是在“说话”,它其实是在“预测汽车下一秒该去哪”。
4. ORION与FutureSightDrive:会“脑补”未来的预言家
- ORION利用大语言模型来理解场景,并生成多模态的驾驶推理
arxiv.org
。 - FutureSightDrive则更进一步,它能在脑海中 “生成未来的画面”。在决定怎么开之前,它先在脑子里“放电影”,想象出未来几秒场景会怎么演变,从而选出最安全的路线。
5. OpenVLA / OpenDriveVLA:开源界的“万能底座”
OpenVLA 原本是斯坦福等机构开源的用于控制机械臂的通用VLA模型。但由于其强大的泛化能力,现在很多开发者直接拿它微调,变成了控制方向盘、甚至让机器狗开车的“具身智能底座”。
04 VLA的“阿喀琉斯之踵”与最新破局
听起来VLA简直完美,那为什么现在路上跑的还不是它们?答案是:太重、太慢、太费钱。
让一个几十亿参数的语言大模型去“推理”,然后再去“控制车辆”,算力消耗极大。在高速上,哪怕推理延迟多出0.2 秒,都可能导致致命的车祸。此外,大模型有时候还会“产生幻觉”(一本正经地胡说八道),这在开车时是绝对不允许的。
💡 最新的破局思路是什么?
就在最近的前沿研究中,科学家们提出了像SimWAM这样极具创意的新方法。 既然庞大的语言模型太慢,那我们就 “取其精华”:研究人员发现,那些专门用来生成 Sora 视频的 “视频生成大模型”,其实早就深刻理解了物理世界的“运动规律(Motion Prior)”。 于是,SimWAM直接把视频模型里对“物理运动”的理解,提取出来注入到一个轻量级的动作网络中。这样既不需要庞大的语言模型去慢吞吞地推理,又能让汽车拥有“懂物理、懂常识”的直觉,实现了更聪明且更轻量的轨迹预测!