2023年的CVPR会议上,特斯拉自动驾驶软件总监Ashok Elluswamy用15分钟介绍一个叫通用世界模型的东西。
他提出,仅凭车道线检测、障碍物识别等离散感知模块,无法构建对驾驶场景的时序一致性理解。
唯有通过神经网络从海量驾驶视频中学习以过去预测未来的能力,才能生成连贯、物理一致的场景演化,支撑安全决策。
这个模型可以在云端生成用于训练和仿真的驾驶场景,也可以压缩部署到车端,这一技术也成为大家熟知的世界模型。
那世界模型就是特斯拉提出的吗?其实不然,世界模型的源头,要比2023年早得多。
01
从认知科学到强化学习
1943年,苏格兰心理学家肯尼斯·克雷克出版了一本不到两百页的小册子《解释的本质》。
他在书中提出一个假说,人在对现实作出反应之前,会先在大脑中构建一个小规模的现实模型,用来模拟可能发生的过程,再据此选择行动。
这个理论后来被称为心智模型。彼时数字计算机尚未诞生,但克雷克的假说已经触及了智能的核心,真正的智能不是被动反应,而是主动推演。
图片源自:网络
这个想法沉寂了近半个世纪,直到被人工智能研究者重新发现。
上世纪90年代,强化学习领域的先驱理查德·萨顿提出了Dyna架构,在强化学习领域首次将世界模型确立为智能体内部的一项基础能力。
智能体在学习行动策略的同时,也要学习如果我采取某个动作,世界会如何变化。
1990年,于尔根·施密德胡贝尔发表了一份技术报告,描述了一个基于两个循环神经网络的强化学习和规划系统,他把这两个网络分别叫作控制器和世界模型。
世界模型负责学习控制器发出动作之后会产生什么结果;控制器则利用世界模型进行心理实验,在内部推演不同行动序列的后果,再选择最优的那一个。
这是世界模型一词在机器学习领域首次正式亮相。
02
从游戏到驾驶
真正让世界模型成为一个独立研究方向的,是2018年的一篇论文。
那一年,谷歌大脑的大卫·哈和瑞士AI实验室IDSIA的于尔根·施密德胡贝尔在神经信息处理系统大会上发表了《Recurrent World Models Facilitate Policy Evolution》,他们用三个组件搭建了一个结构清晰的框架。
变分自编码器负责将高维视觉观测压缩成低维表征;混合密度循环神经网络在表征空间中预测未来的序列变化;轻量控制器则根据这些预测选择行动。
整个系统最特别的地方在于,智能体完全在一个由自身内部世界模型生成的想象环境中训练策略,然后再把这个策略迁移回真实环境。
这项研究是在赛车游戏环境中完成的。
智能体在虚拟赛道上通过想象学会了驾驶,并能在真实的赛车游戏中跑出不错的成绩。
图片源自:网络
这也是世界模型第一次在具体任务中被验证有效,它证明了一件事,智能体不需要在真实环境中反复试错,也能学会复杂的行为。
这篇论文及其提出的想象中学习范式,后来被DeepMind的Dreamer系列模型所继承和发展。
Dreamer系列模型同样让智能体在世界模型内部通过想象进行行为学习,从而避免了大量真实环境的试错。
Dreamer的测试环境从游戏扩展到了连续控制任务,但当时离现实世界的复杂场景还有距离。
2022年,图灵奖得主杨立昆发表了一篇六十二页的立场论文《通往自主机器智能的道路》。他将具备预测能力的世界模型置于其构建自主智能架构的核心位置。
杨立昆认为,构造自主智能需要预测世界模型,而世界模型必须能够执行多模态预测。
这篇论文让世界模型从强化学习社区的一个技术概念,变成了通用人工智能研究的主流议题。
03
世界模型进入自动驾驶
2023年是世界模型进入自动驾驶行业的转折点。
除了特斯拉在CVPR上的演讲,英国的自动驾驶公司Wayve也在同一年发布了GAIA-1。
GAIA-1是一个生成式世界模型,可以通过视频、文本和动作输入生成逼真的驾驶场景。
它拥有九十亿个参数,训练数据来自Wayve在英国城市道路上的真实驾驶数据。
模型不仅能生成视频,还能对自车行为和场景特征进行精细控制。
2024年,蔚来在创新科技日上发布了中国首个智能驾驶世界模型NWM。
图片源自:网络
NWM是一个多元自回归生成模型,能在100毫秒内推演出216种可能发生的场景,并从中寻找最优路径。
它还可以基于三秒钟的驾驶视频,生成一百二十秒的想象视频。
2026年2月,Waymo宣布推出基于谷歌DeepMind的Genie 3构建的Waymo世界模型。
Genie 3是DeepMind最先进的通用世界模型,能够生成逼真且可交互的三维环境。
Waymo没有选择从零开始,而是直接在Genie 3的基础上加入自动驾驶专属的传感器数据,再针对仿真与规划进行微调。
这种做法很像大语言模型的发展路径,先有一个通用的基础模型,再通过领域数据把它变成专用模型。
04
最后的话
从1943年克雷克的心智模型到2026年Waymo的驾驶世界模型,这条脉络跨越了八十多年,但每一次关键的跃迁都来自外部力量的注入。
认知科学提供了思想原型;强化学习提供了技术框架;深度学习的爆发提供了实现工具;而大语言模型的成功则为自动驾驶指明了基础模型加领域微调的路径。
然而技术演进的速度往往快于我们对它的理解。当前自动驾驶行业对世界模型的热衷,多少带有几分期待它能解决所有问题的意味。
图片源自:网络
但生成式世界模型容易出现物理交互幻觉,生成的场景可能违反基本的物理规则。
此外,模型的视觉指标虽在持续进步,但这是否能让驾驶安全有所提升,仍是一个悬而未决的问题。
当前主流的评测体系无法充分刻画自动驾驶所需的鲁棒性维度,这些问题不是靠更大规模的训练数据就能解决的。
智驾最前沿以为,世界模型真正的价值,可能不在于它能生成多么逼真的视频,而在于它能否让自动驾驶系统拥有像人类一样的内心推演能力,在做出每一个驾驶决策之前,先在脑海里预演一遍后果。
这个目标其实还很远,但方向已经清晰了。
#自动驾驶#世界模型#自动驾驶世界模型