2025年1月,CES展会上,英伟达CEO黄仁勋在主题演讲中拿出一段视频:一辆虚拟汽车在AI生成的街道上行驶,路面积水反射着路灯的光晕,行人从斑马线走过,车辆在路口右转——一切看起来如此真实,但这一切从未在现实世界中发生过。这是英伟达Cosmos世界模型生成的训练数据。黄仁勋说:世界模型是AI的下一个前沿。而在同一展会上,谷歌DeepMind、World Labs、Wayve等公司也纷纷展示了各自的世界模型方案。一场围绕AI理解物理世界的技术竞赛,正在悄然升温。
一、端到端的困境:为什么看不等于理解
2023年以来,端到端自动驾驶成为行业热词。特斯拉FSD V12从30万行C++代码缩减到依赖神经网络直接输出驾驶决策,蔚来、小鹏、理想等国内车企也纷纷跟进端到端方案。但一个尴尬的事实是,即使是表现最好的端到端系统,在面对长尾场景时仍然频频出错。

问题出在哪里?端到端系统本质上是模式匹配——它学会了从传感器数据到驾驶动作的映射,但它并没有真正理解物理世界。一辆端到端自动驾驶汽车可能知道红灯时应该停车,但它不理解停车的物理含义:惯性、摩擦力、制动距离、雨天对刹车性能的影响。它只是见过足够多的红灯停车训练样本。
这正是世界模型试图解决的核心问题。世界模型的目标是让AI建立一个对物理世界的内在表征——一个能够预测如果X发生Y会怎样的因果推理引擎。特斯拉早在2023年CVPR的WAD Workshop上就展示了其世界模型方案,通过预测未来的场景演变来训练自动驾驶决策。但真正的突破来自2024年,Wayve推出的GAIA-1世界模型能够生成高保真的驾驶场景视频,包括天气变化、行人行为、交通状况等复杂交互。这个模型拥有90亿参数,在4096个TPUv5上训练了数月,生成的视频在人类评估中的逼真度得分达到了87%。
二、从视频生成到物理模拟:世界模型的关键跃迁
世界模型的概念最早可以追溯到2018年,由David Ha和Jurgen Schmidhuber提出。但彼时的世界模型只能处理简单的2D游戏环境。真正的飞跃发生在2024至2025年,生成式AI技术的爆发让世界模型从学术概念走向工程实践。

英伟达的Cosmos平台是这一趋势的代表。Cosmos不是一个单一的模型,而是一个世界模型开发平台,它包含视频生成模型、3D重建模型、物理仿真引擎等多个组件。开发者可以用Cosmos生成海量的合成驾驶场景数据,用于训练自动驾驶模型。据英伟达披露,使用Cosmos生成的合成数据训练的感知模型,在真实场景中的检测准确率提升了12%到18%。此外,Cosmos还提供了物理反馈机制,可以在生成的数据中标注物理参数,如物体质量、速度、摩擦系数等,让模型不仅学习视觉模式,还学习物理属性。
而在具身智能领域,世界模型的意义更为深远。2025年,Google DeepMind发布了RT-2-X,一个结合视觉-语言模型和机器人控制的通用模型。RT-2-X通过世界模型来理解物体在三维空间中的位置关系、物理交互规律,从而让机器人能够在从未见过的新环境中完成任务。例如,一个在实验室中训练好的机器人,可以仅通过少量示范就在新的厨房中学会打开微波炉、取出食物——因为它理解了打开微波炉这个动作的物理本质,而不只是机械地重复示范动作。斯坦福大学李飞飞团队也提出了类似思路,通过World Model预训练让机器人在新任务中的成功率提升了40%以上。
三、世界模型是通用解法吗
尽管世界模型展现出了巨大的潜力,但它距离成为通用解法还有很长的路。最大的挑战在于物理准确性与计算效率之间的权衡。生成一个高保真的3D世界并实时模拟其物理演化,需要惊人的计算资源。当前的Cosmos或Sora生成一分钟视频可能需要数分钟甚至数十分钟的计算时间,远不能满足自动驾驶所需的毫秒级响应。

另一个挑战是因果理解的深度。当前的世界模型充其量是关联性预测——它能够根据历史帧预测未来帧,但它并不真正理解为什么。一辆车在湿滑路面上刹车,世界模型可能预测出它会滑行更远,但它并不理解这是摩擦系数降低导致的,因此当出现训练数据中从未见过的路面材质时,它可能给出完全错误的预测。
然而,这些挑战并不妨碍世界模型成为AI发展的必然方向。正如DeepMind联合创始人Demis Hassabis所说:要造出真正通用的人工智能,它必须理解世界是如何运作的,而不仅仅是文本中的统计规律。从这个角度看,世界模型不仅是自动驾驶和具身智能的解法,更是通往AGI的必经之路。当AI学会理解重力、摩擦、碰撞、流体动力学这些物理规律时,人类与机器的关系将进入一个全新的阶段。