过去谈世界模型,很多人第一反应还是AI视频:输入一句话,生成一段能看的未来画面。现在变化已经往前走了一步,它开始进入自动驾驶、机器人和具身智能,目标不只是“画得像”,而是让系统提前判断行动之后世界会怎么变。
同一个词下面,实际装着几条差异很大的路线。Sora、Genie、Cosmos偏向生成未来画面和可交互世界。
Meta V-JEPA和AMI Labs更强调在抽象表征里预测。小鹏、理想、华为等车企则把世界模型放进云端仿真和驾驶策略训练。
真正影响产业落地的,不是名字叫不叫世界模型,而是三个更硬的条件:生成结果是否足够物理一致,预测能不能接上动作,系统是否已经进入可验证的产品闭环。按这三个条件看,自动驾驶明显走在前面,机器人还在更早的位置。
世界模型最核心的功能,是给智能体做一个内部环境表征。车要变道,不只是识别旁边有几辆车,还要预测自己加速、减速或并线后,周围车辆可能如何反应,再选择相对稳健的动作。理解当前状态、预测后续变化、辅助规划决策,这三件事才是世界模型的共同底层任务。
分歧出在预测发生在哪里。生成式路线直接生成未来画面、视频或3D世界,好处是结果可见,可以拿来做内容、合成数据和仿真环境。
JEPA路线只在抽象表征空间预测,不把未来还原成画面,目标是减少像素级冗余,提高规划效率。产业侧现在更容易押注前者,因为每一步进展都可能变成视频产品、数据工厂或仿真服务。
但生成式并不等于已经掌握物理世界。视觉逼真更像渲染器,能让人看到未来的样子。
自动驾驶和机器人需要的是模拟器,输出状态要可计算、可交互,并且符合几何和物理约束。stable-worldmodel评测给过一个很直观的信号:被测模型在标准推物任务的干净条件成功率约50.8%,只改变背景颜色后降到约6%。画面好看和策略可靠之间,还有一段工程距离。
世界模型进入物理AI后,下一步要看它和动作怎么连接。最松的一种方式,是把世界模型当数据工厂或仿真器,英伟达Cosmos给GR00T造训练数据,Wayve GAIA生成驾驶场景,特斯拉神经世界模拟器训练独立端到端网络,都属于这个层级。
更深的一层,是把世界模型变成闭环训练环境。理想MindVLA、小鹏X-World、华为世界引擎,都不是只做一段演示视频,而是让策略在虚拟环境中训练,再回到真实产品里验证。再往前,是架构级融合,小鹏X-Foresight和阿里RynnVLA-002尝试在同一架构里同时预测未来画面和动作。世界模型越接近动作决策,产业价值越不取决于生成效果,而取决于它能不能降低真实世界试错成本。
这里也能解释它和VLA的关系。VLA负责从视觉和语言指令映射到动作,世界模型负责预测环境如何变化。
两者不是替代关系。纯VLA可以直接从当前画面出动作,融合路线则在行动前多做一步未来推演。对车和机器人来说,这一步推演如果不稳定,动作输出就可能把仿真里的错误带到真实场景。
自动驾驶之所以跑得更快,不是因为它对物理一致性的要求低,而是它同时具备三项条件。第一,量产车队能持续回传真实道路数据。
第二,道路、车道线、交通规则和常见交互限制了世界开放度。第三,安全与体验可以直接变成产品竞争力,企业愿意为闭环训练投入。
一个完整的数据飞轮已经能看清楚:量产车队先回传真实数据,云端世界模型再重建和生成场景,尤其补充危险或罕见长尾场景。
驾驶策略在虚拟环境中做大规模闭环强化学习,再通过OTA回到车端。新策略上车后继续回传新数据,进入下一轮迭代。这套闭环把过去依赖实车试错的部分,尽量前移到可控的虚拟环境里。
公司样本也基本沿着这条路展开。Wayve、Waymo、Waabi、特斯拉侧重生成式仿真和闭环模拟。
国内的小鹏、理想、华为、蔚来、商汤等,则把世界模型放进智驾系统、云端训练或难例生成。它们的共同点不是路线完全一致,而是都在把“造场景”接到训练、评测和车端更新上。
机器人看起来需求最强,因为真实机器人的数据更稀缺,试错成本也更高。问题在于,它对世界模型的要求比汽车更细:抓取、碰撞、摩擦、形变和接触力都可能影响任务成败。自动驾驶主要在道路空间里运动,机器人要和开放物体直接发生接触,这让仿真到现实的误差更难控制。
算力也是另一条约束。生成式路线训练和推理成本高,扩散模型需要反复去噪,长序列还会累积误差。
Sora应用曾被公开报道算力消耗约每天100万美元,之后在2026年3月关停。JEPA路线如果跑通,可能在推理端降低单位世界理解能力的算力需求,但它还要面对训练坍缩、状态不可直接观察、缺少中间产品等问题。一边更容易商业化,一边更像长期效率解,这就是当前路线分化的现实原因。
把数字内容、自动驾驶和机器人放在一起,落地顺序其实很清楚:低风险内容场景最快,因为视觉瑕疵通常不会造成安全事故。
自动驾驶闭环最深,因为有量产数据和道路约束。机器人最难,因为开放任务和接触物理都更复杂。三者最后都会碰到同一组瓶颈:物理一致性不足、长时序不稳、评测标准不统一。
世界模型的核心矛盾,是从生成画面跨到可验证的物理推演。自动驾驶能够先跑出来,成立条件不是单一模型能力,而是量产数据、受约束道路场景、云端仿真训练和车端反馈同时存在。
机器人要形成同样闭环,需要把接触物理、长时序稳定性、低成本推理和独立评测一起补上。只有走到模拟器和动作闭环,世界模型才会真正改变物理AI的训练方式,这也是自动驾驶先跑通、机器人仍受约束的根本差别。
如果想继续核对这些变化,我还整理了世界模型产业链的关键环节、供需传导、成本交付约束和后续变量,放在文末左下角的【阅读原文】里,需要的话可以自取。