
自动驾驶世界模型已经能生成道路视频,但真正用于测试时,研究人员往往想问得更具体:能不能把某辆车换成指定外观?能不能把它移动到另一个位置?六路相机和激光雷达能不能同步变化,而且连续推演一分钟不崩?
M4World 针对的正是这些控制难题。它同时生成环视视频和 LiDAR,允许在空间位置与视觉外观两个层面编辑单个交通参与者,并通过四步去噪的因果生成模型维持 60 秒连续推演。
团队与论文信息
论文 M4World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
团队 美团、中国科学院自动化研究所与北京理工大学
作者 Ke Cheng、Hanqiao Ye 等;Shuhan Shen 为通讯作者
状态 arXiv 预印本,多视角视频与 LiDAR 联合生成研究
▍驾驶世界模型,为什么不能只追求“像真的”?
如果目标只是生成一段好看的道路视频,视觉真实感可能够用。但自动驾驶测试需要可控性。
研究人员需要指定稀有车辆、摆放位置、运动状态和天气,还要保证同一辆车在前视、侧视和后视相机中保持一致。否则,模型生成的只是视觉片段,无法成为可重复的安全测试环境。
更大的难题来自时间。误差会在自回归生成中不断累积,几秒后可能出现车辆变形、视角不一致或场景漂移。短视频指标好,并不代表模型能稳定滚动一分钟。
▍不仅移动方框,还要控制车辆“长什么样”
M4World 的条件接口同时接收 3D 布局、对象类别、文本描述和参考图像。
因此,研究人员既可以规定一辆车出现在哪里,也可以指定“白色厢式货车”“带磨损的混凝土搅拌车”等外观属性。模型还会在六路相机中维持同一对象身份,并生成同步 LiDAR 扫描。

这类控制对长尾测试尤其重要。真实数据中罕见车辆和特殊组合很少,但研究者可以从少量片段出发,对目标对象进行定制,再把它放进不同道路和视角中。
▍六路视频和 LiDAR 必须讲同一个世界
多视角生成容易出现一种隐蔽错误:每个画面单独看都合理,拼起来却不是同一场景。
M4World 用统一时空条件生成六路相机与 LiDAR,并加入跨视角对象一致性评估。团队还设计 VLM 自动评测流程,分别检查场景条件是否满足、对象外观是否符合描述,以及跨视角是否为同一对象。

▍四步去噪,把生成拉到 60 秒
团队先训练双向教师模型,再通过多阶段自回归训练和蒸馏得到因果学生模型。学生每个生成块只需四次去噪,能够在线滚动预测后续场景。
为抑制长时间误差,训练过程逐步从教师强制过渡到依赖自身历史输出,让模型提前适应“只能接着自己生成结果继续往前推”的条件。


▍数字说明了什么?
在 10 秒驾驶视频上,M4World 将 FID/FVD 从基线的 41.7/346.1 改善到 34.8/288.7。
更值得注意的是控制指标:对象视觉一致性从 13.4% 提升到 62.7%,文本描述一致性从 11.6% 提升到 59.1%,跨视角对象一致性从 78.9% 提升到 84.5%。

▍一分钟生成,离闭环驾驶测试还有多远?
连续 60 秒并不等于已经具备可信物理仿真。世界模型仍可能生成视觉上合理、动力学上不严格的行为,LiDAR 与图像的一致性也需要更细致验证。
论文展示了长尾数据增强和场景编辑潜力,但没有证明这些合成数据一定能提升真实车辆的安全性。VLM 自动评分也可能受到评测模型偏差影响。
M4World 的价值在于把研究问题从“能不能生成驾驶视频”推进到“能不能控制一个可持续、可编辑、多传感器一致的驾驶世界”。这才更接近自动驾驶真正需要的测试工具。
读者问题:你更期待世界模型生成罕见危险场景,还是直接成为可交互的闭环测试环境?
如果你想持续看自动驾驶、机器人和具身智能论文的可读版拆解,可以关注本号。
▍往期精选
2. 大模型不是来开车,而是来出难题:TrafficAlign 让自动驾驶碰撞率降了 36.1%