汽车积累了海量道路视频、多传感器数据和闭环训练系统。现在,这套能力开始进入机器人。但真正能搬过去的,是感知与推理底座;最后一米的接触控制,仍要重新练。 |
过去几年,自动驾驶是现实世界里最舍得烧算力、最早建立数据闭环的 AI 工程。摄像头连续看,模型持续预测,系统再把结果变成轨迹。它训练的,本质上不是一台“会开车的机器”,而是一套理解动态物理世界的方法。
这也是汽车 AI 与人形机器人开始靠近的原因。两者都要处理连续视频,都要判断人和物体下一步会怎么动,都不能只靠语言模型在云端慢慢想。区别在于,车主要在二维路面里移动;人形机器人还要伸手、受力、保持平衡。
所以,这不是一场整包复制。更接近一次分层迁移。
图1|DriveVLM 将驾驶任务拆成场景描述、场景分析与分层规划,并保留传统3D感知和轨迹规划支路。来源:清华大学、理想汽车 DriveVLM 论文/项目页
汽车AI到底练出了什么
先看自动驾驶大模型已经在做什么。DriveVLM 的输入不是单张图片,而是一段连续视觉序列。模型先描述场景,再找关键目标、分析风险,最后输出元动作、决策说明和路径点。
这套结构和机器人很像。机器人接到“把桌上的红杯子递给我”,也要先看清环境、理解目标,再把任务拆成靠近、抓取、抬起、递交。
真正有迁移价值的,不是方向盘角度,而是方向盘角度之前的那几层能力:
开放世界视觉理解:识别训练集中没被单独标注过的障碍物、工具和人的行为。
时序预测:从连续画面判断目标速度、意图和遮挡后的可能位置。
空间表征:把多摄像头输入压进统一的三维或鸟瞰空间。
分层规划:先做语义级决策,再把决策交给高频控制器。
数据闭环:从失败案例中挖数据、重标注、再训练、重新上车验证。
这五项能力,正好也是具身智能“看懂—想清—去执行”的上半段。
已经出现了跨汽车、跨机器人的统一模型
过去说“技术同源”,更多是产业判断。现在已经有了直接的模型证据。
小米团队在 MiMo-Embodied 技术报告中,把自动驾驶与具身智能放进同一个视觉语言模型。训练任务同时包含驾驶环境感知、状态预测、驾驶规划,也包含可供性判断、空间理解和高层任务规划。论文报告称,两类数据在多阶段训练中出现了正迁移。
图2|MiMo-Embodied 统一处理单图、多图和视频,用视觉编码器、投影层与大语言模型覆盖驾驶和具身任务。来源:小米具身智能团队技术报告
另一个更直接的例子是 NavFoM。它把车辆、轮式机器人、四足机器人和无人机放进同一套导航基础模型,用 800 万条导航样本联合训练。
这里的关键不是“车的数据量大,所以机器人跟着沾光”这么简单。模型必须额外知道摄像头装在哪里、看的是哪个方向、历史画面跨了多长时间。NavFoM 为此加入了视角和时间标识,并在有限 token 预算下动态压缩历史观测。
图3|NavFoM 用统一架构学习车辆、轮式机器人、四足机器人与无人机的导航任务。来源:NavFoM 论文
这说明导航层已经可以跨“身体”共享。车辆的大规模道路数据,能够帮助机器人学习动态障碍、人类行为和长距离路径判断;机器人室内数据,也能反过来补足窄空间、第一视角交互和语言指令。
能搬走的四层,与搬不走的三层
图4|汽车AI向人形机器人的迁移边界(AI不浪漫整理)
一句话概括:自动驾驶能帮机器人把“大脑皮层”练得更成熟,但小脑、脊髓和手上的触觉反射,不能靠道路视频补出来。
为什么VLA仍然要有两套速度
驾驶模型已经吃过一次教训:大模型擅长理解复杂场景,却不适合独自承担所有高频控制。DriveVLM 因此做了 Dual 架构,让视觉语言模型负责慢速推理,让传统 3D 感知和规划模块补足空间精度与实时性。
人形机器人正在走相同路线。NVIDIA 的 GR00T N1.5 用视觉语言模型编码图像和指令,再由扩散 Transformer 处理机器人状态和动作。上层模型负责“拿哪个、放哪里”,动作专家负责输出连续控制序列。
图5|GR00T N1.5 的视觉语言模型把自然语言指令落到具体目标物体。来源:NVIDIA Research
这是迁移里最容易被忽略的一点。汽车和机器人可以共用一颗理解世界的“大脑”,但动作端必须知道自己的身体:有多少个关节、相机装在哪里、手臂能伸多远、当前关节角度和力矩是多少。
一台车的动作空间通常可以压缩为转向、加速、制动与轨迹;人形机器人的动作空间则可能同时包含几十个关节,还要处理双臂协同、接触约束和全身稳定。模型骨架可以共用,动作词表不能照搬。
图6|GR00T N1.5 在 Unitree G1 上进行双臂抓取测试。实拍来源:NVIDIA Research
真正值钱的不是某个模型,而是汽车的数据工厂
对机器人公司来说,汽车行业最值得借的,未必是一份预训练权重,而是已经跑通的数据生产线。
一辆测试车每天产生连续多摄像头和车辆状态数据。车企已经建立了自动筛选长尾场景、自动标注、仿真回放、版本评测和影子模式验证。机器人也需要同样的闭环,只是“危险场景”从加塞和鬼探头,换成了抓空、打滑、碰撞、失衡和错误用力。
汽车数据能降低机器人学习“看懂世界”的起点,但无法替代机器人真实操作数据。后者必须记录图像之外的关节位置、末端位姿、夹爪状态、力/力矩、触觉、动作延迟和任务成功率。
这也是为什么纯视频很有价值,却还不够。视频能告诉模型“人怎么把杯子拿起来”,却没有直接告诉它手指用了多大力、杯壁有多滑、动作晚 50 毫秒会不会掉。
工程一线的结论
汽车 AI 确实在给机器人练大脑,但它首先练的是视觉理解、动态预测、空间推理和高层规划。
短期内,迁移最先落地的会是导航、避障、场景理解和任务拆解。它们对身体结构不那么敏感,也有更成熟的汽车数据可用。
真正决定人形机器人能不能稳定干活的,仍是具身数据和控制系统:看见杯子之后,能不能抓稳;走到工位之后,能不能把零件装进去;被人碰一下之后,能不能站住。
所以,这条路线不是“汽车大模型降维打击机器人”。更准确的说法是:汽车行业把物理世界 AI 的上半场提前跑了一遍。机器人可以借用它的大脑底座,但要获得一双可靠的手和一副不摔倒的身体,还得在真实世界里重新交学费。
本文技术论据参考以下行业论文与厂商技术报告:
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
MiMo-Embodied: X-Embodied Foundation Model Technical Report
NavFoM: Embodied Navigation Foundation Model
NVIDIA GR00T N1.5
NVIDIA Isaac GR00T N1
| 文末互动:
汽车AI能把视觉、空间推理和世界模型带给机器人。但到了抓取、力控和全身平衡,机器人还得重新训练。你觉得,汽车行业积累的这套AI能力,能让机器人少走多少弯路? |
评论区聊聊。