写到这儿,可能有人觉得汽车人转行具身智能是降维打击。我后来发现,机器人真正难的,不是AI,而是物理。别急,听我讲完下面这三座山。
智驾的Data Engine是从相对结构化的道路世界长出来的。把它搬到充满开放任务和复杂物理交互的机器人领域,不能简单复制,必须跨越三座新的大山。这也是我这一年摔得最狠的地方。
第一座山:数据获取——从"规模化采集"到"组合泛化"
我刚转行的时候,天真地以为机器人最大的问题是数量少。错。
真正的问题不是数量少,是数据难以规模化复用。
智驾的数据闭环建立在"多智能体、单任务"模式上:数百万辆车,几乎一致的底盘、传感器、控制系统,每天干同一件事——把人从A点送到B点。所以不同车的数据可以不断汇聚,形成持续增长的数据飞轮。
机器人面对的是完全不同的问题。
机器人不仅硬件形态各异(人形、轮式、双臂、单臂、灵巧手),任务也高度开放。同样是"拿起一个杯子",杯子的材质、重量、是否装液体、桌面摩擦系数、光照条件、周围障碍物——任意组合,都是一个新任务。
真正困难的不是长尾,是组合泛化(Compositional Generalization)。在一次抓杯子实验里。我们连续换了二十多个杯子,模型都没问题,但只要换成一个透明、带水珠的玻璃杯,成功率立刻掉下去。后来我们才意识到,机器人面对的不是一百万种物体,是动作、物体、环境、任务目标之间近乎无限的组合空间。靠真实世界采集数据,几乎不可能穷尽。
更头疼的是,机器人的失败远比自动驾驶难定义。车辆被接管是明确的失败信号;机器人抓取失败,是摩擦力不足?姿态规划错误?力度控制不当?还是视觉误检?这些失败难以自动标注,更难直接反馈到数据闭环。
我团队里有个兄弟,之前在车企做数据闭环,来了之后花了三个月想搭一套机器人的"接管数据"系统,最后放弃了。他跟我说:"车被接管是离散事件,机器人失败是连续过程,根本不是一回事。"后来我们换了个思路,用遥操作(Teleoperation)+ 力反馈记录来标注失败帧,才算勉强跑通——但成本是车企那套的十倍。
所以机器人真正缺的,不是更多数据,是具有可迁移性(Transferability)和可扩展性(Scalability)的数据体系。这也是为什么今年(2026)大家都在卷VLA模型(Vision-Language-Action)、在卷合成数据、在卷跨本体迁移——本质上都是在解这道组合泛化的题。
第二座山:物理世界——Data Engine遇到真正的Boss
自动驾驶的大多数决策,发生在"不接触世界"的前提下。
识别道路、预测他人行为、规划安全轨迹——仿真的重点是场景够真、交通参与者行为够合理。
机器人完全不同。机器人真正创造价值的地方,几乎都发生在接触(Contact)的瞬间。
拿起杯子、拧瓶盖、插USB、折叠衣服、系鞋带、开门——这些任务都属于典型的Contact-rich Manipulation(接触密集型操作)。
一旦发生接触,问题就极其复杂。摩擦力、弹性形变、接触点变化、力反馈、柔性材料、流体运动——任何一个细微误差,都可能导致现实中的操作失败。
这就是机器人领域长期存在的Sim-to-Real Gap(仿真到现实鸿沟)。
自动驾驶里,一个摄像头仿真误差可能不影响最终决策;但机器人里,哪怕摩擦系数存在千分之一的偏差,都可能导致抓取失败。
我们团队有一次在仿真里把一个倒水任务跑通了,成功率99%。搬到真机上,成功率掉到30%。排查了一周,发现是仿真里的水流模型和真实水流的表面张力差了那么一点点。还有一次更离谱,仿真里抓取一个塑料瓶成功率100%,真机上死活抓不起来——最后发现是仿真里把瓶身的摩擦系数设高了0.02,真瓶身有水汽,更滑。
那一刻我才真正理解,对于机器人,真正需要解决的不只是物理仿真,是接触真实性(Contact Fidelity)。
这也是为什么英伟达在死磕Omniverse物理仿真平台,谷歌在搞RT-X多机器人模型,无数创业公司在探索合成数据——大家都在用不同方式填这道坑。
第三座山:具身智能——身体也是模型的一部分
自动驾驶最大的优势是标准化。同一车型硬件几乎一致,道路交通规则高度统一,一次OTA升级可以快速覆盖整个车队。
机器人完全相反。
首先,不同机器人拥有完全不同的身体。机械臂长度、自由度数量、电机响应速度、灵巧手结构、触觉传感器布局都存在巨大差异。同一个策略,在一台机器人上成功,换一台可能完全失效。
所以机器人领域越来越强调一个观点:Body is Part of the Model(身体也是模型的一部分)。
智能不仅来自模型,也来自机器人本体的设计。这事儿在自动驾驶里几乎不存在——你不会说一辆Model 3的"身体"和一辆Model Y的"身体"需要不同的算法。
其次,机器人面对的是高度非标准化的环境。每个家庭、每间厨房、每个工厂车间都有不同的布局、光照、材质和物品摆放。
更要命的是,机器人不仅观察世界,还会不断改变世界。
打开抽屉,环境变了;拿起杯子,世界状态变了;移动椅子,整个规划空间重新变了。机器人需要持续感知、持续更新世界状态,不断重新规划后续动作。
而自动驾驶更多是在相对稳定、可预测的环境里完成路径规划。
这也是为什么机器人不仅需要感知模型,还需要更强大的世界模型(World Model)来预测自身动作将如何影响环境,并据此完成连续决策。