Physical AI两大超级超级载体/场景,自动驾驶和人形机器人。而与自动驾驶比,人形机器人又更难(尤其是家庭场景),从商业化上,一定是自动驾驶率先商业化后,才能人形机器人爆发。自动驾驶是Physical AI能否形成真实世界闭环的最佳前哨指标,尤其对tsla而言,fsd/cybercab量产上路就是optimus之前规模最大,数据最丰富的一次物理ai演习。而且,自动驾驶这个前哨已经跑通了部分,waymo已经robotaxi已经可以规模化运营,悬而未决的是tsla能否用更低成本的纯视觉、端到端通用神经网络和量产cybercab,超越waymo。为什么我一直说自动驾驶是人形机器人的前哨?主要有这么5点,也就是二者共享的5项核心能力:1.从摄像头等传感器理解真实世界;
2.预测其他物体下一步会怎样运动;
3.在不确定环境中规划动作;
4.在毫秒级延迟下闭环控制硬件;
5.通过“真实部署—数据回传—模型升级—OTA”形成飞轮。
更重要的是,物理ai,比数字场景ai的要求更加苛刻:
做对90%没有商业价值,99%也不够,真正商业化需要在长尾场景中不断增加可靠性小数点后面的“9”。
自动驾驶的优势包括:任务目标非常清楚,只要全地从A点到B点;空间相对简单,只管方向、刹车、加速;道路规则高度结构化;数据量巨大但容易自动采集。
而人形机器人相比之下就更难,需要面对几十个自由度、双手操作、接触力学、材质差异、自然语言指令和无限任务组合,难度指数级提高。(当然,我指的是家庭等较高难度商业化场景,不是指工厂固定场景干简单工作的机器人)
以上,就是我认为自动驾驶是人形机器人前哨的核心论证。
目前,tsla robotaxi已经实现真实收费、车内无人,但客观说规模还很小,开通城市集中在奥斯汀(几十辆级别)、达拉斯、休斯顿、迈阿密旧金山湾区等部分区域,且主要是modex y车型,目前运营数据跨过了从0到1,但是离cybercab大规模量产并在城市渗透,业绩体现在财报上,还有很长一段路要走。要耐心等待商业化的拐点。我粗略判断,要等到27下半年
开始,才是规模化运营的潜在加速点,28-29开始在公司财务上兑现。
一言以蔽之,自动驾驶是Physical AI第一次真正进入大规模真实世界、接受安全责任和商业模型检验。它如果跑通,会显著提高人形机器人跑通的概率。
说完自动驾驶,再说人形机器人。
人形机器人的卡点,一是灵巧手,二是大脑,尤其是后者,现在的机器人,不具备泛化能力。
人形机器人真正的技术拐点不是机器人跑得更快、跳得更高,是机器人的“大脑”从VLA升级为WAM(世界行动模型),只有这样才能推动人形机器人从身体会动,进入能够在物理世界里先想象结果、再规划行动的阶段。
相比自动驾驶,人形机器人公司要解决的事情太多了,主要瓶颈包括:复杂操作与环境适应性、长任务如何持续可靠运行、长程规划、技能迁移、泛化、从VLA的直接输出动作到WAM先预测结果再行动(大幅提升准确性和推理速度)。
虽然,WAM无法解决机器人低成本、可靠性长程任务工作的能力,但起码有望解决“机器人为什么有可能泛化”这一难题,这可能是接下来最重要的突破。
从LLM/VLM → VLA → WAM,采用多模态物理世界数据训练(机器人需要的不是纯视频生成模型,是哪内化了物理规律的世界模型),先让机器人大脑聪明起来,这是前提,此后再说规模化、降本、商业化。而这,比自动驾驶商业化需要的时间更久。
那么,在人形机器人的大脑从VLA进入WAM时代,哪些公司容易跑出来,容易构筑竞争壁垒?
这些公司主要考察的能力维度是:世界模型架构、多模态数据清洗和对齐、物理规律学习、仿真与真实世界之间的迁移能力、推理效率等。
人形机器人的技术主线正在从本体工程问题,升级为世界模型、物理数据和自主规划问题。
自研大脑+自研身体+大规模低成本量产的垂直一体化公司,将是最大赢家。
而部分专攻高价值/稀缺性高的细分领域的配套商做到极致的,也是产业链里的赢家,比如灵巧手、触觉传感器、边缘推理芯片、机器视觉、世界模型和仿真平台、真实视觉部署及数据闭环的产业链参与者。