一个山村的学龄前儿童,以前从来没出过门,突然被带到城市,他会过马路吗?
会。尽管他没见过汽车,不认识公交车,更不懂红绿灯,但照样会过马路——既不会自己主动撞车,更不会被车撞。
这不是科幻,而是常识。儿童尽管不识物,跌跌撞撞地走路也不会撞上板凳、饭桌,更不会撞墙或被门槛绊倒。
如果我是这个学龄前儿童,我就想弱弱地问一句:难道我不认识全世界,我就不配过马路吗?
可如今自动驾驶行业的回答,偏偏是"认识不了全世界,就不配上路"。
所谓"世界模型",就是要让AI先认识汽车、公交车、三轮车、二轮车、马车……再认识交通标志牌、标线、红绿灯……还得认识狗、猫、鸡……不够,还要认识砖头、石块、石头蛋子……结果还不行,还有长尾,还不认识马路塌方、道路维修机械等等。
不仅要认识它们,还得知道它们的运动规律,从而做出躲避动作。
于是乎,为了自动驾驶,大模型都不够,还要世界模型,算力不断被拔高,H100不够上H200,一片不够上千片,到最后,连电力都不够了,还要向太空要能源(马斯克要将AI中心搬上太空),太疯狂了!
这像不像一个准备出门的人,非要先把全世界每一粒沙子都认清楚,才敢抬脚?
幼儿走路和山区儿童进城两例都表明:不认识障碍物,不影响对它的躲避。
老李:照片是二维的(左右、上下),应该缺乏远近的三维信息。
老张:不对,明明白白包括远近呀。当你站在马路中间放眼望去,能够清楚地看出远近。
老李:对,你说的对,远处的图像偏上偏小,而近处的图像偏大偏下。但问题恰恰出在这里——图像的上下与远近是混在一起的,区分时可能会出错。例如,网上流传的经典视觉错觉图中,下图左中误认为女士站在空中讲话、下图右的鹦鹉长出牙齿。

老张:是呀,确实出错了,人不可能漂浮在空中、鹦鹉也不可能有牙齿,这是怎么回事?
老李:根本原因就在于,二维的图像信息中混合进了三维信息,非要从单张照片中提取远近信息是病态问题(ill-posed)——会出错。
老张:那怎么办?
老李:单张照片会出错,多张呢?因为有移动,尤其是目测者本人就在移动,则远近与上下将能够明确区分。
老张:我明白了,对于讲话的女士,第一眼可能看成了她浮在空中,但是当你走两步后再看,就能分清楚女士是站在沙滩上,木板比旗帜的影子稍远而已。
老李:对了。人的眼睛分辨远近,靠的不是"认识"物体,而是靠移动前后的多张图像来提取远近——这在视觉科学里叫"运动视差"。老鹰抓兔子,它在树上时看到了草原上的兔子,它一定要飞起来,才能准确判断兔子的远近,而不是在树上"认识"兔子就知道。
老张:我知道了,为什么老虎不抓静物——只有动起来,才能一招锁喉。
老李:差不多是这意思。生物视觉的底层逻辑是"运动感知",不是"物体识别"。
视频每秒至少30帧,即一秒30幅照片,并且,目测者在移动,足以分辨远近信息。
事实上,分辨图像中的物体属于深度网络,而物体在视频中的远近信息属于工业数据,而不是图像数据。
让我们重温工业数据:连续物理量,如温度、流量、功率等,被等间隔数字测量,所得数据。
可见,视频中物体的远近数据也是连续物理量被等间隔(=1/帧频)测量——这就是工业数据。
在"工艺科学化"的前序推文中,我们介绍了要挖掘工业数据中规律需要"工业ANN"——它不是深度学习那种黑箱大模型,而是挖掘连续物理量变化规律的小模型。我们还将其物化为DCT,如同设备心电图,能够"透视"工业设备,获得设备内部物料的状态量变化曲线。
所以,将视频中物体的位置数据训练工业ANN,能够得到关于物体的运动模型——对时间的常微分方程:
场景 | 数据特征 | 工业ANN输出 | 模型阶 |
输电线路 | 电气量等间隔采样 | 线性14阶微分方程 | 14阶 |
真空回潮机 | 热工量等间隔采样 | 非线性4阶微分方程 | 4阶 |
视频中物体 | 位置和前后的等间隔采样 | 线性2阶微分方程 | 2阶 |
注:物体的运动方程通常2阶(距离、速度、加速度)就够,最多3阶(加加速度,即jerk)。
可见,如果用工业ANN来挖掘视频中物体的运动规律易如反掌,不费吹灰之力,它就能从物体的图像结果数据中区分出上下、前后、远近等信息。
世界模型的思路是:先认识障碍物"是什么",再说"它会怎么动"。
没必要。不认识障碍物,不影响对它的躲避——这是儿童过马路的常识。
并且,视频中区分远近和位置信息依靠的更不是大模型,而是工业ANN。可以肯定,"世界模型"是舍近求远、缘木求鱼。
这两天特斯拉刚宣布它的模型Grok4.5,而它的FSD第14.3版肯定在大模型之前。从时间前后就能得知,FSD的核心并非大模型。
需要澄清:特斯拉官方从未说过FSD或BMS用了"大模型"(large model / foundation model),是外界在这么猜、这么传。 马斯克虽提过十倍参数的新模型,但用词始终是"end-to-end neural network"或"AI model",从未用"大模型"定性FSD。
在电池新国标落地,但有两个技术问题想聊聊中,我们已介绍了工业ANN和DCT,并暗示特斯拉有类似方法用于BMS。同样,也用于视频的区分位置和远近信息。
由此推断,HW4和HW5也没必要堆大算力。FSD在HW3上也能实现,因为工业ANN不是大模型、不需要多大算力。FSD Lite是营销宣传,与HW4上的FSD没有本质区别。
特斯拉的视频自动驾驶,HW3、HW4和HW5都不需要大算力;特斯拉的BMS也不需要大算力。
我们的DCT也不需要大算力。
交流的话题:
如果自动驾驶不需要"认识世界",只需要知道"障碍物"和"如何避免碰撞",那么:
英伟达万亿市值的根基是什么? 是技术必需,还是"没有大模型就讲不出新故事"的资本焦虑?
国内车企纷纷上马Orin、Thor芯片的军备竞赛,有多少是真需求,有多少是"别人有我不能没有"的恐慌性采购?
HW4和HW5都是大算力吗,真需要,还是HW3都足够?
当前行业每年数百亿美元的"大算力+大模型"投入,有多少是真需求,有多少是为营销目的而包装的?
你的行业有没有类似的"堆量不如挖质"的误区?
欢迎在评论区分享。
本文是"工艺科学化"系列推文之一。前文我们讨论了APC不是先进工艺、工艺不是熟练工的诀窍,今天我们把同样的追问投向自动驾驶——当AI行业也在用"堆量"代替"挖质"时,常识还能不能发声?
关联阅读:
1.APC:是真先进,还是营销宣传?(1140阅读)
2.工艺的本质(下):认知偏差的根子已达百年之久(888阅读)
3.电池新国标落地,但有两个技术问题想聊聊(工业ANN与DCT)