清华团队揭秘:自动驾驶缺的不是算力,而是人类司机的“常识”!
自动驾驶喊了这么多年,算力从5TOPS堆到200TOPS,可L3就是迟迟落不了地。很多人第一反应是芯片不够强。但事实恰恰相反。真正卡住自动驾驶的,不是算力,不是传感器精度,而是机器没有人类司机的常识。第一个被大众忽略的角度:自动驾驶的瓶颈不是技术上限,而是机器缺乏具身认知。人类开车靠的是几十万年演化和几年驾驶经验共同训练出来的直觉。我们知道进路口时视线应该聚焦在可能窜出来的行人和电动车上,而不是路边商店的招牌。我们知道前车刹车灯亮起,比它车身的颜色重要一万倍。机器没有这套本能。它得先识别、再分类、再计算轨迹、再匹配规则,一顿操作下来,动作僵、反应慢,遇到没见过的场景直接懵。清华团队最近的研究直接点到了这个痛点。他们提出一个概念叫语义重要性地图。人类司机脑子里始终有这样一张地图,哪些信息重要、哪些不重要,几乎不假思索地分配注意力。他们把人类审视阶段的注意力数据注入大模型,模型性能直接飞跃了一大截。这背后的意思很扎心:大模型学会了逻辑,但在把逻辑跟真实世界的具体像素精确链接这件事上,依然存在巨大的接地鸿沟。它认识行人这个概念,但要它在昏暗的雨夜、复杂的背景里,精确地指认出那个正要横穿马路的关键行人,依然困难。不是算力不够,是它没有人类那种这个像素比那个像素重要的直觉。第二个更隐蔽的角度:这场竞争已经从算力军备赛转向数据质量军备赛。过去几年大家过度聚焦在TOPS这个数字上,把芯片算力当成信仰。可智己的工程师之前提到过,他们通过模型优化,把二阶算力需求硬生生降低了90%。同样一颗Orin-X,装在不同车上跑出来的效果,可能差着两个身位。业内近两年集体转向端到端大模型路线。传统方案是把感知、决策、控制拆成一段一段的模块,中间靠人写的规则和参数拼接。端到端则是从传感器输入到方向盘输出一整个大模型直接学出来,让机器像人一样从原始画面到最终动作一步到位。智己和Momenta搞的汽车直觉,就是沿着这条路走的。他们的智驾大模型模仿人脑,用直觉加逻辑的双通道来处理智驾问题。绝大多数常见场景走直觉,快而省能;碰到复杂情况再切换到逻辑推理。更有意思的是,大模型的自我学习和迭代采用了短期加长期记忆结合的模式,同样借鉴人脑的经验积累过程。刚学到的新东西先放短期记忆里检验,反复稳定之后再沉淀进长期记忆。从更长的时间尺度看,自动驾驶的进化是一场芯片、算法、数据、法规四条线并行推进的接力赛。任何一条腿短了,整体都跑不快。过去大家过度聚焦在算力这一条腿上,反倒有点走偏了。清华团队这次的研究,是把大家的注意力重新拉回到了真正的瓶颈——机器如何像人一样看路。这也意味着,接下来智驾行业的竞争,会从硬件军备赛慢慢转向软件和数据军备赛。谁能收集到更多样、更极端的真实道路场景,谁能训练出更接近人类直觉的大模型,谁能在算法层面把有限算力榨到极致,谁就能真正跑出L3、L4的临门一脚。人类花了几十万年才把看路这件小事内化成本能,机器要走完这段路,恐怕还要一段时间。但至少方向已经找到了——别再一味堆算力,学着像人一样看世界。