一辆白色汽车在道路上行驶,周围有橙色光圈表示感知范围。
说实话,这两年我试驾的新能源车里,十辆有八辆都在跟我吹智驾。什么”全场景自动驾驶”、“城区领航不用手”,厂家PPT做得比电影特效还炫。
但我每次都想问一句:这东西到底是怎么工作的?它凭什么说自己能看见路上的人和车?
今天就跟大家好好聊聊这个话题。不搞学术,就讲清楚原理,让你下次坐在车里开智驾的时候,心里有数。
01. 最开始:给车装上”眼睛”
汽车底盘的X光透视视图,展示了电池组和发动机等核心部件。
工程师最开始想的很直接——模仿人类,给车装上眼睛,也就是摄像头。
逻辑上没毛病,人开车靠眼睛,那车也靠摄像头呗。
但问题来了。我们人眼看到模糊的画面能自动脑补,可AI眼里的世界只是一堆像素点,它分不清哪是车哪是人。
你想想,一张图里,一辆白色轿车和一堵白色墙,对AI来说像素值可能差不多,它怎么区分?
动画展示了自动驾驶汽车在斑马线前识别行人的场景。
于是工程师只能用数百万张标注好的图片,给AI填鸭式补习,硬让它记住:四个轮子、带壳子的就是车。
多张不同品牌和型号的汽车图片,代表AI训练数据。
这个方法管用,但效率低、成本高,而且只解决了”认得出来”的问题。开车光认识东西还不够,你还得知道那个东西离你多远,对吧?
02. 搬来救兵:激光雷达登场
动画展示激光雷达发射激光束,生成周围环境的毫米级精准点云图。
这时候激光雷达就被拉进来了。
它像个超级精确的”瞎子”——通过发射激光束并计算反射时间,能毫米级精准地测量出每个点的距离,把周围环境扫描成一幅细致的点云图。
这个必须得说说,激光雷达的测距精度真的是没谁了,理论上比人眼稳定得多。
但可惜,它只知道那里有个东西,却不知道那到底是什么。
所以改进方案就是把摄像头和激光雷达结合起来——一个负责看清是啥,一个负责测量多远。听起来完美,但这两个家伙经常吵架。
雷达说前面有障碍,摄像头说那是影子。系统听谁的?
动画模拟了自动驾驶汽车因判断失误而突然刹车(幽灵刹车)的场景。
判断失误,就是幽灵刹车。
我自己就在高速上经历过这个,前面明明什么都没有,车突然给你来一脚刹车,吓得后排的娃差点哭出来。这波操作我是没看懂。
更麻烦的是,早期系统离不开高精地图当保姆,结果就是被锁死在了高速上,城区根本用不了。
03. 转机出现:AI学会”看懂全局”
动画展示了自动驾驶汽车通过鸟瞰图技术,将周围环境信息整合成一个3D立体沙盘。
转机出现在AI学会自己理解世界。
一种叫Transformer的模型,让它获得了一眼看懂全局的能力。
基于它发展的鸟瞰图技术,能把所有信息融合成一个上帝视角的立体沙盘。
然后出现了一个更聪明的思路——占用网格。
不再纠结识别每个物体,只判断空间格子有没有被占用。
分屏显示真实驾驶画面和自动驾驶系统通过网格判断障碍物并规划避让路径的视图。
这下无论路上是什么稀奇古怪的东西,车都知道躲开。
就是二郎神开天眼了——我不管你是人是狗是共享单车,反正那个格子被占了,我就绕开。
这个思路,我是服气的。
04. 最颠覆的一步:端到端大模型
车内视角,屏幕显示自动驾驶系统从传感器信号直接输出驾驶动作,模拟人类驾驶直觉。
但光看清世界还不够,思考还是硬伤。
当时的决策系统,全靠工程师编写的无数条”如果……就……“规则,死背题库。一旦遇到加塞、鬼探头,要么死机,要么做出特别僵硬的判断。
于是行业走到了今天最颠覆的一步——端到端大模型。
不再教AI具体规则,而是直接喂给它海量人类开车视频,让它自己从数据里总结规律,从传感器信号直接输出驾驶动作。
这就像一个疯狂刷题之后,形成直觉的老司机。开车不再是查规则手册,而是”这条路感觉怎么走”,一气呵成。
05. 两派之争:你站哪边?
多路摄像头画面拼接,展示纯视觉方案如何通过多个摄像头感知周围环境。
说到这,不得不承认,现在行业分成了两派。
纯视觉派:像人一样,靠摄像头和强大算法来脑补世界。成本低,但雨雾天容易”失明”。
多传感器融合派:激光雷达加上各种传感器,像给车配上蝙蝠的回声定位,安全感高,但成本也高。
动画展示汽车利用激光雷达进行障碍物检测,形成360度感知范围。
从奶爸的角度来说,我个人更偏向融合感知。带着老婆孩子出门,安全这件事我不想赌概率。贵点就贵点吧,花钱要花在刀刃上,这点钱省不得。
车内视角,一名驾驶员和一名乘客在车内,讨论自动驾驶的两种技术路线。
当然,这只是我个人观点。可能每个人需求不一样,城区通勤为主、预算有限的车友,纯视觉方案也未必不能用。
那问题来了——你更相信纯视觉派,还是融合感知派?
欢迎车友们留言,咱们聊聊。