上一期我们聊了依靠“回声”定位的激光雷达——测距精准,却无法分辨颜色,在其感知视野中,世界只是一堆点云。
本期的主角,是相机视觉。相比于雷达,它虽不擅长精确测距,但能瞬间识别物体的颜色、纹理和语义信息——比如区分左侧的红色锥桶与右侧的蓝色锥桶,甚至识别起点/终点区域的黄色标识。
在大学生方程式无人驾驶赛车上,二者缺一不可:雷达负责告知“前方(距离)存在障碍物”,相机则负责判断“那是锥桶,以及它是什么颜色、属于赛道哪一侧”。今天,我们就来剖析它的工作原理。
根据中国大学生无人驾驶方程式大赛(FSAC)现行规则,赛道由红、黄、蓝三色锥桶标识:红色锥桶标记赛道左边界,蓝色锥桶标记右边界,黄色锥桶用于起点/终点区域。
( 注:2027赛季起,中国赛将对齐国际规则,调整为蓝色=左侧、黄色=右侧、橙色=起终点。)
若仅依赖激光雷达,它只能输出坐标数据(比如 x=5米,y=2米),却无法回答颜色这一关键属性。没有相机,赛车就如同色盲——无法区分赛道左右边界,更无法定位起终点,比赛将无从谈起。
相机的核心优势在于为环境赋予色彩和语义。它捕捉的每一帧图像都是一张丰富的“彩色地图”,包含了边缘、纹理和明暗等细节信息。许多顶尖车队会在车头部署多台不同焦距的RGB相机,组合实现约180°的前向视野覆盖。
相机直接输出的是一张普通照片(像素矩阵)。工控机需经过以下四个核心步骤,才能从中提取有效信息:
原始图像难免包含噪点(类似手机在弱光下的画质劣化)。通过中值滤波等方法,可将每个像素与邻域像素比较,剔除异常值,使画面更干净,便于后续处理。
图2 中值滤波去噪效果:原图 → 椒盐噪声 → 滤波后
这是相机特有的关键预处理环节。由于相机镜头存在固有的光学特性,拍摄的图像在边缘区域常会出现径向畸变(如桶形畸变或枕形畸变,使直线变弯曲)。同时,因镜头组安装误差,还可能存在切向畸变。
我们需要利用相机标定(通常使用棋盘格标定法)获得的内参(焦距、主点坐标)和畸变系数(径向畸变系数k1、k2和切向畸变系数p1、p2),通过数学变换对每个像素的位置进行重新映射,将畸变图像“拉直”为符合真实世界投影的平面图像。这一步对于后续基于几何特征的测距和定位至关重要,否则锥桶的边缘位置会产生系统性偏差。
图3 棋盘格标定板:通过拍摄不同角度的棋盘格,计算相机内参与畸变系数
图4 去畸变前后对比:左侧原始图像边缘弯曲,右侧校正后直线恢复笔直
这是识别环节的关键。我们指定目标颜色(如黄色),电脑将图像从RGB空间转换到更符合人类感知的HSV(色调、饱和度、明度)空间。随后,它会根据设定的色调范围执行“筛选”:属于黄色的区域标记为白色,其余为黑色。一张彩色照片由此变为二值化的黑白剪影,白色区域即为锥桶候选区。
图5 HSV颜色空间模型:Hue(色调)、Saturation(饱和度)、Value(明度)
图6 颜色阈值分割:左侧四色原图 → 中间红色区域二值mask → 右侧提取结果
上一步得到的白色区域可能存在孔洞或粘连。通过开运算、闭运算(类似图像修复)进行填充和分离。最后,算法根据面积、圆度、长宽比等几何特征,从候选区域中筛选出最像锥桶的目标,并输出其位置和类别。
图7 形态学操作原理:腐蚀(Erosion)与膨胀(Dilation)组合形成开运算和闭运算
图8 FSAE赛车第一视角锥桶检测效果:blue cone(蓝锥)与 yellow cone(黄锥)被精准框出
目前,更主流的方案是采用深度学习目标检测模型,如YOLO系列。此类算法无需人工设定颜色阈值,可通过大量数据自行学习锥桶的视觉特征,实现端到端的识别,具有更强的泛化能力。在FSAC赛场,许多车队使用YOLOv5/v8,直接输出锥桶的边界框与类别(blue_cone / yellow_cone / orange_cone等),再结合雷达数据完成空间定位。
图9 YOLOv5网络结构:Backbone(主干)提取特征 → Neck(颈部)融合特征 → Head(头部)输出检测
既然相机能识别颜色,为何还需要雷达?
因为相机存在固有局限:在雨雾、夜间等光照不佳的条件下,其性能会显著下降;且单目相机无法直接测量距离,测距依赖估算,精度远低于雷达。而FSAE赛道宽度仅3-6米,锥桶间距有限,对定位精度要求极高。
因此,实际系统必须融合两者优势。常用策略包括:
雷达和相机独立处理各自数据:雷达输出“坐标(5,2)处有物体”,相机输出“该处为蓝色锥桶”。再由融合算法综合两者结论,得出最终结果。优点是实现简单,且具备一定冗余性——单个传感器失效时,系统仍可降级运行,这在赛事中尤为重要。
图10 决策级融合流程:各传感器独立感知 → 融合中心综合决策 → 车辆控制
在神经网络内部,让雷达的点云特征与相机的图像特征进行交互(如采用交叉注意力机制、BEV融合等)。二者在特征层面深度结合,互相修正,能获得比单一决策融合更高的识别精度。
图11 三种融合架构对比(BEVFusion):(a)点级融合 (b)特征级融合 (c)BEV融合
多传感器融合后,锥桶的颜色识别准确率与空间定位精度均显著优于单一传感器方案,系统鲁棒性也更强——这正是无人驾驶赛车能在高速过弯时仍精准走线的关键。
总而言之,相机为自动驾驶提供了“理解世界”的语义能力,雷达则提供了“丈量世界”的几何精度。在吉林大学吉智无人车队的感知方案中,二者正是通过上述融合策略协同工作,才确保了赛车在复杂赛道中既能“看得清”,也能“测得准”。
下次观看无人驾驶赛车过弯时,不妨留意车头的摄像头——它正在快速分析锥桶颜色,为赛车提供关键的导航指令。这,便是视觉感知的魅力所在。