
摄像头色彩丰富但雨雾致盲,激光雷达测距精准但看不懂红绿灯,毫米波雷达全天候但分不清行人和护栏,超声波雷达便宜但只能看5米。
所谓"多传感器融合",本质就是让四类各有短板的传感器互相补位,拼出一张完整、稳定、高精度的环境地图。
但融合不是简单"把数据叠在一起"。
摄像头30Hz、激光雷达10Hz、毫米波雷达50Hz——采集时刻完全错位;坐标系各自为政;时钟漂移随温度累积。如果时序没对齐,120km/h时速下100ms偏差就是3.3米的位移,融合结果直接错位失效。
本文从四类传感器的真实输出数据格式切入,拆解时序同步的软硬件协同机制,最后落到当下行业真正的主战场。

图| 主要的感知数据流
每一类传感器都有独立的信号采集链路和固化数据规范,原始数据和结构化数据用途完全不同。以下逐类拆解。
摄像头:唯一的色彩与纹理感知源
摄像头是自动驾驶中唯一能获取颜色、文字、交通标识的传感器,其输出分为原始图像和AI推理结果两层。
原始图像数据包包含整车统一纳秒级时间戳、帧序列号、分辨率(当前量产主流已从200万像素升级至800万像素,部分旗舰车型如比亚迪天神之眼C采用三目800万方案)、像素编码格式(RGB8或Bayer原始拜尔编码)、曝光时长、白平衡参数、镜头畸变系数、相机内参矩阵。单帧800万像素图像数据量可达12-18MB,远超传统1080P的3-5MB,对车载ISP和传输带宽提出了更高要求。

图| Bayer原始拜尔编码
原始图像经过车载ISP芯片完成畸变矫正、HDR合成、LED闪烁抑制(LFM)后,传输至NPU完成目标检测、语义分割、车道线拟合等推理任务。
结构化输出为标准化目标列表:每条包含检测框中心坐标、像素宽高、目标类别ID、置信度(0-1)、遮挡标记位、基于几何模型估算的目标距离。此外还输出车道线多项式拟合参数、交通标识类别与坐标、可行驶区域二值掩码等辅助感知数据。
需要特别说明:摄像头本身无原生测距通道,早期方案通过像素高度比例估算距离,远距离误差大;但自BEVFormer提出以来,通过Transformer的Cross-Attention机制,BEV查询向量可以直接从多相机2D特征中学习深度映射关系,不再依赖简单的像素比例换算,视觉测距精度大幅提升。
前视摄像头主流刷新率30Hz(每33ms一帧),环视摄像头为满足泊车实时性提升至60Hz。
激光雷达:三维空间感知核心
激光雷达通过发射红外激光脉冲、测量飞行时间(ToF)计算空间位置,是自动驾驶三维空间感知的核心设备。
原始点云数据包头部记录采集时间戳、帧序列号、激光通道总数、多回波模式标记。数据主体为海量三维采样点,每点存储x/y/z坐标(米)和反射强度。高端型号额外存储单点微秒级时间偏移和扫描环编号,用于后续运动畸变校准。
行业趋势上,机械式激光雷达正在被半固态和固态方案快速替代。2025年禾赛ATX、速腾MX等量产型号单价已降至1500元以内,推动激光雷达从高端选配走向20万元以下车型标配。刷新率方面,半固态方案可达20Hz,较传统机械式的10Hz翻倍,扫描速度更快、运动畸变更小。

图| 激光雷达在车上的工作图
原始点云无法直接参与融合,需经过噪点过滤、地面分割、非地面点聚类、障碍物分类等预处理流水线,输出结构化障碍物数据集:每条包含三维包围框中心坐标、长宽高、姿态四元数、类别标签、置信度、有效点数。
激光雷达测距误差可达厘米级,但无法采集色彩纹理,不能识别红绿灯颜色和交通标识文字。
毫米波雷达:全天候速度感知源
车载毫米波雷达采用77GHz调频连续波(FMCW)体制,信号解调、频谱分析、目标聚类全部在雷达内置MCU内完成,不输出原始射频波形,仅输出轻量化结构化目标列表,单帧数据量仅数KB。
单条目标数据包含:径向距离、径向相对速度、水平方位角、信噪比、跟踪ID、存活帧数、遮挡置信度。
传统77GHz毫米波雷达有明显局限:无纹理、无三维轮廓、无色彩,只能根据雷达散射截面粗略区分动静目标,无法区分行人与护栏。但其最大优势在于全天候适应能力——雨雾沙尘黑夜均不影响信号传输。
2024-2026年的重要趋势:4D成像雷达正在快速替代传统毫米波雷达。4D雷达增加了高度维探测能力,点云密度提升10倍以上,单帧可输出数千个点,能区分路面车辆与高架桥上的车辆,识别路面坑洼与静止障碍物。成本仅数百美元,约为激光雷达的十分之一。部分车企已采用"5R11V"(5颗4D雷达+11个摄像头)方案,在无激光雷达配置下实现城市NOA。

图| 大陆的毫米波雷达
超声波雷达:近距离泊车补充
超声波雷达依靠声波回波测距,单价低廉,仅用于5米以内近距离障碍物探测,服务低速泊车和防撞场景。
数据格式最简单:探头编号、毫秒级时间戳、探测状态标记(正常/遮挡/失效)、单向距离值(米)。固定10Hz刷新,多颗探头分时采集避免声波互扰。数据维度极低,不参与高速场景主融合运算。

图| 超声波雷达是传感器中的小伙计
四类传感器各自搭载独立晶振,出厂时钟基准未统一标定,长期运行中晶振温差和电压波动会产生时钟漂移。叠加刷新率不统一(摄像头30Hz、激光雷达10-20Hz、毫米波雷达20-50Hz、超声波10Hz),所有传感器的采集时序完全错位。
时序错位是融合落地最核心的工程难点。120km/h时速下,100ms时序偏差导致目标位置偏移约3.3米,直接造成融合匹配失败、速度计算错误、轨迹跟踪断裂。
完整的时序校准体系分为硬件硬同步和软件软对齐两层,缺一不可。

硬件层:GNSS PPS + PTP精密时间协议
硬件同步的核心是消除传感器本地时钟漂移,建立整车统一绝对时间基准。
行业主流方案采用GNSS秒脉冲(PPS)搭配车载PTP精密时间协议。整车部署独立主时钟服务器,向所有传感器、域控、IMU下发统一同步信号。摄像头和激光雷达通过GPIO硬件引脚接收PPS脉冲,采集动作由硬件脉冲触发,每帧绑定全局UTC时间戳;毫米波雷达和超声波雷达通过车载以太网PTP协议完成时钟同步,误差可控制在亚微秒级。

图| PTP精密时间协议
2026年的前沿方案进一步将摄像头曝光起始信号、激光雷达扫描起始脉冲、IMU采样中断全部接入FPGA同一时钟域,由FPGA生成全局同步时间戳嵌入每帧数据包头部,硬件层时间戳误差控制在10ns以内。
硬件同步解决了长期系统性时钟偏差,但无法解决刷新率不同导致的采样时刻错位,必须搭配软件时序校准算法。
软件层:以激光雷达帧为基准的动态对齐
软件对齐的行业通用方案是以激光雷达扫描帧为基准时间轴(T_ref),所有传感器数据映射校正至同一物理时刻。融合模块开辟约200ms滑动缓存窗口,持续缓存多帧数据保证连续性,针对不同频率传感器采用差异化校准策略。
毫米波雷达(50Hz高频降频对齐):激光雷达100ms基准间隔内生成约5组雷达数据,系统缓存T_ref前后相邻两帧,基于线性匀速模型计算目标状态变化斜率,通过插值推算T_ref时刻等效状态。该策略在匀速场景精度极高,急加速/变道场景存在小幅插值误差,属可接受工程范围。
摄像头(30Hz最近邻匹配+运动补偿):遍历缓存窗口筛选与T_ref时间差最小的图像帧,设置50ms偏差阈值,超限帧丢弃。单帧曝光期间车辆位移会导致画面运动畸变,系统调取IMU实时姿态数据对像素检测框做逐帧运动补偿,修正时序错位带来的像素偏移。
超声波雷达(10Hz状态复用):与基准频率一致,低频近距离目标状态变化极慢,直接沿用最新有效帧填充当前基准帧。若探头输出失效标记则清空字段,禁止无效数据参与加权。
激光雷达自身运动畸变校正:单次扫描耗时100ms,扫描起始与结束时刻车辆位姿已变化,原始点云存在运动畸变。系统调取扫描周期内IMU高频姿态数据,对每个三维坐标点做独立时间偏移补偿,统一校正至T_ref基准时刻。
残留误差:无法彻底消除的工程瓶颈
完整软硬件校准体系仍无法实现百分百无误差对齐。硬件脉冲存在微小触发延迟,不同传感器响应速度有固有差异,软件线性插值基于匀速假设无法适配变速/变道的非线性运动。车辆颠簸和高低温环境造成时钟微小抖动,这类残留误差无法通过算法彻底消除。
在路口多车密集、非机动车穿插、行人横穿等复杂场景,微小时序误差会被放大,导致目标重复融合或真实目标漏融合——这是当前多传感器融合普遍存在、难以根治的技术瓶颈。行业前沿正在探索在线自标定和不确定性估计来缓解此问题,但尚未完全解决。
多传感器融合的底层逻辑从未改变:让各有短板的传感器互相补位,输出统一、稳定、高精度的环境感知结果。但技术载体已经历三代跃迁。
第一代:规则驱动后融合(2021年前)。
各传感器独立输出检测结果,在规则层面做目标级关联,信息损失严重——摄像头看到"前方有车"但丢失了尾灯细节,激光雷达看到"有三维物体"但不知道是不是锥桶。前文所述的硬件对时、软件插值、运动补偿,最初都是为这一代架构服务。
第二代:BEV特征级前融合(2021年起)。
BEV不是独立的识别算法,而是一套空间翻译协议:将所有传感器特征统一投射到俯视地平面,在特征层面而非目标层面完成融合。时序校准和空间对齐的最终目的,就是保证多源特征在送入BEV编码器前对应同一物理时刻,否则同一目标在BEV平面会出现前后错位、重影漂移。
2022年特斯拉发布Occupancy Network后,行业进一步从"识别已知物体"跨越到"理解未知空间"——不再输出"这里有一辆车",而是输出三维空间中每个体素是否被占用,从根本上解决掉落轮胎、异形施工车等长尾障碍物的识别问题。华为ADS的GOD Network本质也是Occupancy。
第三代:端到端一体化(2024年起)。
融合架构正在经历三重演进:
Dense BEV→Sparse感知(Sparse4D等只维护目标级查询向量,算力效率大幅提升);
后融合→前融合(神经网络直接从原始数据提取特征并融合,信息损失最小);
模块化→端到端(特斯拉FSD V12等将感知-预测-规划整合为单一网络,时序对齐不再是独立预处理步骤,而是隐式编码在网络内部)。
时序同步作为融合的前置硬性条件,核心原则始终如一:硬件层建立统一时钟基准,软件层做动态插值对齐,二者缺一不可。
但随着4D成像雷达、固态激光雷达、800万像素摄像头的量产普及,传感器数据密度和刷新率快速提升,对时序校准的精度要求也在同步攀升。
对从业者而言,理解传感器数据格式和时序同步原理仍是必要基本功;但更重要的是看清趋势:
传统模块化管线中的"时序校准"正在被神经网络隐式吸收。未来的竞争力不在"把对齐做得更准",而在"设计出不需要显式对齐也能work的端到端架构"。
编辑|咖啡鱼
审核|阿蓝


