T27: Map BEV:自动驾驶在线矢量地图构建
前面BEV成长系列 IPM→LSS→BEVDet→BEVFormer→Temporal→Fusion ,主要围绕动态目标展开,可以归属为Object-centric BEV,关注:
如何构建BEV?如何表达Agent State?
Detection | Tracking | Prediction
汽车 | 行人 | 骑行等
但自动驾驶决策不仅依赖目标位置,还依赖道路结构、交通规则等。例如:当前在哪条车道?前方车道如何连接?是否允许变道?路口拓扑关系如何?这些信息通常由地图来提供。为摆脱离线预存地图的维护成本,行业开始研究基于 BEV 特征的在线矢量建图方案。
流程:离线采集-> 人工建图 ->高精地图 ->在线定位
车辆运行时:实时感知 + 高精地图-> 定位、规划
识别:车道中心、车道边界、道路边界、斑马线、停止线等地图元素 输出:点、线、Graph等矢量形态和拓扑关联
VectorMapNet:首次系统化提出在线矢量地图构建 MapTR:结构化地图表达 StreamMapNet:流式建图,重点在序列帧的融合 TopoNet:关注拓扑构建
VectorMapNet核心思想:BEV Feature → Vector Prediction直接预测地图元素向量。解决以往 Segmentation → 后处理 → Vector链路过长的问题。《VectorMapNet: End-to-end Vectorized HD Map Learning》
Image Encoder + View Transform + Feature AggregationMulti-view Images ───────────────────────────> Unified Global BEV Feature Polyline Regression HeadUnified Global BEV Feature ──────────────────> Vertex Coordinates Post-processing(Curve Smoothing / NMS / Filtering)Vertex Coordinates ──────────────────────────> Output Vector Polylines
MapTR 核心思想:BEV Feature → Map Element Query → Vector Element,MapTR借鉴了 DETR、BEVFormer中的 Query 思想,将地图元素视作可学习对象。
特点:地图元素结构化表达、训练稳定、工业界采用广泛。目前很多在线地图方案都会与 MapTR 进行比较。《MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction》
Image Encoder + View TransformMulti-view Images ──────────────────────────────> BEV Feature Map Instance Query DecoderBEV Feature Map ────────────────────────────────> Instance Queries Point Set DecoderInstance Queries ───────────────────────────────> Vertex Coordinates Post-processingVertex Coordinates ─────────────────────────────> Output Vector Polylines
Permutation Matching LossPredicted Coordinates <─────────────────────────> Ground Truth Polylines
VectorMapNet与MapTR仍然属于单帧建图,而单帧数据的观测范围有限,很难处理遮挡、远距离车道、路口结构。StreamMapNet 引入History Map Memory,实现过去观测+当前观测共同建图。 《StreamMapNet: Streaming Mapping Network for Vectorized Online HD Map Construction》
类似于:BEVFormer → Temporal BEV,但Temporal BEV关注动态目标的检测、跟踪、预测,重点是用历史帧增强当前帧,时序信息是用来建模运动的。而StreamMapNet 是把多帧观测累积成同一个地图,历史memmory map会通过pose 变换(来自CAN BUS/IMU/Odometry/GT)对齐到当前帧再融合。
Image Encoder + View Transform + Streaming Temporal FusionMulti-view Images (Frame Sequence) ───────────────> Temporal BEV Feature Query Propagation + Instance Query DecoderTemporal BEV Feature ─────────────────────────────> Streamed Instance Queries Point Set DecoderStreamed Instance Queries ────────────────────────> Vertex Coordinates Post-processingVertex Coordinates ───────────────────────────────> Output Vector Polylines
前面的Map主要解决地图元素的分类与几何,自动驾驶还需要地图元素的拓扑关系。例如:车道A是否连接车道B、左转进入哪条车道、路口如何通行等。
TopoNet一类的工作核心关注:Topology Graph,即:Geometry +Topology,从地图构建进一步走向道路规则建模。《Graph-based Topology Reasoning for Driving Scenes》
Image Encoder + View TransformMulti-view Images ─────────────────────> BEV Feature Map Instance Query DecoderBEV Feature Map ───────────────────────> Instance Queries Graph Topology ReasoningInstance Queries ──────────────────────> Topology-aware Queries Geometry DecoderTopology-aware Queries ────────────────> Centerline Coordinates Graph Topology ReasoningTopology-aware Queries ────────────────> Lane / Traffic Element Topology Post-processingCoordinates + Topology ───────────────> Topology-aware HD Map
Map BEV核心任务: BEV → Vectorized Map,代表技术演进脉络:
VectorMapNet(矢量建图)
MapTR(结构化地图表达)
StreamMapNet(持续建图与空间一致性维护)
TopoNet(拓扑关系建模)