自动驾驶技术先后经历独立模块化、通用多任务、早期端到端三条技术路线,每条路线都存在无法根治的结构性缺陷,UniAD 诞生于三条路线全部触及性能天花板的节点:
1. 第一代:工业主流独立模块化(图 a)
感知 / 预测 / 规划各自训练独立模型,分模块串行部署
•
优势:工程解耦、分团队迭代、单模块易调优;
短板:模块间接口割裂、特征反复压缩转换,误差逐级累积;上游检测一点偏差会被持续放大,最终规划失控;各模块优化目标割裂,只为自身指标最优,不考虑最终行车安全。
2. 第二代:共享骨干多任务 MTL(图 b)
共用 BEV/CNN 主干,不同任务单独输出头(BEVerse、Transfuser 等)
改进:共享特征、减少重复计算;
短板:所有任务平等对待,无主次之分,出现负迁移(跟踪、地图、预测梯度冲突,互相拖累精度);没有统一通信接口,任务间交互浅,感知不会为预测 / 规划做适配。
3. 第三代:两类早期端到端方案(图 c)
1.
纯黑盒端到端(c1):图像直接输出轨迹,无任何显式感知、预测中间结果; 缺陷:完全不可解释,只靠轨迹稀疏监督,复杂路口、行人横穿等场景极易失效,无法满足安全验证要求。
2.
简易串联端到端(c2,PnPNet、ST-P3、ViP3D):感知→预测→规划线性串联; 缺陷:缺少完整全套任务,普遍缺失在线地图、实例级占用;模块间只有单向数据流,没有双向特征交互,上游错误无法被下游修正。
BEV 视觉范式成熟(BEVFormer),统一鸟瞰视角成为自动驾驶基础表征;
Transformer Query / 注意力机制普及,适合建模多智能体交互;
3.
行业需求升级:L3 及以上自动驾驶要求可解释、高安全、能处理复杂城市场景,传统架构边际收益骤降;
解决模块化误差累积: 传统串行架构上游误差一路放大;UniAD通过全局Query全链路互通,规划模块可反向吸收全局场景信息,甚至在跟踪漏检物体时依然能识别障碍物、规避碰撞。
解决多任务学习负迁移 : 摒弃“任务平等”思路,确立规划为终极目标,跟踪/地图/运动/占用全部作为规划的辅助支撑,所有任务梯度、特征流向都服务行车安全,缓解梯度冲突。
解决早期端到端不可解释、安全差 : 保留全套显式中间输出(跟踪目标、道路地图、多智能体轨迹、占用栅格),每个模块有独立监督,既能端到端联合训练,又可单独定位故障;同时稀疏运动+稠密占用双预测互补,大幅降低碰撞风险。
4.
解决感知、预测、规划信息割裂 : 首创统一Query通信总线:Track Query(动态物体)、Map Query(道路)贯穿所有模块,实现车-路-自车全局交互建模,不再是单向数据传递。
行业首次提出所有自动驾驶子任务优先级由规划需求定义,颠覆“各任务独立优化”固有思路:
任务逻辑:感知(跟踪+在线地图)→双预测(运动+占用)→规划,全部以安全轨迹输出为最终评价标准;
实验证明:同时配备跟踪+地图,运动预测误差下降9.7%;同时配备运动+占用,规划碰撞率降低超50%,缺一不可。
业界首个完整集成五大核心驾驶任务(3D跟踪、在线建图、多模态运动预测、实例占用、轨迹规划)的单网络端到端模型:
统一Query作为模块间唯一通信接口:Track Query表征车辆行人、Map Query表征车道标线,跨模块共享;
四大前置Transformer(TrackFormer/MapFormer/MotionFormer/OccFormer)+ 专用规划(Planner) 解码器,特征双向流通;
新增自车Ego Query,把自动驾驶车辆单独建模,全程参与全局智能体交互。
TrackFormer:区分检测Query+时序跟踪Query,无NMS后处理,带目标生命周期机制,大幅降低ID切换;
MapFormer:稀疏Map Query在线生成道路全景分割,无需高精HD地图,规避地图更新成本;
MotionFormer:三层并行注意力(车-车/车-路/终点可变形注意力)+非线性轨迹平滑,适配上游感知误差;
OccFormer:像素-智能体掩码交叉注意力,生成带物体身份的实例占用图,解决传统占用丢失个体信息的痛点。
解决全栈多任务联合训练难以收敛的难题:
阶段1(6轮):单独预训练跟踪+地图感知,稳定底层特征;
阶段2(20轮):冻结图像骨干+BEV编码器,全任务联合训练,平衡训练稳定性与多任务协同收益; 配套多任务复合损失:跟踪+地图+运动+占用+规划损失加权,规划碰撞损失赋予高权重,优先保障安全。
规划粗输出后,基于预测未来占用栅格做牛顿迭代优化,代价函数同时约束轨迹平滑与障碍物远离,推理阶段主动降低碰撞概率。
范式分水岭:正式确立规划导向端到端作为区别于模块化、普通多任务、黑盒端到端的第四类自动驾驶主流架构,后续大量端到端自动驾驶工作沿用了统一任务组织与规划导向思想;
完备性突破:首个在单网络内完整覆盖感知、双预测、规划全链路,在nuScenes数据集所有任务指标全面超越同期SOTA,仅视觉输入甚至优于激光雷达基线;
可解释端到端证明:打破“端到端=黑盒”固有认知,证明保留显式结构化中间表征、联合优化可以同时兼顾性能、可解释性、安全性;
CVPR2023最佳论文:UniAD 是近十年首篇中国机构一作 CVPR 最佳论文,也是自动驾驶领域首篇最佳论文,代表学术界对新范式的认可。
给出下一代自动驾驶量产架构清晰路线:车企/自动驾驶公司纷纷从独立模块化转向BEV+全任务端到端;
证明纯视觉全栈方案具备高安全潜力,降低对激光雷达、高精地图的依赖;
开源工程落地基准:开源UniAD代码、完整训练流程,成为学术界端到端自动驾驶标准基线,几乎所有相关对比实验都会以UniAD作为对标模型。地址:https://github.com/OpenDriveLab/UniAD
完整模型125M参数,A100仅1.8FPS,车载低功耗芯片难以实时运行;多Transformer解码器堆叠,推理延迟高、功耗大;
训练依赖16张A100高端GPU,训练周期长,中小企业、车企训练成本极高;轻量化难度大,削减模块会直接损失规划安全指标。
论文明确失败案例集中于极端长尾:大型挂车、异形工程车、昏暗窄巷、远距离小物体;跟踪模块对大尺寸异形物体检测精度下滑,连锁导致运动、占用、规划出错。
五任务损失权重、训练轮次、两阶段分配需要大量调参,梯度平衡难度极高,极易出现某任务精度牺牲换另一任务收益;
统一大网络耦合度高,规划轨迹异常时,难以快速定位是跟踪、运动还是占用模块的根源,不利于车规级故障排查、ISO26262安全认证。
仅支持环视单目视觉输入,原生未融合激光雷达、毫米波雷达;
未纳入深度估计、驾驶员意图、交通信号灯识别等辅助任务,场景信息完整度有缺失;
占用预测时域短(仅2s),运动预测6s,长短时序不匹配,高速长距离规划存在短板。
传统模块化可分模块独立做安全测试;UniAD所有任务耦合联合优化,系统行为存在耦合关联,传统形式化验证工具难以适配,车规级安全认证流程缺失成熟方案。
全部验证基于nuScenes北美城市数据集,未充分适配国内复杂路况(非机动车密集、路口行人混杂、特殊交通参与者),真实道路泛化能力缺少大规模实车验证。
UniAD 针对传统模块化、多任务、黑盒端到端架构的固有缺陷,提出以规划为核心、统一Query串联全栈五大驾驶任务的全新自动驾驶范式,是端到端自动驾驶从实验室走向产业落地的分水岭里程碑;但受制于巨大算力开销、长尾鲁棒性、车规验证等问题,距离大规模车载量产仍存在明显工程短板,后续轻量化、多模态融合、世界模型类工作大多沿用了它的框架思路。