端到端自动驾驶之Occupancy 白话拆解:8 大 Occupancy 算法对比,从BEV到3D空间感知,一文看懂智驾底层Occupancy技术
开过搭载高阶智驾的新车你一定有过疑惑:同样是纯视觉自动驾驶,老款车只会识别车辆行人,新款却能精准避开路沿石、护栏、悬空广告牌、高架分层障碍。车企宣传里反复出现的「3D占用感知」「Occupancy体素预测」,到底是什么黑科技?曾经统治智驾行业的BEV鸟瞰方案为什么正在被全面替代?市面上TPVFormer、FlashOcc、SurroundOcc等几种Occupancy算法又有什么区别?今天这篇干货,避开晦涩论文公式,从开车场景切入,一次性拆解所有主流Occupancy技术,普通车主、汽车从业者、算法新手都能收藏看懂。一、BEV已经跟不上真实路况,端到端智驾必须拥抱Occupancy
日常开车里,大量BEV智驾失灵场景随处可见:上双层高架时,系统分不清上层桥面和下方路面,容易误判悬空区域;路边低矮石墩、临时施工锥、倒伏树枝高度不足1米,BEV丢失高度信息直接漏检;隧道、多层立交、地下车库交错墙体,二维俯视画面无法区分前后遮挡物体。一句话总结行业变革逻辑:BEV只能看「地面」,Occupancy能看清「整个立体空间」,这也是所有车企发力端到端智驾的核心突破口。二、零基础读懂Occupancy:3种三维空间表征,看懂技术底层区别
很多人看不懂Occupancy,核心卡在「空间表征方式」,我们用生活化类比讲清三类主流方案:1. 稠密Voxel纯体素方案
把车辆周边空间像魔方一样切成密密麻麻小方块,每一个方块独立存储信息。优势:三维信息完整无丢失,墙体、天桥、低矮障碍物全部精准还原;短板:算力、显存消耗爆炸式增长,魔方格子越多,计算量呈立方上涨,很难直接装车量产,仅用于实验室高精度测试。2. BEV鸟瞰表征
相当于从上往下俯视地面,直接把所有高度信息压缩成一张平面图纸。优势:计算速度快、硬件要求低,早年低成本量产车型普遍搭载;短板:彻底丢失高度维度,高架、隧道、悬空障碍物全部识别混乱,复杂路况安全性存在硬伤。3. TPV三视角表征(行业折中最优解)
TPV=三正交平面:俯视BEV平面+纵向立面+横向立面。不用完整稠密魔方,仅依靠三张二维平面融合还原三维空间,算力开销接近BEV,同时完整保留高度、纵深信息,兼顾精度与速度,是目前学术研究热门方向。简单类比:Voxel是完整魔方,BEV是一张俯视图,TPV是三张互相垂直的图纸拼出立体世界。三、八大主流Occupancy算法全拆解,覆盖学术研究到量产落地
目前行业主流8套Occupancy算法,按照使用场景分为四大赛道,每一套都对应解决特定行业痛点,不用啃论文,结合开车场景通俗解读,同时补充完整架构流程+核心创新点。(一)高精度学术路线:TPVFormer / SurroundOcc / FB-OCC
1. TPVFormer:TPV 三视角方案开山之作完整架构 & 推理流程- 2D→TPV 升维:交叉注意力自适应将图像特征映射至俯视、纵向、横向三个正交平面;
- 跨视图混合注意力:实现三张 TPV 平面之间特征互通、信息互补;
- 首创 TPV 三平面空间表征,解决 BEV 丢失高度、纯 Voxel 算力过高的双重痛点;
- 跨视图混合注意力机制,让三个正交平面互相交换三维几何信息;
- 弱监督训练方案:仅使用稀疏激光雷达点云标签训练,无需海量稠密 3D 标注,即可预测完整稠密场景。
适用场景:多层立交、隧道、高低落差极大的复杂城市道路,垂直结构感知远超传统 BEV。 局限:多平面注意力模块存在一定算力开销,暂时难以直接下放至低算力车载芯片。2. SurroundOcc:解决稀疏激光雷达无稠密真值难题- 多帧激光点云时序拼接,静态建筑、动态物体分开处理;
- 网格体素化,通过最近邻匹配给每一个体素分配语义类别,生成稠密占用真值。
- 多组 2D-3D 空间注意力,分 3 档分辨率完成 2D 图像到 3D 体素空间映射;
- 多尺度 3D 卷积 + 反卷积解码器,粗到细逐级上采样重建完整场景;
- 输出全场景稠密语义占用预测,使用离线生成的稠密真值做监督训练。
- 一套完整稠密占用真值生成管线,把单帧稀疏激光点云转化无缺失完整 3D 标注,大幅提升模型训练精度;
- 多尺度分层 2D-3D 跨视图注意力,相比传统 BEV 注意力完整保留三维空间信息;
- 粗到细多分辨率 3D 解码,兼顾远距离大范围感知与近处障碍物细节还原。
完美补齐行业一大痛点:单帧激光雷达点云稀疏,无法覆盖墙体、立柱、远处障碍物,缺少完整标注数据,模型训练效果差。SurroundOcc 完美补齐该短板。3. FB-OCC:融合两种视图变换,弥补单一方案缺陷
完整架构 & 推理流程
- F-VTM 前向投影分支:基于深度分布做 LSS 式 2D 升维;
- B-VTM 反向投影分支:基于 BEVFormer 注意力范式反向映射特征;
核心创新点
(二)量产轻量化路线:FlashOcc & Panoptic-FlashOcc
整车厂落地首选方案,核心目标砍掉高消耗3D卷积,适配车载低算力芯片,平衡速度与精度。1. FlashOcc:Channel-to-Height 插件,彻底抛弃 3D 卷积- 视图变换模块,将图像特征统一映射至 BEV 平面;
- BEV 编码器(纯 2D ResNet)完成俯视特征增强;
- 核心 Channel-to-Height 轻量化插件:把 BEV 通道维度映射为三维高度维度,一步还原完整 3D 体素空间;
- 可选时序融合模块:拼接历史帧 BEV 特征,提升夜间、雨天感知稳定性。
- 提出即插即用 Channel-to-Height 插件,全程移除算力消耗巨大的 3D 卷积,仅使用 2D 算子完成 3D 占用重建;
- 显存占用降低 60% 以上,推理速度提升 2~3 倍,适配车载低算力芯片实时运行;
- 模块化设计,可无缝替换传统 3D Conv 占用预测头,兼容市面上绝大多数 BEV 基线模型。
2. Panoptic-FlashOcc:从语义占用升级全景占用- 复用 FlashOcc 全套轻量化 BEV 生成、语义占用预测主干;
- 实例中心匹配 + 最近邻分配算法,将语义体素绑定对应实例 ID;
- 输出全景占用结果,区分同类物体不同个体(多辆车、多行人)。
- 基于 FlashOcc 轻量化底座拓展全景能力,不额外增加大量算力开销;
- 双实例预测头精准定位物体三维中心点,解决语义占用无法区分实例的短板;
- 无复杂 3D 算子,保留量产上车轻量化优势,是当前车企迭代主流方案。
(三)极致稀疏建模路线:SparseOcc
稠密体素会大量计算空白天空、空旷路面,算力严重浪费,SparseOcc提出全稀疏架构。- 稀疏体素解码器:粗到细三层结构,逐级上采样,仅重建场景内存在物体的有效稀疏体素;
- Mask Transformer 分支:生成 N 组稀疏查询向量,依次经过自注意力、掩码稀疏采样、自适应混合层;
- 查询特征与稀疏体素特征融合,分类头输出体素占用掩码、语义类别;
- 替换查询向量即可切换语义占用 / 全景占用两种任务。
- 全稀疏架构:无稠密 3D 网格、无稀疏转稠密、无全局稠密注意力,仅计算有效物体体素,大幅减少无效算力消耗;
- Mask Transformer 稀疏查询机制,不用遍历全空间网格,推理效率大幅提升,适配超长距离高速智驾。
(四)低成本无标注训练路线:RenderOcc & SelfOcc
解决激光雷达稠密标注成本高昂、采集难度大的行业痛点,无需完整3D真值即可完成训练。1. RenderOcc:2D 渲染监督,只用普通图像标签训练- 多相机图像输入,2D-to-3D 网络生成三维体素特征场;
- 网络预测每个体素两大参数:密度 σ、语义分类 S,构建语义密度场;
- 体渲染模块:将 3D 密度场沿相机光线投射,渲染出 2D 像素级语义图、深度图;
- 加权射线采样:提取相邻帧有效光线补充监督样本,过滤噪声射线;
- 损失计算:渲染出的 2D 语义、深度图与现成 2D 标签做匹配,仅用 2D 像素损失完成训练;
- 全新 2D 渲染监督训练范式,彻底摆脱昂贵稠密 3D 激光真值依赖,仅用低成本 2D 分割、深度图训练;
- 语义密度场 + 体渲染机制,搭建 3D 空间与 2D 图像的监督桥梁;
- 加权射线采样策略,优化监督光线质量,提升模型训练收敛速度与精度。
2. SelfOcc:纯自监督方案,完全不需要 3D 标注- 沿用 TPV/BEV 类 2D→3D 映射模块,构建三维场景表征;
- 新视角图像渲染分支:基于重建的 3D 空间反向投影生成相邻帧相机画面;
- 自监督损失:渲染图像与真实车载视频画面做像素匹配约束;
- 外接离线 2D 分割模型时,可拓展输出自监督语义占用。
- 纯自监督训练框架,全程不需要激光雷达、3D 真值、人工语义标注,仅依靠车辆行驶视频训练;
- 时序视频一致性约束,模型自主学习物体三维空间位置,甚至推理车辆被遮挡的背面空间;
- 适配无激光雷达低成本纯视觉车型研发,大幅降低车企数据采集与标注成本。
四、八大Occupancy算法横向对比表,一眼看清核心差异
为方便快速区分8款算法的底层区别,整理直观对比表格,从空间表征、核心算子、算力消耗、真值依赖、输出能力、适用场景六大维度横向对比: | | | | | | |
|---|
| | | | | | 三视角融合完美保留高度信息,垂直场景精度第一,弱监督友好 |
| | | | | | |
| | F-VTM+B-VTM 双分支 + 3D UNet | | | | 融合两种视图变换,搭配深度语义预训练,物体边缘预测更细腻 |
| | | | | | Channel-to-Height 轻量化插件,量产落地首选,速度最快 |
| | | | | | 在 FlashOcc 轻量化基础上增加实例识别,兼顾速度与实例感知 |
| | | | | | 只计算场景有效物体,空白区域跳过,适合长距离高速智驾 |
| | | | | | |
| | | | | | |
- 追求极致精度、实验室研发:优先 TPVFormer、SurroundOcc、FB-OCC,代价是算力高、标注成本贵;
- 新车量产落地、车载芯片部署:FlashOcc/Panoptic-FlashOcc,唯一无 3D 卷积的轻量化方案;
- 商用车远距离感知、减少无效计算:SparseOcc 全稀疏架构;
- 缺少激光雷达、控制标注成本:RenderOcc、SelfOcc,前者靠 2D 标签,后者纯视频自监督。
五、落地现状:Occupancy量产车型实测,当下行业核心痛点
1. 真实量产落地情况
目前国内主流新能源车企高端智驾车型均已搭载Occupancy相关技术:头部品牌城市NOA系统采用轻量化FlashOcc衍生方案,单帧推理耗时控制在50ms以内,适配量产车载芯片;部分旗舰车型搭载TPV优化版本,针对高架、隧道垂直场景做专项优化,实测低矮障碍物识别召回率提升40%;入门纯视觉车型采用RenderOcc辅助训练,降低激光雷达采集依赖,压缩整车硬件成本。同等硬件条件下,BEV方案对1米以下低矮障碍物识别率不足55%;搭载Occupancy感知后,识别率提升至92%以上,高架分层场景误判率下降87%。2. 当前无法回避的行业痛点
- 算力矛盾高精度稠密 Occupancy 算力消耗大,低端车载芯片难以承载;轻量化方案会小幅牺牲远处物体感知精度;
- 标注成本难题高质量稠密 3D 激光真值采集、标注人力成本极高,百万级数据标注投入成为车企门槛;
- 极端环境鲁棒性不足暴雨、大雾、夜间逆光场景,纯视觉 Occupancy 容易出现体素预测空洞;
- 时序融合难度高动态行人、非机动车快速移动时,多帧体素融合容易出现残影、错位。
六、未来趋势:Occupancy+多模态大模型,打通完整端到端自动驾驶
Occupancy不是独立的感知模块,而是下一代端到端自动驾驶的底层基础底座,两大核心发展方向已经清晰:1. Occupancy作为端到端智驾统一输入
传统自动驾驶分为感知、预测、规划控制多模块,模块间存在信息损耗;未来端到端架构,直接把Occupancy完整三维空间特征输入大模型,一步输出车辆行驶轨迹,消除多模块信息断层。2. 多模态车载大模型与Occupancy深度融合
现在新车标配的车载多模态大模型,将和Occupancy形成互补:- Occupancy负责精准还原物理三维空间,看清道路、障碍物几何结构;
- 多模态大模型负责语义理解、逻辑推理,识别临时路牌、施工标语、特殊交通场景;
两者结合,车辆既能看清空间,又能读懂场景规则,实现真正类人驾驶。3. 技术迭代方向
轻量化稀疏化、无标注自监督训练、时序占用统一建模,是行业长期迭代主线;未来会逐步实现「低算力芯片+高精度三维占用感知」,全面下放至十几万入门家用车型。七、互动留言
互动话题:你有没有体验过搭载3D Occupancy空间感知的高阶智驾车型?高架、隧道场景里,它的表现有没有超出你的预期?欢迎在评论区分享你的用车实测感受,文章收藏转发给身边做汽车、自动驾驶的朋友,行业干货随时查阅!欢迎评论区留言交流!喜欢硬核智驾干货,欢迎关注AI研习干货、点赞、转发、收藏,后续持续更新自动驾驶端到端技术前沿内容!完整高清可修改 PPT 仅留给认真看完文章的朋友,在评论区留下【领取原版PPT】,优先发送完整版PPT。文章整理不易,尤其是图片,如果认可内容可任意打赏,点击下方👇喜欢作者,您的认可,是我们更新的动力❤️❤️❤️