随着自动驾驶技术的快速发展,高精度环境感知成为保障行车安全的核心环节。单车感知受限于传感器视野遮挡与算力约束,难以全面捕捉复杂的驾驶环境。为突破这一瓶颈,协同感知应运而生,通过多车之间共享感知信息,实现"群智"补全个体视野盲区。现有主流的协同感知方法——无论是车车协同(V2V)还是车路协同(V2I)—均采用广播式通信机制:车辆将自身的感知特征广播给周围的其他车辆或基础设施,接收方再融合多方信息完成环境建模。然而,这种广播范式带来了两个严峻挑战:其一,通信冗余极为严重,例如在三车V2V通信系统中,单车的平均通信带宽高达1606.82 Mbps,系统通信冗余率可达50%;其二,随着车辆数量增加,通信复杂度呈O(N²)增长,系统可扩展性受到严重制约。此外,现有方法普遍采用"开环融合"范式——车辆将本车感知信息发送出去并聚合后直接输出检测结果,而融合后的全局知识并未回流至单车感知阶段加以利用。这导致每一帧感知彼此孤立,历史信息被白白丢弃,感知的时序一致性和鲁棒性难以进一步提升。
该成果"Octopus: Vehicle-to-Road Collaborative Perception for Autonomous Driving with Closed-Loop Fusion"已被The Web Conference 2026(WWW 2026)录用并发表。WWW是中国计算机学会推荐的CCF A类会议,也是交叉综合领域最具影响力的国际学术会议之一。
在自动驾驶感知任务中,单车感知面临的核心挑战是视野受限。由于传感器安装位置和视场角的限制,车辆容易受到周围车辆、建筑物等遮挡,从而产生感知盲区。尽管近年来PointPillar、BEVFormer等BEV感知方法通过统一鸟瞰视角显著提升了环境建模能力,但遮挡带来的信息缺失仍难以依靠单车感知解决。因此,通过多主体共享信息以弥补视野盲区的协同感知(Collaborative Perception)已成为自动驾驶领域的重要研究方向。
现有协同感知主要包括车车协同(V2V)和车路协同(V2I)两类,大多采用广播式通信机制。然而,该范式存在三方面局限。首先,通信开销随车辆数量呈近二次增长,在交通密集场景下难以扩展。其次,现有特征融合方法通常依赖精确的相对位姿信息进行坐标对齐,而在V2R场景中车辆之间并不直接通信,导致传统对齐机制难以适用。最后,现有方法普遍采用开环融合模式,仅利用当前时刻的协同信息生成检测结果,而忽略了融合过程中形成的全局场景知识。由于连续时刻之间具有较强时序相关性,缺乏历史全局信息的利用会降低系统在动态遮挡和目标短时失踪场景下的感知鲁棒性与连续性。
基于上述动机,我们提出了Octopus—全新的车路协同感知框架。Octopus将传统的V2V广播范式改造为以RSU为中心的星型通信架构,从根本上将通信复杂度从O(N²)降至O(N);引入相对物体图和基于距离的融合解码器替代统一坐标系作为多车特征的融合载体,彻底摆脱了对车间相对位姿的依赖;并首次在协同感知中设计了闭环融合机制,将RSU聚合后的全局先验知识反馈至单车感知阶段,使每一帧感知都能站在"历史肩膀"上眺望当前场景,形成自我增强的感知闭环。
本文摒弃业内主流广播协同范式,从车端感知编码、路侧聚合优化、双向闭环交互三大维度搭建Octopus完整协同感知体系,依托5G低时延专网实现车路联动。
在V2R框架中,每辆车以上一时刻的全局物体特征作为先验知识,从传感器数据中提取感知信息,并通过5G网络将处理结果发送至路侧单元。具体而言,车端感知分为两步。第一步,观测编码器将原始激光雷达点云转换为BEV空间特征表示。第二步,相对物体解码器从BEV特征中解码出物体级表示,通过可学习的初始查询(Initial Query)与BEV特征进行交叉注意力交互,产生包含物体特征和相对位置关系的输出。与现有协同感知方法的关键不同在于:Octopus的解码器引入了上一时刻RSU回传的全局物体特征作为先验查询(Global Query),与初始查询融合后共同指导解码过程,使得单车在尚未接收任何外部信息时即能利用"上一帧世界长什么样"的历史知识来预判当前场景,从而提升本车感知的质量和时序一致性。
解码器输出经Top-K筛选后,保留分类置信度最高的K个前景物体,将其特征与相对位置打包为本地的相对物体图(Local Relative Object Graph)。相对物体图是Octopus的核心数据结构——每个物体的位置以相对于其观测车辆的方式编码,而非依赖统一的世界坐标系。这一设计巧妙地规避了V2R场景下车辆间缺乏相对位姿信息的问题,因为每辆车只需知道物体相对于自己的位置即可。最终,本地相对物体图连同车辆的GPS位姿信息,通过V2R通信链路发送至RSU。
在V2R框架中,RSU承担信息汇聚与融合的中心角色。由于车辆之间不直接通信,传统依赖车间相对位姿的特征对齐方法无法直接应用。为此,Octopus采用“空间对齐+位置约束融合”的两步策略。首先,在空间对齐阶段,各车辆上传的局部相对物体图均基于自身坐标系构建。RSU利用车辆上传的GPS位姿信息计算从车辆坐标系到世界坐标系的变换矩阵,将所有物体统一映射到全局坐标系下,从而实现跨车辆特征对齐,而无需获取车间相对位姿。
在此基础上,RSU进一步融合来自不同车辆的物体特征。然而,同一目标可能被多辆车同时观测,而不同目标之间又应避免错误关联。为此,我们设计了位置约束Transformer(Position-Constrained Transformer, PCT)。其核心为位置约束注意力掩码,根据物体在世界坐标系下的空间距离动态调整注意力权重:距离较近的物体具有更高的交互强度,而远距离物体的注意力则被显著抑制。该机制既能够实现同一目标多视角特征的互补融合,又有效避免跨目标误匹配。经过多层PCT融合后,所有局部相对物体图被整合为统一的全局相对物体图,从而获得场景中完整的全局感知表示。
传统协同感知方法普遍采用“开环融合”范式:车辆上传感知信息,RSU完成融合并输出检测结果后,融合产生的全局知识便被丢弃,无法在后续感知过程中持续发挥作用。为此,Octopus提出闭环融合(Closed-Loop Fusion)机制。RSU在完成全局融合后,不仅输出检测结果,还将全局物体特征与检测信息回传给所有参与车辆。车辆在下一感知周期中将这些全局特征作为先验知识注入相对物体解码器,指导新一轮物体查询生成,从而形成“车端感知→路端聚合→全局反馈→增强感知”的闭环迭代过程,实现历史全局知识的持续积累与利用。然而,闭环融合引入的全局先验会改变单车模型的输入分布,使原有预训练模型难以直接适配。为此,我们采用LoRA低秩适配策略,在解码器中插入轻量级低秩模块,仅更新少量新增参数而冻结大部分原始参数,以较低训练开销实现模型对闭环融合机制的快速适配。
我们在两个权威数据集上验证Octopus的有效性:OPV2V—大规模多模态V2V仿真协同感知数据集,包含59个场景;V2V4Real—首个大规模真实世界V2V协同感知数据集,覆盖约410公里行驶里程,包含20K帧激光雷达点云和240K个标注3D边界框。对比方法涵盖五类代表性协同感知基线:Attentive Fusion、CoBEVT、V2X-ViT、HEAL和CoCMT。评估指标采用AP@0.5/0.7和R11@0.5/0.7(平均精确度与11点插值平均精确度),以及通信量和推理速度(FPS)。
在物体检测精度方面,Octopus在两个数据集上均取得最优性能。在OPV2V数据集上,Octopus的AP@0.7达到90.08,相比最强基线HEAL提升了1.26个百分点,R11@0.5达到93.74;在更具挑战性的真实数据集V2V4Real上,AP@0.7达到51.73,相比次优方法CoCMT提升了3.82个,AP@0.5则达到72.41,较CoCMT提升了6.88。在通信效率方面,Octopus展现出压倒性优势:得益于V2R协同框架,单帧通信量仅为12.55 KB,而广播式方法—Attentive Fusion需传输69,206.20 KB的完整BEV特征,CoBEVT需17,301.50 KB,V2X-ViT和HEAL也均需12,976.13 KB—Octopus相比这些方法实现了最高达5514倍的通信量缩减。充分验证了V2R架构在大规模场景下的可扩展性。
我们逐一拆解Octopus的核心组件以评估其独立贡献,在V2V4Real数据集上进行三组对照实验:(1)无RSU无闭环融合的基线方案(即仅保留单车感知 + 基本的query通信),AP@0.7为46.57,通信量高达20,914.38 KB;(2)仅加入V2R架构,AP@0.7提升至48.56,同时通信量锐减至12.55 KB——仅此一项就将通信量压缩了三个数量级,充分说明星型通信架构和query级传输的优势;(3)在V2R基础上进一步加入闭环融合,AP@0.7跃升至51.73,相比基线净提升5.16个百分点。值得注意的是,CLF在不增加任何通信开销的前提下实现了显著的精度增益,这完全归功于全局先验在时序上的重复利用。
Top-K决定了每辆车向RSU传输的物体query数量,直接影响通信量与感知精度之间的平衡。我们在V2V4Real数据集上对K = {20, 40, 60, 80, 100, 120}进行系统扫描,结果呈现出清晰的"倒U型"趋势:当K从20增加至80,AP@0.7从47.06持续攀升至51.73,因为更多的query意味着更完整的前景物体覆盖,为RSU端融合提供了更丰富的信息源;然而当K继续增至100和120时,AP@0.7反而回落至51.20和49.57。原因有两方面:一方面,过多的低置信度query引入了背景噪声和虚假物体,增加了PCT融合时的干扰和模型收敛难度;另一方面,更多query直接增加了通信成本。K=80在精度和效率之间达到了最佳平衡。
闭环融合中RSU回传给车辆的信息可以有多种形式,我们对比了三种方案:(1)无反馈——车辆每次独立感知,不接收任何历史信息,AP@0.7为46.57;(2)检测结果反馈——RSU将最终的3D检测框(包含类别、位置、尺寸等几何参数)回传至车辆,AP@0.7反而下降至42.37,甚至低于无反馈基线。这一反直觉的结果表明,检测结果仅保留了筛选后的稀疏几何信息,不仅丢失了丰富的语义特征,还可能因为检测阶段的误检和漏检引入错误先验,将模型导向次优解,造成误差的级联放大;(3)融合query反馈——RSU将融合后的全局物体query(即PCT输出的中间特征)回传至车辆,AP@0.7达到51.73。融合query保留了Transformer解码器中间层的高维语义特征和上下文关联信息,车辆解码器通过交叉注意力自主选择有用信息,避免了检测后处理带来的信息损失和误差传播。这一对比充分说明,在闭环融合中"反馈什么"与"是否反馈"同等重要——反馈中间特征远优于反馈输出结果。
Ruikun Luo, Jiadong Zhao, Peize Su, Jieming Yang, Jing Yang, Yuan Gao, Minhui Xue, Xiaoyu Xia. Octopus: Vehicle-to-Road Collaborative Perception for Autonomous Driving with Closed-Loop Fusion. In Proceedings of the ACM Web Conference 2026 (WWW'26), pp.5263-5274.
https://doi.org/10.1145/3774904.3792317