Armor推荐理由 自动驾驶中的 3D 指代需要让查询里的物理属性找到能观测它的传感器。Talk2Sensors 把颜色、几何、距离和速度写进自然语言指令,TSFormer 再让文本参与空间采样和模态选择。三传感器 EAA mAP 从 FUTR3D 的 42.949 提高到 51.000,但移除 LiDAR 后 DCA mAP 只剩 18.9。这组结果同时说明了方法价值和现实边界:语言能够调度证据,几何骨架仍主要依赖 LiDAR。
原论文信息
论文标题: Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching
发表日期: 2026 年 8 月
发表单位: 香港科技大学(广州)、哈尔滨工业大学、武汉大学、复旦大学等
论文类型: arXiv 预印本
原文链接:arXiv:2608.04568[1]
开源代码:项目仓库[2]目前仅有占位 README,代码未开源
公开数据: 基于 View-of-Delft 构建;Talk2Sensors 标注数据未共享
通讯作者: Daizong Liu、Hui Xiong
查询距离和速度时,相机没有对应的物理测量
3D visual grounding 要根据一句自然语言,在三维场景中找出被描述的目标。室内研究常用 RGB-D 或点云,户外研究则常从单目图像出发。这两类设置都回避了自动驾驶中的一个基本事实:颜色、三维轮廓、距离和运动速度来自不同的测量机制。
例如,查询要求寻找“前方约 45 至 50 米、以每秒 5 米向前运动、背着包的骑行者”。相机可以提供外观和语义,LiDAR 描述三维几何更加稳定,4D 雷达能够补充距离和运动信息。单一传感器无法稳定覆盖整句话中的全部约束。
常见融合方法也会造成新的问题。把相机、LiDAR 和雷达特征简单相加或拼接,相机的稠密特征容易占据主要权重,稀疏雷达中的速度线索反而可能被淹没。固定投影到 BEV 或体素空间又依赖标定和预设几何关系,难以适应不同的传感器组合。
图1:Talk2Sensors 根据语言查询调用相机、LiDAR 与 4D 雷达信息。
数据集先把语言与物理属性对齐
作者从 View-of-Delft 的同步相机、LiDAR 和 4D 雷达数据出发,构建了 8,682 条自然语言指令,覆盖 20,558 个被指对象。标注者先查看可量化的多传感器属性,再编写包含外观、几何和运动约束的指令,并由三名专家检查文本与传感器事实是否一致。
这一步决定了模型究竟能学到什么。数据中的文本平均含 20.2 个词,中位数为 18 个词。31.7% 的查询只依赖 LiDAR,20.7% 依赖 LiDAR 与雷达,18.4% 依赖相机与 LiDAR,真正同时依赖三种传感器的查询占 2.9%。
图2:Talk2Sensors 的量化、标注与多人核验流程。
这些比例也提醒我们,三传感器系统的平均成绩不等于每条指令都需要三路输入。更有意义的问题是:模型能否根据当前查询保留必要证据,并减少无关模态的干扰。
文本先找位置,再决定保留哪种传感器证据
TSFormer 用两个连续步骤处理这个问题。Language-Routed Property Sampler,简称 LRPS,先把文本编码注入对象 query,再用文本与 query 的相似度调制可变形采样。查询谈到距离、速度或外观时,采样位置和传感器特征会随文本发生变化。
Sparse-Preserving Modality Arbiter,简称 SPMA,随后根据全局文本预测样本级传感器门控。模型只保留得分最高的两个模态,再用文本引导的交叉注意力细化融合结果。这个设计针对的是传感器密度不平衡:稀疏信息是否保留,应由查询内容决定,不能由特征数量决定。
图3:TSFormer 先用 LRPS 获取文本相关特征,再由 SPMA 选择和融合传感器证据。
可视化结果给出了较直观的解释。同一条行人查询下,普通的模态无关采样会把注意力分散到背景和其他物体;LRPS 的采样响应更集中于被指行人。它不能单独证明定位准确,却能说明文本调制确实改变了模型读取场景的位置。
图4:LRPS 与模态无关采样器在同一查询下的响应差异。
独立实验验证:增益来自查询路由还是传感器堆叠
在 Talk2Sensors 主测试中,三传感器 TSFormer 的 EAA/DCA mAP 为 51.000/66.499。FUTR3D 为 42.949/58.878,对应绝对提升 8.051/7.621。EAA 更严格地要求预测框与目标匹配,DCA 则关注驾驶相关区域,两组指标都显示出一致增益。
模态组合实验进一步限定了增益来源。EAA mAP 从 LiDAR 单模态的 46.182,提高到 LiDAR 加雷达的 48.275,再提高到相机、LiDAR 与雷达共同输入时的 51.000。雷达单模态只有 1.463;移除 LiDAR 后,DCA mAP 降到 18.9。当前系统仍以 LiDAR 提供的几何信息为主体,其他模态负责补充外观与运动线索。
图5:Talk2Sensors 上不同模型与传感器组合的主要结果。
模块消融更接近机制验证。采用普通采样和求和融合的基线为 43.217;只加入 LRPS 为 47.542,只加入 SPMA 为 46.885,两者同时使用达到 51.000。去掉 LRPS 的文本调制因子后降至 47.230。这说明性能提升不能只归因于增加网络容量,文本参与采样与模态选择都提供了独立贡献。
跨数据集实验报告了 Mono3DRefer Overall Acc@0.5 53.05%,高于 Mono3DVG-TR 的 44.25%。该实验在原有 KITTI 图像之外补充了 KITTI LiDAR,因此它验证了跨数据集的属性感知设计;该结果不属于纯单目条件下的迁移成绩。
三传感器指代离车辆部署还有多远
论文报告 LiDAR 加雷达配置为 9.2 FPS,接近 TPCNet 的 9.6 FPS,但没有给出完整三传感器系统在车规平台上的感知时延。训练使用 4 张 RTX 4090,持续 80 个 epoch,每张卡的 batch size 为 2。这些数字只能说明论文实验的计算条件,不能替代车辆端吞吐、显存和功耗评估。
数据来自 View-of-Delft,论文没有覆盖夜间、恶劣天气、连续时序查询、传感器故障或跨硬件标定变化。作者提到雷达的恶劣天气属性,但当前实验没有证明模型在这些条件下仍能保持优势。
项目仓库目前只有占位内容,Talk2Sensors 标注、训练配置和模型参数尚未提供。现阶段,这项工作给出了多传感器 3D 指代的问题定义与方法基线;车辆接入所需的完整实现尚未形成。
Armor三问
1. TSFormer 是不是自动为每句话选择一个传感器?
不是。LRPS 会从各模态中采样文本相关特征,SPMA 再用样本级门控保留得分较高的模态。它调整的是证据权重和融合路径,不是把整条查询硬分配给单一传感器。
2. 三传感器成绩更高,能否说明雷达贡献最大?
不能。雷达单模态 EAA mAP 只有 1.463,而 LiDAR 单模态达到 46.182。加入雷达和相机后成绩继续上升,说明它们提供补充线索;当前几何定位仍主要依赖 LiDAR。
3. Mono3DRefer 的 53.05% 能否视为纯视觉迁移?
不能。该实验补充了 KITTI LiDAR。它说明 TSFormer 可以迁移到另一份数据和任务设置,但不代表模型只看单目图像也能达到同样结果。
Armor测评
学术/科研价值: ★★★★☆
论文把多传感器 3D 指代从通用特征融合推进到物理属性与语言查询对齐,并通过采样、门控和消融形成较完整的证据链。数据仍来自单一基础数据集,跨域结论有限。
工业/工程价值: ★★★☆☆
按查询分配传感器证据可用于交互式自动驾驶感知和具身任务。当前系统高度依赖 LiDAR,缺少车规平台时延、传感器故障和恶劣环境验证。
商业/产品价值: ★★☆☆☆
自然语言检索三维道路目标具有数据查询和人机交互潜力,但代码、标注和模型参数尚未开放,产品接口与安全降级策略也未形成。
可能的问题: 雷达单模态表现弱;无 LiDAR 时性能明显下降;三传感器查询比例较低;跨城市、跨硬件、夜间、恶劣天气和连续时序没有验证;项目仓库仍是占位状态。
主要参考文献
Guan, R., Tian, D., Ouyang, N., et al. (2026). Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching. arXiv:2608.04568. https://arxiv.org/abs/2608.04568[1]
本文仅代表个人理解及观点,不构成任何论文审核或项目落地推荐意见,具体以相关组织评审结果为准。论文内容如有理解偏差,以原文为准。欢迎就论文内容交流探讨,理性发言哦~
对自动驾驶多传感器融合、4D 雷达和视觉语言模型感兴趣的朋友,欢迎关注Armor知道公众号!
[1] arXiv:2608.04568:https://arxiv.org/abs/2608.04568[2] 项目仓库:https://github.com/GuanRunwei/Talk2Sensors