顶刊速递 | IEEE TITS 自动驾驶如何破除“机器人僵滞问题”困局?
顶刊速递 | IEEE TITS自动驾驶如何破除“机器人僵滞问题”困局?双向交互感知决策全面综述在复杂的城市交通中,自动驾驶车辆(AV)必须与意图随机、行为多变的人类驾驶员(HDV)共享路权。如果仅采用传统“单向交互”策略(被动预测周围车辆轨迹并单向避让),车辆往往会变得过于保守,陷入“机器人僵滞问题”(Freezing Robot Problem),甚至引发交通拥堵或碰撞事故。
为了实现安全、高效且符合人类社交习惯的驾驶,双向交互感知决策(Interaction-Aware Decision-Making)成为了突破瓶颈的关键技术。近日,发表于智能交通领域顶级期刊IEEE Transactions on Intelligent Transportation Systems (TITS)的最新综述论文,系统梳理了近十年来(2016-2025)双向交互感知决策的技术演进、验证平台与发展前景。
在实现双向交互感知决策的过程中,研究人员面临以下三大核心挑战:
人类驾驶员的行为呈现多样性、随机性乃至非理性特征。周遭车辆的驾驶策略对 AV 而言完全隐蔽,只能通过观察到的动作进行实时估计。不同地区和国家拥有截然不同的驾驶文化与隐性社交礼仪(如非语言的礼让协同)。自动驾驶决策系统需要快速适应这些动态变化的社交规则。人类驾驶员期望 AV 的行为具有可预测性与透明度。过分防御或过分激进的决策都会破坏人类与 AV 之间的信任,带来安全隐患。为解决上述难题,论文将现有的双向交互感知决策方法系统性地归纳为三大核心技术范式:
双向交互感知决策范式
│
┌────────────────────────────────┼────────────────────────────────┐
▼ ▼ ▼
1. 优化范式 2. 策略学习范式 3. 大模型推理范式
(Optimization) (Policy Learning) (LLM/VLM Reasoning)
├─ 物理/数学交互模型 ├─ 强化学习 (RL) ├─ LLM 独立决策/推理增强
└─ 数据驱动交互模型 └─ 模仿学习 (IL) └─ VLM / VLA 端到端推理1. 基于优化范式的交互决策(Optimization Paradigm)该范式首先显式建模 AV 与周边交通参与者的双向交互关系,进而构建优化问题进行求解:
- 物理/数学模型:采用博弈论(Stackelberg、Nash 平衡、Level-K)或 POMDP(部分可观测马尔可夫决策过程)建模。此类方法数学逻辑优雅、可解释性强,但计算复杂度高,且难以穷尽复杂真实场景。
- 数据驱动交互模型:利用深度神经网络学习交互模式(如 Ego-conditioned 预测与可微联合预测规划 DIPP/DTPP),消除了传统单向预测中的“因果断层”。
2. 基于策略学习范式的交互决策(Policy Learning Paradigm)无需预先显式构建交互模型,直接通过数据交互学习决策策略:
- 强化学习(RL):结合图神经网络(GNN)或 Transformer(如 Scene Representation RL),使 AV 在试错与探索中自发掌握复杂的博弈技巧与社交交互规矩。
- 模仿学习(IL):通过行为克隆(BC)、逆强化学习(IRL)与 GAIL 直接从人类驾驶专家数据中提取交互意图与内部奖励函数。
3. 基于大模型推理范式的交互决策(LLM/VLM Reasoning Paradigm)引入大语言模型(LLM)与视觉语言模型(VLM/VLA)常识推理能力:
- 将大模型作为独立决策器或慢思考推理增强模块(Fast-Slow 架构),利用其常识泛化与可解释性突破长尾场景下的决策难题。
论文不仅分类提炼了算法,还全面总结了交互决策在闭环仿真(Carla, nuPlan, MetaDrive 等)与 Benchmark 评估基准上的发展现状,并提出了三大未来关键发展方向:
🚀 1. 构建逼真世界模型(World Models)结合生成式 AI 预测未来场景演化,提供高逼真度、可交互的仿真验证环境。将“黑盒”学习算法的内部决策动机转化为自然语言,提升用户信任与社会接受度。在注重博弈与效率的同时,将显式交通规则严格嵌入双向交互算法中。📄 论文题目:A Survey on Interaction-Aware Decision-Making for Autonomous Driving: Challenges, Solutions, and Perspectives