多车自动驾驶竞速的难点不只是沿最快线路开得快。车辆需要持续判断对手会怎样回应,在跟驰、并排争夺、封堵和超车之间切换,还要保证每次机动都不越界、不碰撞。基于 MPC 的博弈规划可以显式处理约束,但近距离交互带来高度非凸的问题,计算时间和解质量都很依赖初值;GPU 采样规划速度较稳,却常把安全只写成软惩罚,激烈对抗时可能选出不可行轨迹。
浙江大学、新加坡南洋理工大学和美国宾夕法尼亚大学等机构的研究团队提出 Sampling-based Game-Theoretic Planning,简称 SGTP。它把迭代最佳响应中的每个子问题变成 GPU 并行控制采样与动力学 rollout,再用游戏感知代价排序,最后用显式赛道边界和车辆碰撞检查筛掉不可行候选。
在 7 条赛道、42 场三车长时比赛中,SGTP 取得 95.24% 胜率、100% 无碰撞胜利率和 75% 最终超车率,平均每次规划耗时 0.095 秒。扩展实验还覆盖最多 10 辆车。
用采样近似每辆车的最佳响应
多车策略被写成一个迭代最佳响应过程。当前轮为车辆 规划时,其他车辆的预测轨迹保持固定;系统围绕名义控制序列采样 组加速度与转角扰动,将控制裁剪到允许范围,再用运动学自行车模型并行展开未来轨迹。
图 1:每辆车从并行 rollout 中选择最佳可行响应;完成规定 IBR 轮次后,自车再根据最终对手预测多做一次响应。
候选数量固定时,采样和动力学展开适合在 GPU 上批处理,计算路径比逐次求解非凸优化更可预测。实验配置使用 条候选、1.2 秒预测窗和 个离散步骤,运行两轮 IBR。选中的控制序列会作为下一轮和下一规划时刻的 warm start,使采样云围绕当前有效策略继续探索。
每轮选择可以概括为
负责给候选排序, 表示它同时通过边界与碰撞检查。这个拆分很关键:代价函数可以鼓励有竞争力的行为,硬筛选则决定这些行为能否安全执行。
四项游戏感知代价塑造不同竞速行为
普通赛线跟踪代价偏好沿最小曲率线路快速前进,很难主动形成封堵或持续并排。SGTP 对每个对手增加四项成对博弈代价:
Contest maintenance 奖励终点纵向差仍处于有效对抗窗口的候选,避免规划器过早放弃交互。Longitudinal advantage 奖励在预测窗末端领先,而且车辆越接近,进度奖励权重越大。Blocking alignment 只在车辆已经领先且对手仍在争夺范围时激活,鼓励末段横向位置对齐,压缩后车可用通道。Safety margin 对小于期望间距的轨迹施加二次惩罚。
游戏代价与赛线跟踪、控制幅值及控制变化代价相加。它不预先定义超车、封堵等离散模式,行为从不同 rollout 的相对排名中出现。对手位置变化后,下一轮 IBR 会重排候选,因此车辆可以从封堵转为回归赛线,也可以从跟驰转为并排争夺。
软安全代价之外,再做显式可行性筛选
只靠 safety cost 不能保证候选满足安全约束,因为更高的进度收益可能抵消碰撞惩罚。SGTP 因此为每条候选计算两个布尔条件。边界检查要求整个预测窗内,车体到左右赛道边界的最小余量至少为 ;碰撞检查要求它与所有对手的时间对齐最小距离至少为 。
只有同时通过两项检查的候选才参与最终选择。若没有候选完全可行,系统不会任意执行成本最低轨迹,而是选择边界违反量与碰撞违反量之和最小的 fallback。实验中的边界阈值为 0.515 米,碰撞阈值为 0.9 米,游戏安全期望距离为 1.0 米。
这种设计把竞争性与可执行性分成两个层次。游戏感知代价可以积极探索近距离对抗,硬约束始终保留否决权,最小违反 fallback 则让有限采样未覆盖可行域时仍有确定的退化策略。
三条赛道中的封堵、跟驰与超车
图 2:红色自车从队尾出发,对手会主动封堵;规划器在持续近距离争夺后找到可行超车通道。
Berlin 场景中,蓝车先离开参考赛线做防守,红色自车在后方跟随,随后利用速度优势进入并排行驶并完成超车。f-shape 场景中,前车封堵过度后,赛线跟踪与封堵代价的权衡推动它回到参考线,自车保留侧向通道并超过。Brands Hatch 中,自车同时面对前车封堵和后车进攻,仍在弯道内找到机会。
图 3:自车先跟驰并缩小差距,随后在 至 进入并排争夺,依次超过两辆对手。
这些轨迹展示的是闭环中的策略转换。每辆车都由 SGTP 控制并会回应其他车辆,结果不依赖一个固定脚本。论文用视频进一步展示最多 10 车的交互过程。
胜率、持续时间与实时性
主实验使用 F1TENTH Gym,在 7 条赛道各取 6 个起点,共 42 场比赛。每场包含一辆从最后方起步的自车和两辆对手,最长运行 50 秒;自车碰撞就终止。比较对象包括 lattice、Race Stack、End2Race、conditional flow matching、MPPI、Biased-MPPI、EVO-MPCC 和 IBR-MPC。
SGTP 的胜率为 95.24%,40 场胜利都没有碰撞,因此 collision-free win 为 100%。平均比赛持续 49.67 秒,达到时限的 99.35%;最终超车率为 75%,平均速度 5.86 米每秒。平均规划耗时 0.095 秒,标准差 0.004 秒,最大值 0.102 秒,这一耗时包含两轮 IBR 和最后一次自车响应。
EVO-MPCC 与 IBR-MPC 的胜率分别为 92.86% 和 85.71%,但平均规划耗时达到 0.860 秒和 1.903 秒,标准差也更大。二者的平均比赛持续时间只有 10.58 秒和 12.46 秒,说明高胜率没有转化为稳定的长时近距离对抗。
图 4:SGTP 在长时交互、胜率、超车和实时性之间最均衡;从 2 车增至 10 车时,计算时间增长缓慢且全部无碰撞。
两个核心模块缺一不可
移除游戏感知代价后,SGTP w/o GC 仍保留可行性筛选,但胜率从 95.24% 降到 50%,无碰撞胜利率只有 14.29%。它可以避免部分危险动作,却缺少争夺、领先和封堵激励,竞争性明显下降。
GA-IBR-MPPI 使用相同游戏代价和 IBR,却以标准 MPPI 重要性加权更新替代显式可行候选选择。它的胜率为 57.14%,无碰撞胜利率为 0%,最长比赛仅 5.21 秒。结果说明软安全项不足以支撑长期轮对轮比赛,硬可行性检查是持续交互的必要组成。
对对手预测加入噪声时,SGTP 会主动变保守。严重扰动使近距离片段时长减少 63.86%,平均比赛时长只下降 4.41%,无碰撞完赛率仍为 94.12%。这表明安全项和可行性筛选会以减少贴身争夺换取鲁棒性。
适用边界
当前结果来自仿真的 F1TENTH 运动学自行车模型与纯追踪控制器,论文没有报告 SGTP 在真实赛车、轮胎极限或感知误差下的闭环验证。所有游戏代价权重均为人工调节,不同车辆、赛道和驾驶风格可能需要重新标定。
SGTP 也依赖有限采样覆盖有用控制区域。最小违反 fallback 能处理没有完全可行候选的时刻,却不等同于安全保证。未来工作计划减少参数调节,并利用世界模型识别对手风格;在道路车辆场景中,还需加入交通规则、不确定性边界与形式化安全层。
相关链接
- 原始论文:https://arxiv.org/abs/2607.25388
- 项目主页:https://sgtp-racing.github.io/
- GitHub:https://github.com/zhouhengli/SGTP-Racer