清华大学李升波教授课题组与滴滴深穹远航实验室(DiDi Voyager Labs)联合提出自动驾驶模型大规模强化学习并行训练框架FAST,旨在解决自动驾驶强化学习闭环训练中采样时长异构与全局重置带来的优化效率和性能瓶颈。实验表明,FAST在5-30 clips并行规模下全面超越SGR(OpenAI)与VER(Georgia Institute of Technology)基线,有效采样吞吐最高提升9.08倍、训练加速比最高达2.0倍,同时经严格统计检验,策略性能实现零损失。
研究链接:https://arxiv.org/abs/2606.21587
自动驾驶强化学习(Reinforcement Learning,RL)训练高度依赖与仿真环境的海量交互数据,采样效率是决定训练速度的关键因素。现有方法常采用多仿真环境的同步并行提升数据吞吐。
然而在真实交通工况驱动的闭环 RL 训练中,不同驾驶场景的采样时长差异悬殊:异常场景易导致短时间碰撞终止,常规场景则能够持续采样。这种采样时长异构性与采样数据同步性要求相叠加,催生了一个根本矛盾:传统并行框架为维持同步,强制要求“个体终止、全体重置”(Synchronous Global Reset, SGR)。而在自动驾驶闭环仿真中,每次重置意味着需要重新加载高精地图、重建交通流、初始化传感器状态等完整场景,涉及大量 HD map 数据与感知状态在硬件层级间的跨设备传输,单次重置开销极为高昂。一旦并行规模扩大,最短 episode 触发重置的概率趋近于 1,重置开销将主导整个采样周期,这引发两重后果:

当并行环境中最先终止的片段(Clip 1)触发全局重置时,其余仍在采集有价值数据的片段(Clip 2至Clip n)被强制截断,大量有效样本(绿色区域)被丢弃,重置开销随之急剧累积。
现有工作的应对方案各有局限:高性能仿真引擎(EnvPool、Brax、Isaac Lab)仅优化单步速度,无法消除同步等待开销;VER 通过异步采集缓解掉队者效应(Straggler Effect),但频繁的个体重置在高并发场景下仍积累大量延迟。自动驾驶领域至今缺乏一套能在数学层面保证 on-policy 无偏性,又能彻底消除重置开销的采样机制。
为量化上述低效,本工作将有效吞吐量()定义为单位时间内采集到的有效 on-policy 转移数,并将其分解为三个相互制约的因子:
其中 、 与 分别定义如下:
原始采样吞吐量():系统单位时间内生成的全部转移数,反映采样系统的整体产出速率:
其中 为一次采样阶段内生成的样本总数, 为完成该采样阶段所需的时间。由于 中天然包含了 reset 的等待开销,reset 发生得越频繁、采样阶段 reset 耗时越长, 就越被拉长, 也随之被压低。
样本有效率():实际有效转移占全部生成样本的比例,反映数据质量:
其中 为有效转移数, 为包含 padding 在内的全部生成样本数。传统 SGR 通过立即重置保证 ,但以牺牲时间效率为代价。
时间效率比():实际仿真时间占完整采样周期的比例,反映重置开销对整体吞吐的拖累程度:
其中 为实际环境步进时间, 为物理引擎重初始化开销。并行环境越多,最短 episode 触发重置的概率趋近于 1,期望步进时间急剧缩短, 占比随之主导整个采样周期, 灾难性下降。
三者的矛盾在于:传统的 SGR 维持 ,却让 和 随并行规模扩大而崩塌;而等待所有环境完成再统一重置虽可提升 ,却引入大量无效 padding 样本使 大幅下降,且同样没有从根源上减少 reset 本身的开销。真正的瓶颈始终是 reset 的频率与时长。如何在不牺牲 的前提下从根源上同时压缩 reset 的频率与时长、进而联合提升 与 ,是本文的工作重点。
FAST 的核心洞察是:不再让某一个环境的终止立即触发全局重置,而是将“个体环境终止”和“全局重置触发”解耦。已终止环境通过虚拟续步保持张量形状一致,仍在运行的环境继续采集有效轨迹,直到满足统一截断条件。

FAST整体框架分为采样阶段(Sample Stage)与训练阶段(Train Stage)两部分。采样阶段中,多个并行环境在DPSA机制下同步运行,已终止环境以虚拟续步维持同步直至全局截断触发;训练阶段中,收集到的样本经拼接后由SMPO机制进行掩码归一化处理,最终用于策略更新。
已终止的环境不再立即重置,而是以 dummy 数据虚拟续步,维持向量化 pipeline 的张量形状完整性;这部分虚拟步进产生的数据会通过有效性掩码被同步标记为无效,以确保后续梯度计算不受污染。与此同时,系统在每个时间步实时统计全局终止率 ,即已终止 clip 占全部 clip 的比例:
其中 为第 个并行环境的终止标记。当 超过阈值 ,或达到最大时域 时,系统触发统一截断:
这一机制带来两个关键效果:存活环境的长时域轨迹得以完整保留;全局重置频率大幅降低,时间效率比 稳定维持 99.6% 以上。
虚拟续步引入的 padding 转移若不加处理,会污染优势函数估计并扭曲策略梯度。此外,padding 样本密度随 和训练进度动态变化,若不归一化每轮更新步长将不稳定。为此,SMPO 为每个时间步维护时域有效性掩码:
并以实际有效转移总数对掩码损失归一化,构造如下目标函数:
其中 为新旧策略的概率比, 为估计的优势函数值, 为裁剪超参数。通过以有效转移总数归一化,SMPO 确保 padding 数据对策略更新毫无影响,训练行为与没有 padding 时完全一致,on-policy 分布对齐得到严格保证。
整体算法流程如下所示:

实验在配备8块NVIDIA H20 GPU的高性能节点上展开,使用滴滴真实接管场景数据集。该数据集专门收录需要人工干预的高难度场景,episode时长极度异构,完美复现Straggler Effect的最坏情况。在各种并行环境规模下,对所提出的 FAST 框架以及包括 SGR 和 VER 在内的几种极具竞争力的基线方法进行了多维度评估。如下表所示,总体而言,FAST 框架在所有并行配置下均持续实现了最优性能,直接证明了该方法的内在优越性。作为这一性能飞跃的核心证据,下表直观展示了 FAST 是如何在采样效率、吞吐量以及策略性能等关键指标上全面超越基线方法的。


针对不同规模的并行采样任务,FAST 框架展现出卓越的执行时间控制能力。在 10 clips 的并行设置下,FAST 的采样时间大幅缩减至 14.35 秒,相较于顺序基线(SC)的 84.67 秒降低了 83.0%,实现了 1.94 倍的整体训练加速,显著超越了同步基线 SGR‑10(1.42 倍)和异步基线 VER‑10(1.45 倍)。相反,传统 SGR 算法的采样性能随并行规模扩大而严重退化,在 30 clips 设置下加速比剧烈跌至 0.88 倍,由于同步重置瓶颈反而慢于非并行基线;而 VER 受限于频繁数据获取的固有开销,同样无法超越 FAST。此外,由于训练循环内执行了可视化与策略同步等辅助操作,最终总耗时会略微大于采样与训练耗时的算术总和。
研究团队进一步通过有效吞吐量对计算效率进行了深入的机制层分析,该指标本质上由样本有效率和时间效率比共同制约。SGR 和 VER 虽然保持了 100% 的完美样本有效率,但高频环境重置导致时间效率比灾难性衰减;相比之下 FAST 展现出更健康的训练演进模式。在训练初期虽然由于虚拟续步机制导致有效率较低,但随着训练推进,其最终能稳定收敛至 93% 以上,确保了高数据质量。与此同时,得益于解耦环境管理,FAST 成功消除了环境频繁全局重置带来的硬件等待开销,在全配置下维持了超过 99.6% 的近乎完美的时间效率比,证明优化时间效率比是大规模分布式训练实现高吞吐量数据采集的核心驱动力。

为了探究效率提升对数据质量的深层影响,该研究对不同并行配置下仿真轨迹长度的统计分布进行了对比分析。研究指出,传统 SGR 基线的平均 episode 时长随着并行规模的扩大而急剧下降。这种现象归咎于其僵化的同步机制,即任何单个环境的终止都会强制触发全局重置,不可避免地截断了其他并发环境中的活跃长轨迹,从而引发了严重的短时域偏置,导致智能体无法习得多元的长尾行为。相比之下,FAST 框架通过将重置触发与个体终止解耦,在各种 clips 配置下均能稳定维持在约 35 步的平均时长,与顺序基线高度契合,成功消除了短时域偏置并促进了更稳健的策略优化。

最后,研究团队对以实际训练时间为横轴的策略收敛速率展开了可视化评估。如下图所示,FAST‑10 模型表现出更加平滑且快速的初期跃升,在约 20 小时的真实训练耗时内就率先达到了稳定性能平台。相比之下,标准的 SC 基线需要超过 40 小时,而经过加速的变体 SGR‑10 和 VER‑10 则需要大约 30 小时才能实现收敛。

为了严格验证并行加速机制不会引入任何策略性能的退化,实验对安全、舒适、合规、效率四大维度共 14 项核心闭环驾驶指标(包含碰撞程度、前车风险、安全边界、急刹、急加速、压实线、闯红灯、黄灯不当进入、车位泊入精度、横向避让精度、超速违章、车速效率、卡顿时间以及拉出距离偏差比)进行了 Jackknife 重采样分析。结果表明,所有 14 项闭环驾驶指标在对比 FAST‑10 与顺序基线时,其 95% 的置信区间均完美覆盖零点。这在统计学上完整且严格地证明了 FAST 框架在大幅提升并行训练速度的同时,未引入任何系统性的性能退化,实现了真正的策略性能零损失。

本研究提出 FAST 框架,通过 DPSA 的虚拟续步机制与 SMPO 的梯度无偏保证,从系统与算法双维度协同解决了自动驾驶并行 RL 采样的核心瓶颈。实验结果表明,解耦“个体终止”与“全局重置”是突破同步并行框架效率天花板的关键所在。FAST 为大规模自动驾驶策略训练提供了即插即用的高吞吐量解决方案,其设计思路同样适用于具身智能、机器人操作等任何 episode 时长高度异构的 on-policy RL 训练场景。