自动驾驶的强化学习训练一直卡在一个奇怪的位置:算力堆得很满,但训练吞吐却不见同比例抬升。清华大学李升波教授课题组与滴滴深穹远航实验室(DiDi Voyager Labs)联合提出的 FAST(Fast Asynchronous Sampling for Training)框架,正是冲着这一矛盾去的——通过解耦「个体终止」与「全局重置」的两个核心机制,在 5~30 clips 并行规模下把有效采样吞吐最高抬到原来的 9.08 倍,训练加速比稳定到 2.0 倍,同时把策略性能维持在零损失水平。这是一项典型的系统层突破,而不是单纯的算法层突破,其工程价值放在具身智能、机器人操作等同样场景异构的 RL 训练里同样成立。
自动驾驶的强化学习训练高度依赖与仿真环境的海量交互数据,采样效率是决定训练速度的关键因素。在多仿真环境并行采样的现有框架里,几乎所有方法都要面对「个体终止、全体重置」(Synchronous Global Reset, SGR)的硬约束:只要并行环境里有任意一个片段先终止触发,全局就要重置,包括尚未跑完的长时域轨迹。
这一约束在自动驾驶闭环仿真里代价尤其高。每一次重置都要重新加载高精地图、重建交通流、初始化传感器状态,这些都涉及大量 HD map 数据与感知状态在硬件层级的跨设备传输。当并行规模从 5 clips 扩到 30 clips,最短 episode 触发重置的概率趋近于 1,重置开销随之主导整个采样周期。
这一机制带来两类连锁后果:第一,采样效率倒退——并行规模越大,重置越频繁,采样时间不降反升;第二,数据质量退化——长时域轨迹被频繁截断,智能体难以从完整的驾驶过程里学到关键的长尾行为与复杂决策链。
现有工作的应对方案各有局限。高性能仿真引擎(EnvPool、Brax、Isaac Lab)只优化单步速度,无法消除同步等待开销;VER(Georgia Institute of Technology)通过异步采集缓解掉队者效应(Straggler Effect),但频繁的个体重置在高并发场景下仍积累大量延迟。自动驾驶领域至今缺乏一套能在数学层面保证 on-policy 无偏性,又能彻底消除重置开销的采样机制。
二、用三个因子定义有效吞吐量
FAST 团队把有效吞吐量分解为三个相互制约的因子:原始采样吞吐量、样本有效率、时间效率比。三者之间的取舍关系恰好对应了现有方案的瓶颈。
原始采样吞吐量是单位时间内生成的全部转移数,反映采样系统的整体产出速率。由于原始吞吐量天然包含 reset 的等待开销,reset 越频繁、采样阶段 reset 耗时越长,原始吞吐量就被压得越低。传统 SGR 通过立即重置把样本有效率维持在 100%,但这是以牺牲时间效率为代价的。
时间效率比是实际仿真时间占完整采样周期的比例,反映重置开销对整体吞吐的拖累程度。并行环境越多,最短 episode 触发重置的概率趋近于 1,期望步进时间急剧缩短,时间效率比随之灾难性下降。SGR 和 VER 虽然保持了 100% 的完美样本有效率,但高频环境重置导致时间效率比灾难性衰减。
传统 SGR 维持了样本有效率,但让时间效率比随并行规模扩大而崩塌;而「等所有环境完成再统一重置」的方案虽可拉升时间效率比,却引入大量无效 padding 样本使样本有效率大幅下降,且同样没有从根源减少 reset 本身的开销。真正的瓶颈始终是 reset 的频率与时长。
三、解耦:FAST 的核心洞察
FAST 的核心洞察只有一句话:把「个体环境终止」和「全局重置触发」解耦。已终止环境不再立即重置,而是以 dummy 数据虚拟续步,维持向量化 pipeline 的张量形状完整性;仍在运行的环境继续采集有效轨迹,直到满足统一截断条件。这部分虚拟步进产生的数据会通过有效性掩码被同步标记为无效,以确保后续梯度计算不受污染。
系统在每个时间步实时统计全局终止率(已终止 clip 占全部 clip 的比例)。当全局终止率超过阈值,或达到最大时域时,系统才触发统一截断。这一机制带来两个关键效果:存活环境的长时域轨迹得以完整保留;全局重置频率大幅降低,时间效率比稳定维持 99.6% 以上。
整体算法流程分为采样阶段(Sample Stage)与训练阶段(Train Stage)两部分。采样阶段中,多个并行环境在 DPSA 机制下同步运行,已终止环境以虚拟续步维持同步直至全局截断触发;训练阶段中,收集到的样本经拼接后由 SMPO 机制进行掩码归一化处理,最终用于策略更新。
动态并行采样对齐:DPSA
DPSA(Dynamic Parallel Sampling Alignment)负责采样阶段的对齐工作。已终止的环境不再立即重置,而是以 dummy 数据虚拟续步,维持向量化 pipeline 的张量形状完整性;这部分虚拟步进产生的数据会通过有效性掩码被同步标记为无效。
当全局终止率超过阈值,或达到最大时域时,系统触发统一截断。这一机制带来两个直接收益:第一,存活环境的长时域轨迹得以完整保留——平均 episode 时长稳定在约 35 步,与顺序基线高度契合;第二,全局重置频率大幅降低,时间效率比稳定维持在 99.6% 以上——传统 SGR 在 30 clips 下重置频率趋于 1,时间效率比随之崩塌。
缩放掩码填充优化:SMPO
虚拟续步引入的 padding 转移若不加处理,会污染优势函数估计并扭曲策略梯度。此外,padding 样本密度随终止率和训练进度动态变化,若不归一化每轮更新步长将不稳定。
SMPO(Scaled Mask-Padding Optimization)的设计就是要在数学层面解决这个问题。SMPO 为每个时间步维护时域有效性掩码,并以实际有效转移总数对掩码损失归一化,构造如下目标函数:通过对新旧策略概率比、估计的优势函数值、裁剪超参数的组合做归一化,SMPO 确保 padding 数据对策略更新毫无影响,训练行为与没有 padding 时完全一致。
这一机制的工程价值在于:on-policy 分布对齐得到严格保证。后续实验的 14 项闭环驾驶指标 95% 置信区间完美覆盖零点,从统计学层面证明 SMPO 实现了真正的策略性能零损失。
四、实验验证:更快、更稳、性能无损
实验在配备 8 块 NVIDIA H20 GPU 的高性能节点上展开,使用滴滴真实接管场景数据集。该数据集专门收录需要人工干预的高难度场景,episode 时长极度异构,完美复现 Straggler Effect 的最坏情况。在 5~30 clips 的各种并行规模下,对 FAST 与 SGR(OpenAI)、VER(Georgia Institute of Technology)基线进行了多维度评估。
执行时间显著降低
针对不同规模的并行采样任务,FAST 框架展现出卓越的执行时间控制能力。在 10 clips 的并行设置下,FAST 的采样时间大幅缩减至 14.35 秒,相较于顺序基线(SC)的 84.67 秒降低了 83.0%,实现了 1.94 倍的整体训练加速,显著超越了同步基线 SGR-10(1.42 倍)和异步基线 VER-10(1.45 倍)。
相反,传统 SGR 算法的采样性能随并行规模扩大而严重退化,在 30 clips 设置下加速比剧烈跌至 0.88 倍——由于同步重置瓶颈反而慢于非并行基线。而 VER 受限于频繁数据获取的固有开销,同样无法超越 FAST。
有效吞吐量与样本质量同步提升
研究团队进一步通过有效吞吐量对计算效率进行了深入的机制层分析,该指标本质上由样本有效率和时间效率比共同制约。SGR 和 VER 虽然保持了 100% 的完美样本有效率,但高频环境重置导致时间效率比灾难性衰减;相比之下 FAST 展现出更健康的训练演进模式。
在训练初期虽然由于虚拟续步机制导致有效率较低,但随着训练推进,FAST 最终能稳定收敛至 93% 以上,确保了高数据质量。与此同时,得益于解耦环境管理,FAST 成功消除了环境频繁全局重置带来的硬件等待开销,在全配置下维持了超过 99.6% 的近乎完美的时间效率比。
轨迹时长与短时域偏置
为了探究效率提升对数据质量的深层影响,该研究对不同并行配置下仿真轨迹长度的统计分布进行了对比分析。传统 SGR 基线的平均 episode 时长随着并行规模的扩大而急剧下降——这种现象归咎于其僵化的同步机制,即任何单个环境的终止都会强制触发全局重置,不可避免地截断了其他并发环境中的活跃长轨迹。
相比之下,FAST 框架通过将重置触发与个体终止解耦,在各种 clips 配置下均能稳定维持在约 35 步的平均时长,与顺序基线高度契合,成功消除了短时域偏置并促进了更稳健的策略优化。智能体得以从完整的驾驶过程里学到关键的长尾行为,而不是只见过早截断的片段。
整体训练收敛速度更快
研究团队对以实际训练时间为横轴的策略收敛速率展开了可视化评估。FAST-10 模型表现出更加平滑且快速的初期跃升,在约 20 小时的真实训练耗时内就率先达到了稳定性能平台。相比之下,标准的 SC 基线需要超过 40 小时,而经过加速的变体 SGR-10 和 VER-10 则需要大约 30 小时才能实现收敛。
闭环驾驶指标与策略性能无损验证
为了严格验证并行加速机制不会引入任何策略性能的退化,实验对安全、舒适、合规、效率四大维度共 14 项核心闭环驾驶指标(包含碰撞程度、前车风险、安全边界、急刹、急加速、压实线、闯红灯、黄灯不当进入、车位泊入精度、横向避让精度、超速违章、车速效率、卡顿时间以及拉出距离偏差比)进行了 Jackknife 重采样分析。
结果表明,所有 14 项闭环驾驶指标在对比 FAST-10 与顺序基线时,其 95% 的置信区间均完美覆盖零点。这在统计学上完整且严格地证明了 FAST 框架在大幅提升并行训练速度的同时,未引入任何系统性的性能退化,实现了真正的策略性能零损失。
五、解耦为什么是一剂通用的解药
把视角拉高一些看,自动驾驶 RL 训练所面对的场景异构问题,并非自动驾驶独有。具身智能、机械臂操作、移动机器人、四足机器人在仿真训练中都会面对 episode 时长高度异构的难题——一条轨迹可能因为早期失败几秒就终止,另一条轨迹则持续到任务自然结束;两条轨迹都对应合法的训练样本,但放到同步并行框架里就要为早终止的那一条付出全局重置的代价。
FAST 给出的解法可以拆成两层:第一层是「让重置的频率由群体状态决定,而不是由个体状态决定」——只要群体的终止率没超过阈值,就不触发全局重置;第二层是「让虚拟续步的 padding 数据对训练完全无效」——通过 SMPO 的数学构造,把 padding 样本的影响从策略更新里彻底抹掉。两层合在一起,本质上把「同步性」与「数据真实性」这两个原本矛盾的需求拆开解决。
这套思路的工程可移植性很直接。任何 episode 时长异构的 on-policy RL 训练场景,都可以用 DPSA 替换原有同步重置逻辑,用 SMPO 处理 padding 数据,得到与自动驾驶场景下类似的吞吐提升与性能保证。换言之,FAST 的价值不只在于自动驾驶本身,而在于把「并行 on-policy RL」这道困扰业界多年的工程难题抽出来,给出了一个干净的、可推广的解法。
六、对产业研发节奏的真实影响
自动驾驶公司里负责训练平台的工程师,对「并行规模上不去」这件事的体感是最直接的。现有框架在 30 clips 下出现并行性能倒退,意味着公司花了大价钱采购的 GPU 集群实际上只能用到 5~10 clips 的并行规模,剩下的算力都被同步重置开销吃掉。FAST 把这一瓶颈抬到了 30 clips 仍有正向加速比,相当于在同等硬件投入下把有效算力翻了一倍,对应到训练时间上就是「20 小时 vs 30 小时」这一档量级的差距。
而对算法工程师来说,SMPO 给出的「on-policy 分布对齐严格保证」同样关键——它意味着团队不必担心「为了速度牺牲策略质量」这一长期困扰。当 14 项闭环驾驶指标的 95% 置信区间都能覆盖零点,算法团队就能放心地把训练规模拉上去,把省下的时间投入到更困难的 corner case 数据采集与策略迭代上,而不是反复验证「加速之后策略有没有退化」。
把这两层叠加起来看,FAST 对自动驾驶研发节奏的影响是结构性的。它把过去十年默认的「算力堆叠 + 同步重置 + 算法工程师手工验证性能」这一套工作流,替换成「算力堆叠 + 异步解耦重置 + 数学保证性能」的新工作流。当一项工作流的核心瓶颈从算力转移到系统设计,研发组织的重心也会随之迁移——这或许是 FAST 给整个行业留下的、更长远的影响。