你的自动驾驶模型,在考试里满分,上路就翻车
这种反差,是整个行业藏了好几年的脏秘密
开环训练,就像让一个学生反复看录像答题:录像里的行人不会因为你写错答案而停步,后车也不会因为你偏了半米而变道
模型拿满分,只是因为它猜中了"当时那个人类司机怎么开的"
可一旦把方向盘交到它手里,一切都变了,你偏了10厘米,下一秒摄像头看到的就是"偏了的世界";
你再按旧习惯操作,偏差叠加,轻微错误像雪球一样越滚越大,直到不可收拾
这就是自动驾驶文献里反复出现的误差累积(compounding errors)
而英伟达,刚刚把解决这个问题的工具箱,开源了


▲ NVIDIA亚太官方账号指出:开环训练抓不住误差如何滚雪球,AlpaGym把策略训练接到闭环仿真
"考场满分,上路翻车":一个价值万亿的bug
先把这个问题讲透。
想象你训练了一个端到端自动驾驶模型
你给它看了几千小时的真人驾驶录像,每一帧都标注了"此刻该加速还是刹车、方向盘转几度"
模型学得很好,在测试集上的误差小到几乎可以忽略
但问题来了:录像不会因为模型的动作而改变
这叫开环,环境是死的,模型的输出不会反馈回来
而真实世界是闭环的:你每踩一脚油门、每打一把方向,都会改写下一秒的传感器画面、周围车辆的反应、甚至红绿灯前排队的格局
NVIDIA研究组在综述论文《Beyond Behavior Cloning》中系统梳理了这个差距:行为克隆在时间上独立的样本上开环训练,却必须在动作影响未来观测的闭环中运行
结果就是协变量偏移,训练时见过的状态分布,和部署时模型自己制造出来的状态分布,根本对不上



▲ Alpamayo项目负责人Marco Pavone发布AlpaGym架构图:上半是仿真rollout生成,下半是策略训练,中间用gRPC、NCCL和Redis串联
用一位中文社区网友的话说,
"轻微错误滚雪球这点太真实了。"
AlpaGym:一块连接仿真与训练的"接线板"
2026年6月,NVIDIA研究负责人Marco Pavone在X上宣布:AlpaGym正式开源,Apache-2.0许可证,GitHub仓库NVlabs/alpagym
▲ AlpaGym GitHub仓库首页,README开篇即点明:让策略从闭环动作后果中学习
AlpaGym是一块精心设计的接线板,站在两个系统之上:
- AlpaSim(
NVlabs/alpasim):闭环自动驾驶仿真环境,负责场景渲染、传感器模拟、车辆动力学与交通流,它用神经重建(NuRec)技术,把真实行程数据变成可交互的3D场景,逼真度远超传统游戏引擎; - Cosmos-RL(
nvidia-cosmos/cosmos-rl):面向Physical AI的分布式强化学习基础设施,负责训练编排与权重同步。
AlpaGym做的事情,用最朴素的话说就是:让模型在仿真里"试驾",撞了墙扣分、顺利开过去加分,然后把这些经验写回训练,更新模型权重
如此反复,模型不再只是模仿人类司机,它开始从自己的错误中学习
技术上,默认算法是GRPO(Group Relative Policy Optimization),和大语言模型后训练里的RLHF一脉相承:同一个场景跑多次,用奖励差决定"往哪次开法靠拢"
入门级奖励函数progress_safety简单粗暴,沿路线前进 +1.0,碰撞 −10.0,冲出路面 −5.0,偏离参考轨迹 −0.01
鼓励往前开,重罚撞东西,次罚上路肩,轻微贴近老司机
从CES到GTC:Alpamayo帝国的版图
AlpaGym接续了NVIDIA更大的Alpamayo开放平台体系


▲ GTC Taipei上,NVIDIA正式介绍Alpamayo 2 Super,320亿参数的开放驾驶基础模型
时间线拉起来看:
CES 2026,Alpamayo作为开放推理驾驶栈首次亮相,推理VLA模型、Physical AI大规模数据集、AlpaSim闭环评测,三块积木搭起骨架
那时的定位还是"评测":模型在仿真里跑一跑,看看闭环表现怎么样
2026年5月底至6月初,GTC Taipei与Computex节点,平台迎来爆发式扩展:
- Alpamayo 2 Super:从~10B跳到~32B参数的多任务驾驶基础模型,360°环视、思维链推理、自动标注一应俱全;
- AlpaGym:把仿真从"考场"升级为"健身房",评分随即成为训练信号;
- OmniDreams:照片级场景生成,制造长尾corner case。


▲ NVIDIA DRIVE一次性公布四大组件:2 Super、AlpaGym、OmniDreams与开放数据工具
Hugging Face上的社区文章称,Alpamayo推理模型累计下载已超过40万次
这个数字说明:开放生态的飞轮已经转起来了
有人真跑通了吗?日本工程师的"云端账单"
理论再漂亮,不如看看有没有人在实验室外跑通
日本Classmethod旗下技术博客DevelopersIO给出了一份详尽的实操报告:他们在AWS的g6e.12xlarge实例上(4张L40S 48GB显卡,实际占用2张),从头跑通了AlpaGym的完整闭环
▲ 日本工程师在AWS上实测AlpaGym:烟雾测试10分钟跑通,10步短训半小时
关键数据:
- 烟雾测试约10分钟跑通"试驾→奖励→一步GRPO→权重同步"全链路;
- 10步短训练
- 单次10步运行磁盘消耗约百GB(含四路相机rollout录像与检查点);
- 无碰撞时奖励约0.6,碰撞时约−9,完美对应那个−10碰撞惩罚的设定。
作者非常诚实地写道:场景单一、步数过短,不能据此断言"模型已经开得更好",只能证明闭环RL信号链路是通的
但光是这一点,已经意味着:闭环强化学习不再是只有大厂基建组才能玩的游戏
当然,代价也很真实:Alpamayo 1.5的约11B参数模型需要**≥40GB显存的双卡,完整NuRec场景数据集约1.5TB**,CUDA/cuDNN版本冲突、首次拉镜像超时、磁盘被检查点迅速吃满……这些踩坑细节,才是"开源"和"实验室外可触达"之间的真实距离
闭环训练走进工程流水线
闭环训练早已存在。
学术界讨论误差累积和协变量偏移已经很多年,CARLA仿真器里的闭环实验更是发了无数篇论文
AlpaGym的核心差异在于工程集成度:
- 与可扩展仿真微服务(AlpaSim)和分布式RL(Cosmos-RL)预先焊好;
- 提供可运行的Hydra实验配置、奖励样例、检查点转换脚本与上手教程;
- 用挑战赛(AlpaSim闭环挑战赛、Physical AI推理挑战赛)把"开源"从代码可见推到结果可比。
▲ NVIDIA Developer Blog教程:从安装到定义奖励、启动训练、导出检查点的分步配方
一位中文社区用户看到开源消息后的反应,或许代表了更多人的心声:
"开源出来挺好,终于能少点纸上谈兵了。"
雪球还在滚,但方向变了
把视野拉远。
NVIDIA把LLM时代验证过的"SFT → RL后训练 → 压缩部署"流水线,整个搬到了自动驾驶基础模型上
AlpaGym负责其中"闭环RL"那一段的胶水和环境接口,Alpamayo Recipes仓库则提供从监督微调到量化的全套配方
当然,仿真再高保真,仍与真实道路有距离
Sim-to-real的鸿沟不会因为一个框架的开源而消失
AlpaGym的诚实定位是:在部署前把更多失败模式前置到可重复环境,并让奖励把安全与进度写进梯度
它不宣称取代百万公里真实路测,但它让"从错误中学习"这件事,第一次变成了一条可扩展、可复现、可共享的流水线
误差的雪球仍然在滚。
但现在,它终于滚在了一个可以被观察、被打分、被写进梯度的仿真世界里,更多失败有机会在驶上真实道路前被发现