你以为自动驾驶AI是这样训练的,把方向盘交给它,让它在路上摸爬滚打、从每一次失误中成长?
错。
绝大多数端到端自动驾驶模型的训练方式,可以想象成让一个从没碰过方向盘的学生,坐在教室里反复看老司机的行车记录仪,然后在试卷上勾选"此刻应该左转还是右转"
它答对了,你给它满分。
但试卷永远不会因为它答错而变成另一张卷
这就是行业里说的开环训练,模型的输出从不改变它下一秒看到的世界
它永远在一条"标准答案"铺好的轨道上滑行,永远不知道自己偏半米之后,整个世界会变成什么样
然后你把它放上真实的马路。
方向盘偏了一点,车道线的位置变了,后面的视觉输入全部偏离训练集,一个微小的错误,像滚雪球一样越滚越大,直到不可收拾
NVIDIA刚刚开源了一个东西,试图终结这场骗局
“让它撞”:AlpaGym的暴力美学


▲ NVIDIA亚太官方帖直言:开环训练无法捕捉轻微错误如何随时间"滚雪球"
2026年5月底,伴随Alpamayo 2 Super(320亿参数的开源推理型驾驶大模型)的高调亮相,NVIDIA悄悄把一个名叫AlpaGym的GitHub仓库推到了公众面前
它的逻辑简单到近乎粗暴:别再让AI看录像了,把方向盘交给它,让它在仿真世界里真的开,真的撞,真的冲出道路,然后把这些"物理后果"变成可以优化的学习信号



▲ 斯坦福教授、NVIDIA自动驾驶研究负责人Marco Pavone的开源声明:“监督学习可以模仿行为,但稳健的自主最终需要通过与环境交互来学习”
Pavone这句话值得反复读。
它精准地戳中了一个被行业回避多年的问题:模仿学习能教会模型"像人那样说和规划",但永远教不会它"偏了之后怎么救"
因为在开环数据里,车从来没偏过。
AlpaGym要做的,就是补上这后半段
三块积木搭起的"驾驶炼狱"
AlpaGym在三个系统之间充当胶水,把它们粘在一起:
第一块:AlpaSim,仿真世界。
一个开源的闭环自动驾驶仿真平台,支持高保真相机渲染、车辆动力学与交通场景
它可以接NuRec(把真实车队录像重建成可渲染的三维场景)和OmniDreams(用生成模型合成罕见长尾场景)
AlpaSim为AlpaGym提供可交互的"世界"
第二块:Cosmos-RL,训练引擎。
NVIDIA面向Physical AI的分布式强化学习框架,负责大规模rollout编排与梯度更新,相当于AlpaGym的"肌肉"
第三块:AlpaGym本身,粘合剂与规则书
它定义了策略如何与仿真器对话(每一tick,仿真器送来相机画面,策略返回轨迹,仿真器更新世界再送下一帧),如何给一整段驾驶打分(进度加分,碰撞扣10分,冲出道路重罚,舒适度微调),如何把分数变成梯度回传给模型
▲ NVlabs/alpagym 仓库页面:Apache-2.0开源,目前支持Alpamayo 1.5(约100亿参数)作为示例模型
一次完整的闭环训练是这样的:Host侧用Hydra合成配置 → 拉起AlpaSim仿真器 → 启动Cosmos-RL运行时 → 策略在仿真器里跑一段路(rollout)→ 系统对整段驾驶打分 → 梯度更新权重 → 把新权重同步回去 → 再跑,再撞,再学
它用的算法叫GRPO,同一个场景跑多次,按奖励差距调整偏好
如果你关注大模型后训练,这个名字应该不陌生:它和ChatGPT们用来对齐人类偏好的技术属于同一个家族
只不过,聊天模型的"错误后果"是文本偏好,而驾驶的错误后果是碰撞、冲出道路和乘客的尖叫
有人真的跑通了,代价不小
日本开发者媒体Classmethod(DevelopersIO)在AWS上用两张L40S 48GB显卡,按官方教程把AlpaGym跑了起来
▲ 日文开发者社区的实操文章:标题直译,“试着在AWS上玩了一下NVIDIA的自动驾驶强化学习基盘AlpaGym”
结果很真实,也很冷酷:
- 烟雾测试10分钟跑通,一轮完整的"试跑→奖励→梯度→权重同步"流水线确认可用
- 双卡VRAM各吃满约45GB
- 日志显示模型总参约111亿,但实际更新的只有约22.8亿(语言模型部分被冻结,只练视觉和动作头)
- 10步短训中,没撞车的步奖励约+0.6,一撞车直接跌到-9.3到-9.5,碰撞项权重-10带来的断崖式惩罚清晰可见
- 最扎心的一条:单次10步训练吃掉约117GB磁盘空间(检查点+多相机rollout录像),存储先于GPU爆炸
作者特意提醒:单场景10步绝不足以宣称"车开得更好了",只验证了流水线和学习信号确实存在
这条限定很重要,工程可演示,不等于统计显著的安全改进
AlpaGym背后:英伟达在下一盘更大的棋


▲ NVIDIA DRIVE介绍Alpamayo 2 Super与AlpaGym闭环强化学习能力
把镜头从AlpaGym拉远,你会看到NVIDIA正在搭建一条从车队日志到可训场景再到可优化策略的完整装配线:
- Alpamayo 2 Super:320亿参数的开源推理型VLA,支持7个以上摄像头、360°感知、思维链推理与自动标注,它是AlpaGym要训练的"大脑"
- OmniDreams / Cosmos-Dreams:生成式世界模型,用AI合成那些在真实路上一年碰不到一次、但在事故统计里致命的长尾场景
- NuRec:把真实车队录像重建为可渲染三维场景,让闭环训练不只跑在游戏引擎合成的世界里
- 公开挑战赛:CVPR 2026的闭环驾驶挑战与推理挑战,给整条流水线一个外部验收口
黄仁勋的原话大意是:Alpamayo让汽车在安全驾驶中具备推理能力
开源不等于平等:闭环训练的算力账单落在谁肩上?
这里有一个容易被忽略的产业结构问题
开环训练可以高度批量化,堆大batch、吞数据、一晚上刷完十万段录像
闭环训练天然更贵:每一步都要仿真渲染、策略推理、多相机记录、权重同步
双卡满血、每跑一轮上百GB磁盘,这是"开源"二字背后的真实账单
Cosmos-RL的Slurm预设、AlpaGym的多节点设计,都在暗示:目标用户主要是实验室与车企训练集群,普通笔记本电脑难以承受这类负载
谁能负担"让错误发生在仿真里"的算力成本,谁就更能把复合误差变成梯度;
负担不起的团队,可能仍停留在开环模仿加几轮闭环评测
开源带来了可见性与接口标准,算力门槛依然存在
从"做选择题"到"交方向盘"
回到开头的比喻。
过去十年,自动驾驶行业在开环指标上制造了大量幻觉,模型在日志上和专家轨迹比L2距离,分数越来越好看,但上了闭环仿真或实车就失稳
根因从未改变:训练时假设状态由专家产生,部署时状态由自己产生
你在别人的轨道上得了满分,但你从来没在自己的轨道上活过一秒
AlpaGym没有解决自动驾驶的全部问题
10步训练的奖励曲线不能外推为"车变聪明了";
仿真里学会的谨慎可能在真车上错误迁移;
策略也可能针对度量方式取巧,却没能提升驾驶安全
从闭环RL到量产部署之间,还隔着影子模式、功能安全认证与无数轮回归测试
但它做对了一件事:让错误回到模型。
错误从评测报告里的failure rate,变成了可以进入奖励函数、形成梯度并改变下一次转向的信号
这是一条从"看录像做选择题"到"把方向盘交给你,然后世界按你的操作播下去"的路
路很长。
但方向盘,终于交出去了。