方向盘偏了0.1度,十秒后车已经骑上了马路牙子,这堪称全球自动驾驶行业最昂贵的bug
几乎所有端到端自动驾驶模型,都在犯同一个致命错误:它们在"回放录像"上训练得近乎完美,却在握住方向盘的那一刻开始崩塌英伟达终于把这层窗户纸捅破了,不仅捅破,还递上了一把扳手
它叫AlpaGym。一个让AI在虚拟世界里"撞墙、冲出路面、追尾",然后从自己闯的祸里学会开车的开源强化学习框架


▲ NVIDIA亚太官方账号点出核心:开环训练抓不住轻微误差的累积效应
一场"开卷考试"骗了整个行业
先说一个反直觉的事实:自动驾驶模型的"考试成绩"和"上路表现"之间,可能毫无关系
行业管这叫开环训练(open-loop)想象你坐在教室里看一段行车记录仪录像,考官按暂停问你:"此刻该左转还是刹车?"你的答案和真人司机越接近,分就越高听起来很合理对吧?
问题在于,录像不会因为你的回答而改变你说"猛打方向盘",画面里的行人不会因此闪避,后车不会因此急刹你答错了,世界纹丝不动,下一题照常出
但真实道路是闭环的。 你一拧方向盘,整个世界都跟着变。偏了10厘米?下一秒你的摄像头看到的就是一个"歪了的世界"如果模型继续按"正常世界"的经验开,偏差就会像滚雪球一样越滚越大,学术界叫它compounding errors(误差累积)
英伟达自己的研究团队在一篇综述里把话说得更狠:行为克隆在时间上独立的样本上开环训练,却必须在动作影响未来观测的闭环中运行训练分布和部署分布对不上,构成了结构性缺陷
英伟达的解法:把"考场"改造成"健身房"
AlpaGym的名字里藏着答案,Gym,健身房它让模型真刀真枪地开,撞了墙就扣分,安全通过就加分,然后从这些亲身经历里更新自己的驾驶策略



▲ AlpaGym核心架构:上层AlpaSim做仿真试驾,中层Rollout Worker收集经验,下层Policy Trainer更新策略,一条完整的"撞墙→反思→进步"闭环
具体怎么运转?AlpaGym本身是一块精密的接线板,架在两个系统之间:
第一根线接向AlpaSim,英伟达的闭环自动驾驶仿真器它用神经重建技术把真实道路场景"复活"成可交互的虚拟世界AI的每一次转向、刹车、变道,都会实时改写下一帧的摄像头画面和周围车辆反应场景由真实行车数据重建,达到照片级质感
第二根线接向Cosmos-RL,英伟达的分布式强化学习基础设施当AI在仿真里跑完一段驾驶后,这套系统负责把试驾经历变成可训练的梯度,用GRPO算法(和ChatGPT后训练同源的策略优化方法)更新模型权重
奖励函数朴素得令人发笑:安全往前开就给分,撞了扣10分,冲出路面扣5分就这么简单粗暴。但正是这种简单,让整个系统可以规模化运转,先跑通信号链路,再精雕细琢
32B参数的"推理式司机",开环训练喂不饱了
AlpaGym并非凭空冒出来。它是英伟达Alpamayo开放平台的一块关键拼图
2026年初CES上,Alpamayo首次亮相,带着推理VLA模型(视觉,语言,动作三合一)、大规模多传感器数据集和AlpaSim仿真器到了5月底,平台迎来重磅升级:
- Alpamayo 2 Super:从约10B参数暴涨到32B,支持360°环视、元动作、思维链推理和自动标注
- AlpaGym
- OmniDreams


▲ NVIDIA DRIVE的总结:32B参数模型+闭环RL训练="模型在仿真里从自己的错误中学习"
这条产品逻辑可以概括为:模型越大、推理能力越强,就越需要闭环训练来暴露它在开环里藏住的毛病 一个会"思考"的32B驾驶模型,如果只用行为克隆训练,就像一个智商极高但从没上过路的学生,理论满分,实操灾难
有人真跑通了:双卡GPU,10分钟见"车祸"
日本技术社区DevelopersIO的工程师在AWS上用两张L40S显卡,真把AlpaGym跑了起来
▲ 日本工程师的AWS实操:烟雾测试约10分钟,碰撞时奖励约-9,无碰撞时约0.6,与理论完全吻合
他们的发现极具现场感:
- 烟雾测试10分钟跑通:试驾→打分→一步GRPO更新→权重同步,信号链路完整
- 碰撞时奖励约-9,无碰撞时约0.6,和那个"撞了扣10分"的设定严丝合缝
- 单次10步训练,磁盘消耗约上百GB(检查点+四路摄像头录像)
- 11B参数中只有约2.28B被更新,语言模型骨干冻结,相当于在"冻结大脑上微调驾驶直觉"
但这位工程师也诚实地写道:场景单一、步数太短,绝不能据此断言"模型已经开得更好"他只是证明了一件事,从仿真车祸到梯度更新的完整闭环,确实跑通了
开源≠免费午餐:门槛依然很高
别急着欢呼。AlpaGym代码虽然是Apache-2.0许可,但硬件门槛毫不客气:
- 依赖链包括CUDA/cuDNN版本冲突、Hugging Face鉴权、容器镜像拉取超时……
▲ GitHub仓库首页:Apache-2.0许可,但README第一句就写明,"项目处于早期但活跃开发阶段"
换句话说,这套实验床面向有GPU集群的研究团队和企业,离"下载即用"还有距离英伟达的策略是:用开源降低"只有大厂基建组才能玩闭环RL"的门槛,同时用挑战赛和公开排行榜把行业标准握在自己手里
一个旧问题的新答案
闭环训练由来已久。学术界讨论"开环好看、闭环翻车"已经讨论了好几年AlpaGym的差异在于:它交付了一条可以跑通的流水线
推理VLA模型(Alpamayo)负责思考和决策,高保真仿真器(AlpaSim)负责制造后果,分布式训练框架(Cosmos-RL)负责把后果变成进步,AlpaGym负责把这三者焊在一起
而且,这条流水线已经被第三方、在云端、用商用硬件验证过了
训练时不负责后果,部署时必须负责后果,这是自动驾驶学习里一个古老的裂缝英伟达现在递出的这块补丁,至少把"从车祸中学习"从论文概念推进到了可运行的系统
至于AI什么时候能学会在雨夜里避开突然窜出的行人,那是下一个雪球要滚的方向了