你以为考了100分的AI司机,上路第一秒就开始跑偏
现实正是如此。整个自动驾驶行业花了数十亿美元训练出来的端到端大模型,很多都有同一个致命缺陷,它们从来没有亲自"开过车"它们只是在回放录像上一遍遍地背诵正确答案,就像一个从未摸过方向盘、却把科目一到科目四考题倒背如流的"理论学霸"
英伟达刚刚把这块遮羞布,当众撕了下来


▲ NVIDIA亚太官方账号直指问题核心:开环训练抓不住误差累积,AlpaGym将策略训练接入闭环仿真
一个价值万亿的"作弊":开环训练到底骗了谁?
先听一个比喻。
想象你在驾校,教练从不让你碰车。他放一段老司机的行车记录仪视频,暂停在某一帧问你:"这一秒,方向盘打几度?油门踩多深?"你答对了,满分。再来一帧,再答,再满分。一千万帧答完,教练宣布:恭喜你,毕业了
这就是开环训练(open-loop),行业里绝大多数端到端自动驾驶模型的培养方式模型的输出拿去和专家轨迹做对比,环境不会因为模型的动作而改变行人不会因为你虚拟的刹车而停步,后车不会因为你偏了半米而变道你永远看到的是那个固定的、安全的、已经发生过的世界
问题在于,真实世界是闭环的。
你方向盘多打了一度,下一秒车道线在画面里的位置就变了你刹车晚了0.3秒,前车的相对距离就在缩小模型一开始偏了10厘米,它看到的画面已经是"偏了的世界";它若继续按旧习惯开,偏差叠加、放大、失控
这就是自动驾驶文献里那个令人不寒而栗的术语,compounding errors,误差累积


▲ NVIDIA DRIVE直言:开环训练看不见模型动作之后的世界会怎样
英伟达的解法:把"考场"改造成"健身房"
NVIDIA的回答是AlpaGym,一套把仿真器从考场变成健身房的闭环强化学习框架



▲ 研究负责人Marco Pavone宣布AlpaGym开源,配图展示完整系统架构
逻辑说穿了很简单:别再只看录像了,让AI自己开 开到撞了,扣分;开到冲出路面,扣分;安全推进了一段,加分。然后把这些经历写回训练,更新权重,再开一轮周而复始。
但"简单"只是概念。工程上,这件事难到令人发指。
AlpaGym是一块接线板,负责衔接两个庞然大物:
- AlpaSim:闭环自动驾驶仿真环境,负责场景渲染、传感器模拟、车辆动力学与交通流,它生成那个"会因为你的动作而改变的世界";
- Cosmos-RL:面向物理AI的分布式强化学习引擎,扛住多GPU并行训练的算力编排。
▲ AlpaSim:为端到端自动驾驶策略研发与测试设计的开源仿真平台
每一轮训练是这样转的:Rollout Worker从AlpaSim拉取场景,把相机画面、自车状态、路线规划经gRPC喂给驾驶策略;策略输出轨迹;仿真推进;环境变了,再来一帧。跑完一整段驾驶后,系统用奖励函数打分,再由Policy Trainer执行梯度更新,权重经NCCL同步回去默认算法是GRPO,没错,就是大语言模型RLHF里那套"同一道题做多次、往高分答案靠拢"的路子,被移植到了方向盘上
奖励的设计堪称粗暴而有效:沿路线推进 × 1.0,碰撞 × −10,冲出路面 × −5,偏离参考轨迹 × −0.01翻译成人话,撞一次,等于白开十段好路
日本工程师的"踩坑实录":双卡烧了半小时,终于看到AI被撞醒了
纸上得来终觉浅。日本Classmethod旗下DevelopersIO的一位工程师,真的在AWS上把这套管线跑通了
▲ 日本工程师在AWS双L40S上完成AlpaGym烟雾测试与10步短训
他用的是g6e.12xlarge实例,四张L40S 48GB显卡占了两张:一张跑策略训练,一张跑rollout仿真烟雾测试10分钟跑通,从试驾到奖励到一步GRPO到权重同步,整条链路亮灯10步短训约半小时。
最有说服力的数字来了:无碰撞时奖励约0.6,碰撞时奖励直接掉到约−9,和配置里−10的碰撞惩罚完全吻合AI确实被"撞醒"了:梯度知道它撞了,权重知道往哪个方向更新
但这位工程师也诚实地写道:场景单一、步数过短,不能断言模型已经开得更好,只能证明闭环RL的信号链路是通的他留下的更接地气的信息是运维账单:检查点与多相机录像,单次短跑就吃掉百GB磁盘;宿主CUDA与PyTorch编译CUDA的版本冲突,是真实存在的"依赖地狱"
更大的棋盘:Alpamayo的"推理式自动驾驶"野心
AlpaGym被纳入NVIDIA更大的Alpamayo开放平台
▲ Alpamayo平台全景:开放VLA模型 + 仿真框架 + RL基础设施 + Physical AI数据集
时间线可以这样捋:CES 2026,Alpamayo作为开放推理驾驶栈亮相,带来Alpamayo 1推理VLA、Physical AI大规模数据集与AlpaSim仿真器到了2026年6月GTC期间,平台一口气扩展出三大块,
- Alpamayo 2 Super:32B参数的多任务驾驶基础模型,支持7+相机360°环视、思维链推理与自动标注;
- AlpaGym
- OmniDreams


▲ 32B参数、360°感知、思维链推理,Alpamayo 2 Super与AlpaGym同台亮相
一条韩语转引帖甚至直接下了判断:"考虑到FSD v14展示的性能,在成本至上的汽车/robotaxi市场,激光雷达恐怕很快就会从市场消失" 这属于外围产业观点,但它折射出社区的真实情绪,纯视觉+推理的路线正在硬化
▲ 韩国博主复述技术要点后,顺带给出对纯视觉路线与成本结构的判断
闭环训练由来已久,AlpaGym补上工程管线
闭环训练这个概念,学术界讨论了很多年 NVIDIA自己的研究组就发过一篇综述《Beyond Behavior Cloning in Autonomous Driving》,把闭环训练拆成三根轴,自车动作如何生成、环境如何回应、训练目标是什么,系统整理了整个分类学
▲ NVIDIA研究组综述与AlpaGym核心贡献者高度重叠,框架与研究议程同根同源
AlpaGym的差异化来自一整条已经焊好的可运行管线:开放推理VLA(Alpamayo)+ 可扩展仿真微服务(AlpaSim)+ 分布式RL引擎(Cosmos-RL)+ 可配置奖励 + Hydra实验管理 + 检查点转换 + 挑战赛基准Apache-2.0许可。
写在最后:雪球已经开始滚了
AlpaGym仍处于早期开发阶段当前示例只支持Alpamayo 1.5(约10B参数),双高显存GPU的硬件门槛把大量个人研究者挡在门外,仿真再高保真也存在sim-to-real的鸿沟README写得很坦诚:工作重心在吞吐、扩展,以及支持更多模型和训练算法
但方向已经不可逆了。
当整个行业花了几年时间在开环考试上"刷题",AlpaGym第一次把钥匙交给了AI,让它在虚拟世界里撞墙、冲出路面、学会害怕,然后带着这份记忆,回到训练循环轻微错误不再被静态数据集温柔地掩盖,而是在仿真的闭环里滚成雪球,逼着梯度去正视它
考试满分的时代,该结束了。