你的自动驾驶AI,考试全对,上路全废
整个行业都明白这种尴尬。
方向盘偏了半度,摄像头看到的世界就变了;
变了之后模型继续错,错了世界继续变
轻微失误像滚雪球一样越滚越大,直到撞上护栏的那一帧,模型还以为自己在"正确答案"的轨道上
NVIDIA刚刚把解决这个问题的工具,连代码带框架一起扔到了GitHub上


▲ NVIDIA亚太官方账号一针见血:开环训练根本抓不住"小错误随时间复合"的致命链条
开环训练的"选择题幻觉"
先搞清楚一件事:今天绝大多数自动驾驶模型的训练方式,本质上是看录像做选择题
给模型一段已经录好的真实路况视频,问它:"下一秒你打多少方向盘、踩多少油门?"
然后把它的答案和人类老司机的真实操作做对比,答对了加分,答错了扣分
这叫开环训练(open-loop),模型的回答不会改变接下来播放的画面
它永远在一条"标准答案"铺好的轨道上答题
问题在哪?
试卷不会因为你写错而变成另一张卷,但真实的马路会
你方向盘多打了两度,车偏了半米,于是下一帧摄像头看到的车道线位置、前车角度、路牙距离,全都跟训练集里那帧"正确画面"不一样了
模型从没见过这个偏移后的世界,它的下一个决策只会在错误的基础上继续错下去
业内管这叫协变量偏移(covariance shift),翻译成人话就是:一旦你偏了,你就永远回不到训练时见过的"标准世界"了
过去十年,自动驾驶的感知榜单越刷越好看,可实际部署的系统却反复在"简单场景"里翻车
温差从何而来?
很大程度上,就是这个"选择题满分、真考全废"的错位
AlpaGym:把方向盘真的交给AI,然后让世界"按它的操作播下去"
NVIDIA的答案叫AlpaGym,一个开源的闭环强化学习训练框架,Apache-2.0协议,代码仓库就在NVlabs/alpagym
AlpaGym把训练方式翻了过来:让AI在仿真环境里亲自"开"
在AlpaGym的训练循环里,模型每做一次转向、刹车、变道的决策,仿真器AlpaSim就会根据物理引擎更新整个世界的状态,车偏了,画面就真的变了;
刹晚了,前车距离就真的缩了;
压线了,下一秒就要面对完全不同的交通博弈
然后系统对整段驾驶打分:前进了给正分,保持车道给正分,撞了扣10分,冲出道路扣大分,坐着不舒服也扣分
这些分数变成梯度信号,直接更新模型参数
错误的后果不再停留在评测报告的某一行failure rate里,而是真真切切地流进了模型的"神经突触"
▲ AlpaGym开源仓库:早期但活跃开发,当前支持约100亿参数的Alpamayo 1.5模型
一条"从考试到实战"的装配线
AlpaGym站在两套系统的肩膀上:
AlpaSim,提供闭环仿真环境。
可插拔渲染后端,能接神经重建(NuRec)的高保真相机,也能接生成式世界模型(OmniDreams)合成罕见极端场景
它为AlpaGym提供了一个允许AI犯错的"世界"
Cosmos-RL,提供分布式rollout与训练编排
AlpaGym不重复造轮子,它只做驾驶域的"胶水层":把仿真器、训练引擎和驾驶策略粘在一起,并尽量保持接口可替换
▲ AlpaSim:开源AV仿真平台,AlpaGym的"物理世界"基座
同期发布的还有Alpamayo 2 Super,一个约320亿参数的开源推理型视觉-语言-动作(VLA)模型,支持7路以上摄像头360°感知、思维链推理和自动标注
NVIDIA DRIVE的帖子把它的能力清单列得明明白白:


▲ Alpamayo 2 Super:32B参数、360°感知、思维链推理,再用AlpaGym做闭环精修
黄仁勋在发布会上的表述大意是:Alpamayo让汽车在驾驶过程中加入推理能力
开放模型、仿真、真实世界数据与agent skills,是为了让全球Robotaxi生态能理解边角案例、解释决策并规模化
有人真跑了:双卡L40S,10步训练,117GB磁盘
说得再好听,能不能跑通?
日本Classmethod团队在AWS上用双卡L40S(48GB×2)给出了第一份"第三方体检报告":
- 烟雾测试
- 模型总参约111亿,实际更新的只有约22.8亿(语言模型部分冻结,只训动作头)
- 算法用的是GRPO,和大语言模型RLHF/偏好优化同一家族
- 无碰撞时奖励约+0.6,一旦撞了直接-9.3到-9.5(collision项权重-10,毫不留情)
- 磁盘杀手:单次10步训练就吃掉约117GB(检查点+多相机rollout录像)
▲ 日本开发者在AWS上实测AlpaGym:坑包括CUDA版本错配、首跑镜像超时、异常进程抢显存
作者特别强调:单场景10步绝对不能说明"车开得更好了",只能证明流水线跑通了、学习信号可见了
这条边界提醒很重要:工程可演示,≠ 统计显著的安全改进
▲ 话题从发布会走进可复现的工程社区
闭环训练的代价:便宜的梯度,一夜变贵
开环训练可以疯狂堆batch,一晚刷完十万段录像
闭环?
每一帧都要仿真、渲染、推理、记录,还要把rollout与学习流水线并行
双卡近满血、单run上百GB磁盘、权重同步数GB级,开源不等于"笔记本可玩"
由此出现一个冷酷的产业现实:谁能负担"让错误在仿真里发生"的账单,谁就更能把复合误差变成梯度
负担不起的团队,可能永远停留在"看录像做选择题"的阶段
这才是起跑线
需要明确:仿真里碰撞扣10分,不等于真车上的安全认证
把碰撞写成标量便于优化器下降,但认证机构要的是危害分析、运行设计域、监控与降级策略
AlpaGym的产物仍然需要再进入评测套件、影子模式与实车验证
还有一个幽灵般的风险叫奖励黑客(reward hacking),模型可能学会在仿真度量上取巧,比如用不合人类习惯但低碰撞代理的诡异轨迹
所以成熟团队的流水线里,奖励设计、多指标仪表盘、开环与闭环双重回归,一个都不能少
▲ NVIDIA官方教程四步走:安装配置→定义奖励→启动训练→导出检查点
但方向已经不可逆了。
从"看录像答题"到"亲自上手犯错再改", 自动驾驶与整个Physical AI都在转向同一套底层逻辑
人形机器人、机械臂、无人机……所有需要在物理世界中承受动作后果的智能体,都面对同一个问题:模仿给起点,交互给校准
NVIDIA把这张牌打成了开源。
牌桌上的每一个玩家,现在都得重新算一笔账:
你的AI,到底是在"考试",还是在"开车"?