自动驾驶这几年,最拧巴的一件事,其实就卡在“最后10厘米”。
模型在训练集里看了1727小时路况、学会了怎么像人一样打方向、踩刹车,开环榜单成绩也能刷得很好看。可一旦真进闭环,自己打出去的那一把方向会改写下一秒画面,很多模型立刻就不那么从容了。说白了,过去大量端到端自动驾驶训练,本质上都像在做开卷题——看录像、猜动作、对答案,但答案不会因为你猜错而变。
这次英伟达开源的 AlpaGym,补的就是这道缝。
它不是又一个单独的模型,而是一块“接线板”。前面接 AlpaSim 高保真闭环仿真器,后面接 Cosmos-RL 分布式强化学习基础设施,中间再塞进像 Alpamayo 1.5 这样的端到端驾驶模型,让它在仿真里自己开、自己犯错、自己吃惩罚、再自己改。这个思路我个人特别吃,因为它终于不是“看别人开车学样子”,而是“自己上路学后果”。
这一步很关键。
英伟达官方给的逻辑很直白:沿路线前进给正奖励,撞了大概就是重罚,冲出路面也扣分。你别小看这种简单粗暴的奖励设计,它的价值恰恰在于把“别撞”从一句口号,直接写进训练目标里。过去开环训练最怕 compounding errors,也就是误差累积——第一次偏10厘米,下一帧世界就变了;模型没见过这个世界,就容易继续偏,最后雪球越滚越大。AlpaGym就是专门拿闭环仿真去揪这种问题。
更有意思的是,它不是纸上谈兵。NVLabs 的 alpagym 仓库已经挂在 GitHub 上,Apache-2.0 许可证,项目状态也写得很坦诚:早期但活跃开发中。目前示例主要围绕 Alpamayo 1.5 跑,重心还在吞吐和更多模型适配上。这个态度我反而更信,工具刚放出来就把边界讲清楚,比一上来喊“通杀行业”靠谱得多。
再看平台本身,英伟达今年在自动驾驶这条线,节奏其实很完整。1月 CES 先把 Alpamayo 1 体系端出来,带着开放模型、开放数据集和 AlpaSim 入场;到 5 月底、6 月初,又把 Alpamayo 2 Super 往上抬。官方现在给到的版本里,Alpamayo 2 Super 已经是 34B 级别的推理型 VLA,支持多相机、360感知、推理链能力和自动标注。这个味道很明显:就是把大模型那套“预训练—微调—后训练—部署”的路径,完整搬进自动驾驶。
而 AlpaGym,正是这条链路里最贵、也最难补的一环。
为什么说贵?因为闭环 RL 不是只算 loss 就完了,它每走一步都要渲染世界、生成反馈、再把奖励写回去。日本 Classmethod 旗下 DevelopersIO 前几天就在 AWS 上实操了一遍,用两块 L40S,10分钟烟雾测试打通整个链路,奖励信号能正常跑,撞车时分数也会明显掉到接近惩罚值。这说明什么?说明它不是“看起来很美”的 PPT 方案,而是真能启动、真能迭代的训练底座。
当然,话也得说满一点:这不等于自动驾驶从此无敌。仿真到现实之间还有 sim-to-real gap,NuRec 能把真实街景重建得很像,但其他交通参与者是不是足够像真人,依然是开放问题。再加上数据集、显存、存储、训练时长都很吃资源,这套东西短期仍然更适合研究团队、车企算法组和高阶自动驾驶玩家,不是普通开发者一台卡就能轻松上车的玩具。
但我依旧觉得,这条路走对了。
因为它第一次把“模型要为自己动作负责”这件事,做成了一套公开、可复现、可比较的基础设施。以前这套活,基本只有大厂基建组能玩;现在至少有了统一入口、统一接口、统一挑战赛和排行榜。行业终于能在同一张桌子上比算法、比奖励、比策略,而不是各家关起门来各修各的车。
如果你是关注自动驾驶技术栈的人,这个开源项目值得盯紧;如果你是做端到端驾驶、仿真、强化学习的人,它更像一条已经铺好的跑道。至于期待“明天就能落地满街跑”的朋友,可以再等等。AlpaGym的意义,不是终点已到,而是起跑线终于像样了。
自动驾驶要学会的,不只是怎么开,更是怎么为后果买单。
⚠️ 文中信息整理自网络公开渠道,参数与进展可能会有变动,最终还是以官方发布和实际情况为准。