8月4号深夜,老黄在X上连发了三条推。
前两条是常规操作,第三条直接把智驾圈炸了——英伟达正式开源Alpamayo 2 Super,一个34B参数的视觉-语言-动作(VLA)大模型,面向自动驾驶,商用免费。
注意,不是"研究用",不是"申请制",是直接商用。

这个模型有多猛?先上几个硬数据。
LingoQA第一,干翻了GPT-4o和Gemini 2.5 Pro
LingoQA是自动驾驶领域最权威的推理能力基准测试。Alpamayo 2 Super在上面拿了79.2分,近40个参评模型里排第一。
什么概念?它比通义的Qwen2.5-VL 72B高了17分,比Google的Gemini 2.5 Pro高了15.1分,比OpenAI的GPT-4o高了23.2分。
而且不只是LingoQA——英伟达说,在他们内部评测的所有自动驾驶基准上,Alpamayo 2 Super都是第一。
当然,这是英伟达自己测的数据,独立验证还需要时间。但一个开源模型能在自家基准上全面碾压闭源巨头,这件事本身就够有冲击力了。


34B参数,不是"看见",是"想清楚再动"
先说架构。Alpamayo 2 Super由两部分组成:
32B参数的VLM骨干网络:基于英伟达自己的Cosmos 3 Super Reasoner,经过强化学习后训练
2.3B参数的扩散动作解码器:负责生成具体的驾驶动作
34B参数,是上一代Alpamayo 1和1.5(都是10B参数)的3倍多。更大的参数量意味着更强的泛化能力——尤其是在那些罕见的、多车交互的复杂长尾场景下。
但更关键的不是参数大,而是它的输出方式。
传统自动驾驶模型的逻辑是:看到障碍物 → 输出方向盘角度和刹车力度。像个条件反射。
Alpamayo 2 Super不一样——它每次决策同时输出5样东西:
行驶轨迹:未来6.4秒的64个路径点
因果推理链(CoC) :用自然语言解释"我为什么这么开"
元动作:比如"让行""变道""停车"这种高层意图
推理自动标签:给训练数据自动打上CoC标注
带2D定位的视觉问答:能把回答对应到摄像头画面的具体区域
第2点和第3点是最有意思的。它不只是给你一个动作结果,而是告诉你"为什么"——前方有施工锥桶,我判断需要减速绕行,所以选择变道。
这就是老黄说的"不是看见,是想清楚再动"。

开源商用的含金量
这才是真正的杀手锏。
Alpamayo 2 Super用的是OpenMDW-1.1协议——Linux基金会专门为AI模型设计的宽松开源协议。允许微调、衍生模型、商业再分发,不需要任何额外授权。源代码则是Apache 2.0。
权重放在Hugging Face上,推理代码放在GitHub上,谁都能下载。
行业里有人把这叫做自动驾驶的"安卓时刻"。逻辑是这样的:当年安卓开源,让无数没有能力自研操作系统的手机厂商直接入局,智能手机生态因此爆发。现在Alpamayo 2 Super开源,意味着中小车企不用再砸几十亿从零训练智驾大模型——直接拿来微调,结合自身场景就能上车。
比亚迪、吉利、日产、五十铃、奔驰、Uber、Lucid都已经加入了英伟达的Hyperion+Alpamayo联合开发阵营。
当然,也有泼冷水的。Waymo和特斯拉走的是全栈自研路线,手握大量真实车队数据,不会靠一个开源模型就放弃自己的技术栈。而且开源模型只是一块"基座"——要真正量产上车,还需要大量车辆适配、传感器标定、安全验证的工作。
但对那些"自研做不起、外购用不起"的中小车企来说,这确实是目前最好的选择。

标注成本从"数月"压缩到"数天"
除了规划决策能力,Alpamayo 2 Super还有一个很实用的功能:自动标注。
自动驾驶行业目前训练模型时,大量依赖人工标注2D/3D数据——这玩意儿又贵又慢。Alpamayo 2 Super可以利用自己的推理能力,批量对路采数据进行自动标注,生成带因果推理链的结构化标签。
英伟达给出的数据是:原来几个月的标注周期,现在几天就能搞定。
这对车企来说不只是省钱——是直接把数据工程的瓶颈干掉了。
而且它还支持"教师-学生"蒸馏架构:34B的大模型当老师,蒸馏出小模型跑在车载DRIVE AGX Thor平台上。云端训练、车端推理,一套完整的工作流。

不只是模型,是一整个生态
Alpamayo 2 Super不是孤零零一个模型。英伟达围绕它搭了一整套生态:
AlpaSim:闭环仿真工具
AlpaGym:高吞吐强化学习环境
Physical AI Open Datasets:开放训练数据集(约11.5万小时多摄像头驾驶视频、370万条CoC推理链、超10亿张图像)
Halos:安全验证工作流,对接ISO/PAS 8800标准
截至发布时,Alpamayo全系在Hugging Face上的下载量已经超过50万次。

巧了,同一天还有两件事
8月4号这天,不只是英伟达在搞事。
同一天,华为乾崑智驾发布了ADS Pro V5.0,首次把智驾能力推进到了停车场——园区NCA覆盖超过100万个停车场。
也是同一天,工信部正式获批了L3/L4级自动驾驶强制性国家标准(GB 44721—2026),计划2027年7月1日起实施。
三件事凑在同一天:开源大模型降低门槛、场景落地最后一公里、法规框架成型。
有媒体说这是智驾行业的"三重拐点"。我觉得这个说法不算夸张。
模型权重(OpenMDW-1.1 许可) :https://huggingface.co/nvidia/Alpamayo2-Super

推理代码(Apache 2.0 许可) :https://github.com/NVlabs/alpamayo2

生态工具:
Alpamayo Recipes(微调/量化/部署食谱):https://github.com/NVlabs/alpamayo-recipes

AlpaSim(闭环仿真平台):https://github.com/NVlabs/alpasim

往期精选
扔一本书进去,它就给你一个可以随时调用的skill!又是一个神级skill:book-to-skill!
终端里功能最全的AI编程Agent!2.1万星,17000+提交,60+模型提供商,31个内置工具,14个LSP操作,28个DAP调试操作!
腾讯云团队级 Agent 记忆中心:TencentDB-Agent-Memory!让经验跨 Agent 流通!
Dorsey 又搞事:Slack+GitHub 被一个开源项目干翻了,Agent 直接当队友用!
追踪AI前沿,深挖GitHub宝藏。
用优质内容陪你成长,
点击关注,携手启航。