三年前,一颗英伟达Orin-X芯片的254 TOPS算力还是衡量一款车能否跻身高阶智驾第一梯队的硬指标,那时候谁家新车用上双Orin,宣传稿里一定会将总算力超过500 TOPS(双芯片冗余方案)加粗标红。
到了2026年年中,算力竞赛又来到了另一个维度,理想汽车的马赫M100芯片直接做到了1280 TOPS,蔚来的神玑NX9031也超过了1000TOPS,黑芝麻的A2000X同样达到1000TOPS,而特斯拉的AI 5芯片更是逼近2500TOPS。
如果看一些车企的系统级方案,数字就更夸张了,理想双芯组合能到2560 TOPS,比亚迪三芯方案超过2100 TOPS,小鹏的四芯方案甚至堆到了3000 TOPS。在智驾最前沿交流群讨论的内容中,算力也是非常火热的一个方向,感兴趣的小伙伴也可以一起来聊聊。
从这个趋势来看,智驾领域的算力竞赛还在加速,而且越跑越快,但一直关注这个行业的小伙伴可能会发现,车企和芯片公司的关注点已经在悄悄转移。根据2026年3月的统计,英伟达在中国乘用车智驾域控SoC市场的占有率已经从此前长期超过50%下降到了39.4%,而本土供应商的份额合计上升到了25.1%。
这一数据的变化,并不是说明国产替代了进口,其背后反映的是车企选芯片的逻辑变了,以前大家首先看的是峰值TOPS够不够大,现在更多人在问这颗芯片在真实跑模型的时候到底能发挥出多少算力?它的功耗是多少?跟算法框架是否匹配?供货能不能保证?
换句话说,当单颗芯片已经迈过1000 TOPS这道门槛之后,再往上堆数字所带来的实际收益正在快速递减,行业里越来越多人意识到,算力竞赛的下半场已经不能再用谁的纸面数字更大来定输赢了。
01
标称算力和有效算力之间,差了一整套架构设计?
在聊算力的竞赛逻辑前,得先厘清一个事实,那就是芯片厂商宣传的TOPS数值,几乎都是理论峰值。这个数值是在特定精度(比如INT8)下、所有计算单元满负荷运转,并且没有任何数据搬运等待的理想状态下测出来的。
但在真实的自动驾驶场景中,遇到的情况会复杂得多,传感器数据会源源不断地涌入,神经网络模型层层推进,中间涉及大量的数据读写、缓存命中、任务调度和同步开销。实际能跑出来的算力,可能只有标称值的百分之六七十,有些甚至更低。
以英伟达的Thor芯片为例,其最早发布时宣称最高可达2000 TOPS,但实际交付给车企的Thor-U版本只有700 TOPS。同一个芯片系列,宣传数字和实际可用数字之间差了三倍。而车企开始密集自研芯片,一个很重要的原因也是他们希望掌控从算法到编译再到硬件调度的全链路,从而将理论算力真正转化成可感知的性能提升。
图片源自:网络
理想的马赫M100就采用了一种叫作动态数据流的架构,该架构跟传统的指令队列驱动模式完全不同。传统架构下,计算单元要等指令来了才开始干活,数据要在内存和计算单元之间来回搬运,这中间浪费了大量的时钟周期。而动态数据流架构让数据本身带着计算任务在芯片内部的网络里流动,哪里有空闲的计算资源,数据就自动流过去处理,几乎不需要额外的调度开销。
这个设计的相关论文已经被ISCA 2026收录,说明它确实在学术层面得到了认可,理想宣称这颗芯片的运行效率能突破82%,如果属实,那同样标称1000 TOPS的情况下,它的实际输出要比传统架构高出不少。
黑芝麻的A2000系列走的也是类似的路子,它的九韶NPU采用了物理层面上的Unique AI运算设计,多个计算核之间不需要像传统多核架构那样做核间同步,这样就能避免因为等待同步信号而产生的空闲浪费。
小鹏在图灵芯片的宣传上也特别强调了有效算力这个概念,他们说单颗图灵芯片的有效算力大约相当于10颗Orin-X,这个数字不知道是否存在营销成分,但它传达的核心信息是明确的,那就是业界正在把注意力从单纯的峰值TOPS转向算力利用率。
接下来几年,衡量一颗智驾芯片好不好的标准,恐怕不再是多少TOPS,而是在典型工况下能稳定输出多少有效TOPS。
02
功耗和成本正在成为新的紧箍咒?
如果仅是将算力利用率提上去,那问题还不算太复杂,但关键是,每一瓦特功耗和每一美元成本能换回多少有效算力,这个指标变得越来越关键。
在基于双Orin-X方案的高阶智驾系统中,BEV感知模块是算力消耗的大户,有行业技术分析指出,这部分模块的算力占用可以接近整个系统资源的六成,这意味着当车辆开启城市NOA功能时,两枚Orin-X芯片的系统功耗会明显上升,会接近40瓦的水平。
这个功耗水平对于纯电车型来说,是会直接影响到续航里程的。虽然40瓦相比驱动电机动辄几十千瓦的功率来说不算大,但在低车速、长时间城区行驶的场景下,智驾系统的持续功耗叠加座舱和其他电子设备,对整车能耗的影响已经不能再被无视了。
图片源自:网络
除了算力利用率外,还有一个关键指标是成本,麦肯锡在一份行业报告里预测,ADAS和自动驾驶相关的半导体全球市场,2025年大概是56亿美元,到2035年会膨胀到超过460亿美元,年复合增长率达 24%。市场在快速增长没错,但车企现在对成本的控制比前几年严苛得多。
以前车企可以不计成本地堆两颗、四颗Orin来保证算力冗余,现在大家都在算经济账,一颗高算力芯片的采购价加上配套的电源管理、散热、PCB设计成本,动辄几百甚至上千美元,这笔钱最终都要体现在车价里。如果多花一倍的钱只能换来百分之二三十的实际性能提升,那这个性价比在当下的价格战环境中是很难被接受的。
所以我们可以看到,2026年的芯片选型趋势已经从唯性能论转向了供应稳定性+算法适配度+能效比的综合考量。中国高算力智驾芯片市场今年预计规模会达到850亿元人民币,这么大的蛋糕面前,没有哪家会再傻傻地只盯着TOPS这一个指标来做决策。
03
内存墙正在成为比算力更棘手的瓶颈?
算力的问题还没完全解决,另一个更隐蔽的问题已经浮出了水面,那就是内存带宽和容量。
端到端模型上车之后,模型的参数量动辄几十亿甚至上百亿,而且这些模型已经不是简单地从摄像头输入到控制输出,中间会包含多模态融合、时序建模、注意力机制等非常消耗内存带宽的操作。
特别是Transformer架构中的自注意力层,它需要在不同的特征向量之间做大量的矩阵乘法和内积运算,这些运算的中间结果体积比模型本身的权重还要大好几倍。数据在算力单元和内存之间反复搬移,算力再强,如果带宽跟不上,计算单元就得停下来干等数据,这就是业内常说的内存墙。
黑芝麻的A2000在设计中针对这个问题就做了三层内存架构。第一层是大容量高带宽的NPU专用缓存,让最频繁使用的数据尽可能靠近计算单元;第二层是片内共享缓存,供不同计算核之间快速交换数据;第三层是经过深度优化设计的DRAM带宽利用率机制,尽量把外部内存的每一比特带宽都榨干。
理想马赫M100则直接配了8通道LPDDR5X,理论峰值带宽能做到273GB/s;比亚迪的璇玑A3也做到了同样的带宽水平。这些努力都是在试图把内存墙的高度再往上推一点。
图片源自:网络
但现实问题是,模型的增长速度比带宽的提升速度快太多了,有预测认为,当自动驾驶推进到L4级别之后,单车所需的内存容量将突破300GB。而近三个月以来,车规级存储芯片的价格已经涨了约180%,DDR5内存的均价累计涨幅更是达到了288%。这两项涨幅折算下来,每辆新能源车在存储上的成本就要增加1.5到2万元。
算力可以通过堆核心、提频率来硬往上拉,但内存带宽和容量的提升却严重受限于物理接口的引脚数量、信号完整性以及功耗预算,在1000TOPS之后的时代,谁能在内存子系统上做出更聪明的设计,谁就可能比单纯堆算力更有竞争力。
04
算法在反过来定义硬件,算力竞赛的规则彻底变了?
过去几年,智驾算法经历了从传统多任务分立模型到端到端模型的演进,而现在业界正在向VLA(视觉-语言-动作)模型和世界模型迈进。
每一次架构的迭代,对算力的需求结构都会产生根本性的影响,以前是几个独立的CNN或者轻量级Transformer各干各的,算力可以比较容易地分配到不同任务上。但端到端模型将感知、预测、规划全部揉进一个大的神经网络里,整个前向推理过程变成了一条超长的计算图,中间任何一个环节卡顿都会拖慢整个系统。
VLA模型更进一步,它不仅要理解视觉场景,还要结合语言指令来做决策,这就意味着芯片要同时处理高维视觉特征和离散的文本token,计算模式变得非常不规则。
到了世界模型这个级别,很多方案开始采用DiT(扩散Transformer)作为核心架构。DiT的推理过程涉及多次迭代去噪,每次迭代都需要对隐空间特征做全局注意力,这种计算模式对不规则计算和动态数据流的支持要求极高。传统上那些特别擅长做矩阵乘法、峰值TOPS很高的芯片,跑起DiT来实际利用率可能连10%都到不了。
图片源自:网络
也正是因为这个原因,头部车企才会不约而同地选择自研芯片,他们不是单纯为了降低成本或者摆脱供应商依赖,更是因为他们对自己两到四年后会用什么样的算法框架心里有数,而通用芯片厂商不可能提前为某一家车企的未来算法做专门优化。
蔚来的任少卿曾经在一次内部交流中说过,大模型时代性能提升三个百分点,训练数据量可能需要翻十倍。如果仅靠增加路测车队、采集更多物理数据来推动性能进步,很快就会撞上成本和物理可行性的天花板,所以未来的竞争不仅仅是算力大小的比拼,更关键的是谁能够用更少的算力和更少的数据,跑出更好的模型效果。
从这个角度再回过头来看1000 TOPS之后的路,其实已经很清楚,数字还会继续涨,特斯拉的AI 5芯片已经接近2500TOPS,小鹏的下一代芯片据说也要突破2000 TOPS,但决定胜负可能也不再是这个数字了。
智驾最前沿以为,未来真正的赛点在三个方面,一个是芯片架构能不能创新到让每一颗晶体管、每一瓦功耗都发挥出最大价值;一个是内存子系统能不能喂得饱大模型越来越大的胃口;最后就是硬件设计能不能提前押中三到五年后算法会变成什么形态。
算力竞赛没有结束,但它竞赛的内容已经完全变了。
#自动驾驶#大模型算力#算力竞赛