机器视觉系统的性能上限取决于视觉骨干网络(Backbone)。视觉骨干网络的作用是将原始图像的像素矩阵编码为高层语义特征,供下游的分类、目标检测和语义分割等任务调用。当前视觉感知领域正在经历从 CNN(卷积神经网络)向 ViT(Vision Transformer,视觉 Transformer)的代际更替,这一变革的本质是“人为写入先验”向“数据与算力驱动”的转向。
代际更替的核心:归纳偏置与 Scaling Law 的权重博弈
CNN 统治计算机视觉领域近十年,其核心逻辑建立在三项强归纳偏置(即训练前写入模型的先验假设)之上:局部连接(只关注相邻像素)、权值共享(不同区域复用同一特征提取器)和平移等变性(物体移动时特征相应平移)。
这些先验使 CNN 在中小规模数据集(如约 120 万张图像的 ImageNet-1k)上拥有极高的样本效率,特征提取过程复杂度随分辨率呈线性增长,符合端侧低功耗计算的需求。
然而,强先验构成了结构性约束。CNN 的感受野(神经元能感知的图像区域)必须通过堆叠深度自下而上逐层扩大,导致其在捕捉跨区域的长程依赖关系时效率低下。
2020 年发布的 ViT 改变了这一路径。ViT 将一张 224x224 像素的图像切分为 16x16 的块(Patch),得到 196 个 Patch Token,加入位置编码后直接输入 Transformer 编码器。ViT 依靠 Self-Attention(自注意力机制)在第一层即实现全图 Patch 的全局交互。
这种设计放弃了 CNN 的结构先验,其动力来自于对 Scaling Law(规模法则)的追求:
1、弱先验释放参数上限:没有局部连接的刚性限制,模型能够吸收海量数据并自动学习复杂的空间关系。
2、数据规模突破精度瓶颈:在约 1400 万张图像的 ImageNet-21k 或 3 亿张图像的 JFT-300M 等超大规模数据集预训练下,ViT(如 ViT-H/14 参数量级)的特征提取上限显著超越传统 CNN。
供应链瓶颈与算力壁垒:为什么全盘 ViT 尚未实现
尽管 ViT 在大模型预训练和多模态场景(如 CLIP、SigLIP、Qwen-VL)中占据主导,但其在工业界和车端量产落地时面临极高的资源壁垒,形成了明显的供需错配与瓶颈:
第一,计算复杂度的二次方增长。标准自注意力的计算复杂度随 Token 数量(即图像分辨率)呈平方级递增。在自动驾驶等高分辨率(如 800 万像素摄像头)场景下,计算资源消耗呈指数放大。相比之下,CNN 的计算量仅随分辨率线性增加。为了解决这一问题,行业衍生出了 Swin Transformer 等利用局部窗口限定计算范围的变体,以折中计算开销。
第二,端侧部署生态与工具链落地滞后。硬件芯片对 CNN 的卷积算子、量化工具链(如 INT8 加速)已有多年优化积淀;而 ViT 所需的动态内存分配、大矩阵乘法以及频繁的全局特征交换,对车载 SoC(系统级芯片)和边缘 NPU 的带宽及片上缓存(SRAM)构成了极高的挑战,造成端侧部署延时拉长、功耗增加。
产业分化趋势:云端 ViT 与车端混合架构
基于上述算力与部署约束,产业端呈现出明确的分层逻辑:
1、云端与大模型研究:全面转向 ViT 及类 Transformer 架构,追求最高的表征能力和跨模态融合效率。
2、边缘端与自动驾驶量产:采用混合架构(Hybrid Backbone),即利用 CNN 提取前端局部特征以控制计算开力,结合 Transformer/BEV(鸟瞰视角)进行全局空间语义融合。
针对这一技术路线的演进,需要考虑以下不确定性:
A 股产业链映射
根据上述对视觉骨干网络演进、云端大模型算力需求以及车端混合感知部署的分析,相关受益细分领域及标的:
【德赛西威】作为自动驾驶域控制器龙头,公司深度绑定英伟达 Drive Orin 及下一代 Thor 平台。Thor 算力大幅提升,专门针对 Transformer 架构进行优化。公司具备将视觉混合骨干架构(CNN 前端 + Transformer 全局感知)在车载 SoC 上进行量产部署和工具链优化的能力,直接受益于车端感知架构升级带来的域控单车价值量提升。
【中科创达】视觉架构从 CNN 向 ViT 或混合架构演进时,模型的边缘端部署需要复杂的模型剪枝、量化以及硬件适配。公司在边缘端 AI 模型部署与异构计算优化方面积累了底层软件工具链能力,能够帮助车载及智能硬件客户解决 Transformer 模型在端侧 NPU 上的算子兼容性与功耗控制瓶颈。
【韦尔股份】视觉 Transformer 架构对输入图像的质量、动态范围和像素细节提出了更高的要求,以支撑 Patch 化后的全局关系提取。公司作为车载高阶 CIS(CMOS Image Sensor,互补金属氧化物半导体图像传感器)核心供应商,高动态范围(HDR)及 LED 闪烁抑制(LFM)功能适配了自动驾驶视觉感知端对高清原始图像数据的刚性需求。