
商汤科技的SenseNova U1 Pro不是一款自动驾驶产品,其当前的商业化数据都在设计创作领域。但底层的那套NEO-unify统一架构,拆掉了视觉编码器和语言模型之间的"翻译器",让像素和文字在同一个表征空间里实现了原生处理,这一点恰恰击中了自动驾驶AI最顽固的结构性瓶颈:模块之间的信息损耗。如果这条路走通了,那自动驾驶可能就会拥有一个“全科大脑”,不再需要让感知、预测、规划三个模块各自工作后再互相传纸条了。但要走通这条路,至少还要过两道门槛。
2026年WAIC上,#商汤科技 发布SenseNova U1 Pro的时候,展厅里最吸引眼球的是一幅8K东方山水长卷——《智会世图》。观众站在巨幅画面前,看AI画出每一笔山石皴法、每一行小楷题跋、每一处地标建筑的精确透视,都会不禁惊讶:这真的是AI做的?
从自动驾驶行业的视角出发,这幅长卷的意义不在于画作本身,而在画背后的那套#NEO-unify架构。因为商汤为了画出这幅长卷,做了一件自动驾驶AI一直想做但没做成的事:拆掉"翻译器",让视觉和语言在同一个空间里思考。这可能就关系到#自动驾驶 #AI 认知范式"天花板"在哪里的问题。
1. 自动驾驶AI的"翻译器"问题
先看今天主流自动驾驶AI是怎么工作的。
智驾AI今天的感知→预测→规划流水线,本质是"拼接架构"——三个模块各说各的语言,中间靠接口“翻译”传递。据行业调研显示,跨模态转换存在约15%-20%的语义损耗。一张路标文字经视觉编码器压缩后,从"前方施工限速30"退化为"似乎有个路标类物体"。所以自动驾驶AI的天花板不在于各模块的聪明程度,而在于传递过程中分辨率的降低。
商汤的NEO-unify架构,拆的就是这个"翻译器"。
2. NEO-unify拆掉翻译器
NEO-unify的技术路线非常简洁:去掉视觉编码器(ViT)和变分自编码器(VAE),让像素和文字直接进入同一个Transformer,在同一个表征空间里处理融合。支撑运转的是商汤自研的MoT(Mixture-of-Transformers),语言与视觉token在每层计算中深度交融,而非各干各的再路由选择。商汤林达华在WAIC大会期间接受采访时称"OpenAI和谷歌也意识到了这一点,但却秘而不宣,商汤目前走得更公开、更彻底。" 这就意味着,统一架构是行业共识,只是商汤是目前走得最公开的那家企业。
同时,效率数据也印证了架构优势:
NEO-unify架构关键数据(多源交叉验证)
训练数据量:3.9亿图像文本示例,仅为业界同等性能模型的约1/10 。
开源模型规格:SenseNova-U1-8B-MoT(稠密骨干)+ SenseNova-U1-A3B-MoT(混合专家骨干)。
GitHub Star数:U1 + SenseNova-Skills 合计超8000 。
用户增长:6月人均日生图量较5月提升近3倍 。
商业用户:小浣熊周活超300万、累计服务超2000万用户、企业用户超8000家 。
其中,用1/10的数据量追平SOTA——这是最值得关注的数字。对于自动驾驶来说,数据采集是最大的成本瓶颈,统一架构若能以1/10的数据达成同等的感知和推理能力,那么自动驾驶AI的训练成本则可能会有数量级的下降空间。
这套架构目前在自动驾驶层面有案例吗?
答案是:没有。SenseNova U1 Pro现有的商业化数据都集中在设计创作、办公、电商、教育等领域,而自动驾驶领域,零落地。但是,其架构原理与自动驾驶的核心瓶颈却直接相通。主要体现在以下三个方面:
1.消除模块间信息损耗
自动驾驶AI的感知→预测→规划流水线,本质是"拼接架构"。NEO-unify证明了替代方案的存在,例如像素级路标文字、车道线曲率、远处行人步态微变化等,是可以无损传递到决策环节的。
2.1/10数据效率
自动驾驶的数据采集成本极高,比亚迪315万台车·2亿公里/日的数据壁垒是任何公司都难以复制的。但是如果统一架构能用1/10的数据达到同等效果,那么“谁的车多”就不再是决定性因素,数据规模优势的壁垒就会被结构性削弱。
3.涌现物理理解的可能性
商汤官方称:"视觉和语言的联合#涌现 将加速实现,最终为物理世界的AGI构建全新的通用智能底座"。学术综述emergentmind.com也提到,NEO-unify架构在VLA(Vision-Language-Action)机器人任务和视觉世界建模任务中已展示序列预测能力——物理理解的能力雏形初现。
3. 两道门槛
但是,设想或理论推演并不能等同于结论。从NEO-unify到自动驾驶之间,至少还有两道门槛没有跨过去。
门槛一:没有驾驶场景的验证数据
U1 Pro的全部演示都在内容创作领域。8K山水长卷 ≠ 毫秒级动态交通决策,从静态8K到动态毫秒,这中间的认知跨度远比架构迁移本身更大。
门槛二:"涌现"是假说而非事实
商汤说的"物理世界的#AGI"和"视觉和语言的联合涌现",是一个方向性的愿景。GPT-3实现的语言能力的涌现发生在语言自身的统计结构中,这是基于语法、语义、篇章逻辑都有大量可学习的统计模式支撑的。而物理世界的能力是否也能涌现?这是未知的。
物理世界的运行遵循因果定律而非统计关联,而NEO-unify目前没有显式设计任何物理因果推理或事实验证机制。文远WITT(World Intelligence Toward Truth)的四层闭环(提取→推理→验证→编排)显式设计了这套逻辑,而商汤没有。
4. 商汤和文远,两条路可能在哪里交汇
在当下的技术范畴下,商汤的技术之于自动驾驶,是区别于文远WITT的。但作为目前人工智能领域最前沿的企业而言,也许路径不同,但却有相交的趋势:NEO-unify代表的是"架构统一→涌现物理理解"的路径,WITT代表的是"显式设计物理推理→工程落地"的路径。交汇点最可能是:统一表征底座 + 显式事实验证嵌入,即让统一架构提供"无损信息传递"的底座,然后在统一空间内部嵌入显式的物理因果推理和事实验证环节。这样既享受了架构统一的效率优势(1/10数据、无损信息流),又拥有了显式物理推理的可验证性和安全性。
这并非不可能。商汤在NEO-unify架构中已经预留了扩展空间——emergentmind.com的学术综述明确提到,NEO-unify的"identified research frontiers"包括"Explicit integration of geometric and spatial priors (e.g., 3D reasoning, closed-loop world models)"。也就是说,学术界已经预见到了统一架构需要嵌入显式3D推理和闭环世界模型的必要性。这和WITT的"事实验证机制"在精神上是相通的。
5. 如果走通,自动驾驶会怎样
假设最乐观的情况:NEO-unify的统一架构确实能迁移到驾驶场景,而且物理理解能力在足够大的统一空间中涌现出来(或者通过嵌入#显式推理 机制实现),那么自动驾驶技术会发生什么变化?猜测可能会有以下四个:
变化一:感知-预测-规划的模块边界消融,可能会重塑自动驾驶公司的组织方式和技术栈。
变化二:数据壁垒的结构性削弱,这对数据积累较少但有算法创新能力的公司而言,是结构性利好。
变化三:长尾问题的解决路径会从"跑更多路"变为"用少量数据建物理基座再推理泛化"。这样在数据效率上有数量级优势,在认知深度上也会有因果推理保障。
变化四:从驾驶到具身智能的路径打通。智驾从垂直赛道变为通用物理AI的首个大规模商业落地场景。
那么,回到标题的问题:自动驾驶的"全科大脑"还有多远?
自动驾驶AI的认知天花板,不在算力、数据量、芯片工艺这些层面,而在认知范式层面。而NEO-unify,是打破这层天花板的又一条可能的路径。NEO-unify拆掉了AI的"翻译器",但"拆掉翻译器"和"长出物理理解"之间,还有一段未被验证的距离。这段距离有多长,我们还要走多久,期待答案确认的那一天……
*本文所有数据均来自2026年7月18-22日公开媒体报道及学术资料。如有问题,请及时后台联系。