7月17日的WAIC大会,文远知行发布了一个叫WITT的模型。
全称很拗口——World Intelligence Toward Truth,"以可信事实建立世界认知"。但核心逻辑一句话就能说清楚:自动驾驶不需要一个能写诗、能画图、能陪你聊天的"全能AI"。它只需要一个能精确理解物理世界的AI。
WITT做到了。Token成本比通用大模型低98%,单GPU单日处理1万分钟车载视频,路况识别错误率只有通用多模态大模型的1/3。
这不是"又一个参数更大的模型"。这是一种不完全不同的技术方法论。
01 "最小物理事实单元":把世界拆成可验证的像素
通用大模型理解世界的方式,跟你背单词差不多——看多了,大概能猜出来"红灯"和"停车"有关系。但它是"猜"出来的,不是"推"出来的。
WITT的做法完全相反。它提出"最小物理事实单元"(Atomic Physical Facts,APF),把一段行车视频拆解成一个个可验证的物理陈述。
比如一段3秒的十字路口视频,通用大模型输出:"红灯,有行人,车减速。"
WITT输出:"t=1.2s,前轮距斑马线边缘0.83米。t=1.7s,行人步速1.42m/s,加速度-0.11m/s²(正在减速)。t=2.1s,信号灯由绿变黄,已持续0.4秒。"
这种差异不是"精度更高"的问题,是根本上的认知框架不同。通用大模型在"识别"场景,WITT在"推演"物理。
这个概念借鉴了哲学家维特根斯坦的话:"世界是事实的总和,而非事物的总和。"WITT不关心"这是什么",只关心"正在发生什么物理事实"。
02 98%的成本降在哪:不是省算力,是省了"幻觉"
通用大模型做自动驾驶场景理解,最大的问题是"幻觉"。
举个例子:一辆打着双闪的货车停在路边,通用大模型可能输出:“一辆静止车辆,可正常通行。”但事实上,这辆车后方放置了三角警示牌,属于故障占道。对普通场景而言,这个判断无关紧要。但对自动驾驶来说,这个误判意味着决策链的崩坏——如果系统“以为”是普通静止车辆,它可能会选择直接绕行;而真实的故障车场景需要提前变道、减速避让,甚至等候。一步错,步步错。通用大模型的问题在于:它是在“猜”场景,而不是在“推演”场景。它看到了“白色”“车轮”“停在路边”,然后调用统计上最接近的匹配——至于那是不是一辆故障车、它占用了多少车道、后方来车是否来得及反应,这些物理问题,它一概没有验证。WITT用“事实验证”机制来解决这个问题。它从六个维度评估输出——弱势道路使用者、自车行为、他车行为、场景理解、事实完备性、交通设施——并引入“事实置信度”,结合外部物理证据反向验证。比如对上述故障车场景,WITT不是输出一个“静态标签”,而是提取一组物理事实:占用车道宽度、双闪频率、三角牌距离、自车当前速度下的安全制动距离……当物理约束不满足或置信度不足时,它不会编造一个“看起来合理”的决策,而是会启动复核机制,将异常片段标记出来交由人工处理。结果是什么?在自动驾驶场景理解任务中,WITT的平均每片段事实错误率,约为通用大模型的1/3。这不是“模型更聪明”,是“模型更诚实”。它在不确定的时候说“我不确定”,而不是编一个看起来合理的答案。成本降98%的另一个原因,是WITT不做“多余的事”。通用大模型花大量Token去理解“天空是什么颜色”“远处的广告牌写着什么”——这些跟驾驶决策无关。WITT只提取跟物理事实相关的信息,Token消耗自然低了。03 四大能力:提取、推理、验证、编排
WITT的架构围绕四个核心能力设计:
事实提取:从视频、图像、文本等多模态数据中,识别"最小物理事实单元"。比如"自车右转""交叉口信号灯由红变绿""前方行人步速下降"。每个单元都有高置信度、可校准、可追溯。
事实推理:分析事件之间的关系和风险演化。比如"前方货车遮挡视线"+"右侧盲区存在非机动车切入风险"→"建议减速至25km/h以下,保持横向安全裕度≥1.2米"。这不是基于经验的判断,而是基于物理约束的推导。
事实验证:从六个维度评估输出结果,追踪事实错误、幻觉、遗漏和时序偏差。前面提到的"1/3错误率"就是这个环节的成果。
事实编排:根据学习价值对视频数据智能分流。稀缺长尾场景(如"雨天施工区行人横穿")回流到仿真模型GENESIS做训练;高频日常场景用于强化学习;异常片段进入人工复核。
这四步构成了一个闭环:真实道路数据→提取物理事实→验证事实准确性→编排学习路径→优化车端模型。文远知行把这个闭环叫"物理AI飞轮"。
04 数据底盘:3000辆车、12国、40城
WITT不是凭空出来的。
文远知行目前在全球12个国家、40余座城市部署了自动驾驶产品,拥有8国自动驾驶牌照,L4车队规模超过3000辆。这些车辆每天产生海量真实道路数据——不是仿真数据,是真实路况、真实天气、真实交通参与者行为。
2026年WAIC上,文远知行入选国家发改委《中国智·惠世界(2026)》十大案例,是唯一入选的自动驾驶企业。过去一年,它在阿联酋的运营已经进入加速阶段:2025年11月拿到美国以外全球首张城市级L4商业化牌照,在阿布扎比启动纯无人Robotaxi运营,覆盖约70%核心区域;2025年12月在迪拜上线;2026年2月开启纯无人商业运营。
迪拜和阿布扎比分别计划到2030年和2040年将自动驾驶出行占比提升至25%。文远知行是这两个目标的核心供应商。
这些真实运营数据,是WITT的"事实资产"。通用大模型靠互联网文本训练,WITT靠真实道路中提取的物理事实训练。前者的知识是"人们说过什么",后者的知识是"物理世界发生了什么"。
05 垂直AI的路线之争:为什么"专"正在打败"大"
WITT这件事,本质上在回答一个更大的问题:AI落地的正确姿势,是做一个“什么都会”的通用大模型,还是做一个“只会一件事但做到极致”的垂直模型?过去两年,行业的主流叙事是“越大越好”。百亿、千亿、万亿参数——参数越多,能力上限越高,故事也越好讲。但到了2026年,风向变了。行业开始意识到:参数规模只是基座,真正的考验是“能不能用、能不能量产、能不能赚钱”。一个能写诗、能画图、能聊天的千亿参数模型,放在自动驾驶场景里,问题就来了:不仅推理成本高昂,还容易出现“幻觉”——在复杂的交通场景中,它可能编出不存在的事,给出错误判断。它在“猜”世界,而不是在“验证”世界。它学到了“红灯”和“停车”的统计相关性,却从未用物理定律去验证“为什么红灯必须停车”。WITT的路径是反过来的:不追求“全能”,追求“精确”。它的参数规模比通用大模型轻量得多,但在自动驾驶这个细分领域,事实错误率是通用大模型的1/3,Token成本是1/50。这背后不是简单的“小模型打败大模型”,而是两种截然不同的技术信仰:这不是说大模型这条路走错了。恰恰相反,Scaling Law依然有效,更大参数、更复杂架构仍在产生更好的模型。只是当AI从聊天框走进真实世界——方向盘后面、手术台旁边、飞行控制舱里——光靠“参数大”已经不够了。它还需要“靠得住”。
WITT指向的是一条更务实的路径:在垂直领域放弃“全能”、追求“精确”。参数可以更少,但每一个输出都必须可追溯、可验证、可执行。
自动驾驶只是第一个试验场。下一个可能是手术机器人、工业质检、飞行控制。每一个需要“不能出错”的领域,最终都需要一个“不编故事”的AI。
而这,或许才是AI真正走进物理世界的标准模板。
作者视角 通用大模型什么都会,什么都可能错。在聊天场景,这叫“创造力”。在自动驾驶,这叫“安全隐患”。WITT的选择是:放弃“什么都会”的虚荣,死磕“什么都对”的底线。自动驾驶是起点。手术室、工厂车间、驾驶舱——所有“零容错”的地方,都需要一个“不编故事”的AI。
📎 参考来源
- 文远知行官方公告,《WeRide Introduces WITT, a Physical AI Cognitive Foundation Model》,2026年7月17日
- 上海证券报,《文远知行发布物理AI大模型WITT 引入"最小物理事实单元"概念》,2026年7月17日
- 人民网,《文远知行入选2026世界人工智能大会十大案例》,2026年7月19日
- 凤凰网/网通社,《文远知行发布自研物理AI大模型WITT》,2026年7月17日
- 北京商报/中青在线,《量产计划密集发布 Robotaxi商业化提速》,2026年5月7日
- StockTitan/GlobeNewsWire,《WeRide Unveils WITT AI Model》,2026年7月17日