观点 | 物理AI赋能自动驾驶进化,目前落地还有哪些瓶颈?
自动驾驶是物理AI最大规模落地的场景之一,因此行业目前已经在这一方向上投入了大量工作。但在实际分析过程中,仍然存在不少问题,其中最主要的瓶颈是幻觉和不够精准,有时模型会无中生有,或者本质上对视频的理解还不够到位,与真实场景之间仍有差距。在最近举行的2026中国汽车论坛期间,文远知行上海研发中心总经理霍达发表精彩演讲,分享了物理AI现阶段落地面临的几大问题。以下整理了其中的部分核心内容,以飨读者。霍达认为,对自动驾驶来说,一个重要问题是如何发现长尾场景,找到那些更难处理的问题。比如,在海量视频中识别长尾场景,本身就非常困难。文远知行的思路是,既然现在大家都在讨论用AI解决问题,包括ChatGPT、Anthropic以及国内的一些大模型,那么是否也可以让AI来分析这些场景。目前文远知行观察到AI应用中的几个突出问题。第一,是运营闭环还不完整。虽然采集了大量数据,包括L2++和L4的数据,但这些数据拿来使用并不容易,其中包含很多噪声和干扰。大部分L2++数据来自个人私家车。这类数据中,有相当一部分对算法训练的价值较低,比如大量等红灯或常规行驶场景。对当前的算法迭代而言,这些数据的边际价值相对有限。第二,海量数据也很难被充分利用。以L2++车辆为例,一辆车每天可能产生约300GB数据;L4车辆的数据量更大,每辆车每天可达到TB级。数据量确实非常庞大,但如何更好地把这些数据用起来,仍然是行业面临的痛点。第三,AI仍然缺乏面向真实物理世界的可信锚点。简单来说,现在大家与AI对话、沟通,或者让它完成一些coding agent相关任务,这些事情已经做得不错。但面对真正的物理世界,尤其是自动驾驶所处的复杂交通环境,AI的理解仍然缺少足够可靠的锚点。霍达引用了一位著名哲学家的观点:世界是事实的总和,而不是事物的总和。也就是说,我们希望解决的不只是障碍物检测或路牌检测,更重要的是理解这个世界,理解各个事物之间存在的多种关系。行业需要理解这些事实,并围绕事实开展工作。基于这一思路,文远知行发布了大模型WITT,即World Intelligence Toward Truth。文远知行认为,这是一个具备物理认知能力的AI基础大模型。这个大模型基于文远知行多年积累的数据训练而成,尤其充分利用了自动驾驶数据,因此能够更好地理解真实世界。文远知行提出了一个概念,叫“最小物理事实单元”。在交通环境中,很多事情都非常复杂。比如车辆通过一个红绿灯路口、经过一个十字路口,或者完成一次右转,背后都包含大量事实单元。它并不是一个粗粒度的整体事件。因此,文远知行要做的是把最小物理事实单元定义出来。这个大模型本质上要做的,就是提取这些最小事实单元。它具备四项能力。第一是事实提取,即识别道路上正在发生什么,以及其中的最小事实单元是什么。例如,当前正在下雨,或者行人正在穿过马路,都把它视为最小事实的提取。这是大模型要完成的第一件事。第二是事实推理。比如,当看到一个人走在马路边时,大模型能够推测他下一步可能会穿过斑马线,可能会右转,甚至可能进入非机动车道。因此,这个大模型可以围绕事实做进一步推理。第三是事实验证。大模型有时也会产生幻觉或错误判断,如何处理这一问题?文远知行的方法是依托自动驾驶车辆本身,收集大量来自真实事件、可依靠且可信赖的物理特征。例如GPS信息、道路信息以及道路结构化信息。文远知行会利用这些物理特征,验证大模型给出的结论和判断是否符合真实世界的运行规律。最后是事实编排。不仅要理解世界,还要让这种事实理解能力与云端生成式大模型有效编排,进入整体数据飞轮。