每天为你拆解硅谷最新AI播客与前沿观点
不用啃2小时英文原版内容,几分钟快速看懂AI正在如何改变世界
全文约2,328字 · 预计阅读6分钟
Dmitri Dolgov最近带着两个孩子坐了一回Waymo。车过十字路口,两个人类司机抢道插到前面。Waymo减速,让行,平稳得像什么都没发生。后排的孩子压根没注意到刚才差点出了什么事。
Dolgov在自动驾驶上干了快二十年,现在是Waymo联合CEO。Waymo是谷歌母公司Alphabet旗下的自动驾驶公司,目前是美国最大的完全无人驾驶打车服务。他说那一刻让他意识到一件事:物理世界AI最好的时刻,看起来就像什么都没发生。任务安全完成了,没人注意到。
这场在YC Startup School的演讲,台下坐的主要是创业者。Dolgov没有讲创业鸡汤,讲了一个对硅谷来说很反直觉的道理:你那个能跑的Demo,最多只占1%的活。
现状:每周50万次,15座城市,300年的里程
先说现状。Waymo现在每周跑大约50万次完全无人驾驶行程,每周400万英里,覆盖美国15个城市。换算一下,相当于每周跑完一个普通美国人300年的驾驶里程。
Dolgov把硅谷那句"Move fast and break things"翻了个面。做原子的事不是做比特的事,东西坏了是不能接受的。你得"move fast and ship safely"——快,但安全从第一天就得是地基,不是事后补的。
这话听着像废话,但他接下来解释了为什么物理AI和数字AI是两个物种。
四个差距:为什么物理AI是另一套规则
他列了四个差距。
第一,错误代价。数字AI犯错,大不了重来。物理世界犯错,代价是人命,没有撤销键。
第二,延迟。你问ChatGPT一个问题,等几秒没关系。但一辆在高速上跑的车,一秒走100英尺。毫秒都得计较,所有推理得在一台塞在后备箱里的电脑上完成。
第三,数据。数字AI有整个互联网当语料库。物理世界没有对应的"互联网",你得自己一英里一英里地采。
第四,验证。数字产品可以先上线个"差不多"的版本,让用户帮你找bug,无限规模地迭代。物理AI不行,你在跑第一英里之前就得证明足够安全。
说实话,这四个差距我以前没有放在一起想过。把它们排成一排看,你会发现做物理AI不只是"更难",是规则都不一样。
Demo用了18个月,产品用了15年
然后是这场演讲的核心判断:Demo是1%的活,那几个"9"才是产品。
2009年,大约12个工程师定了个目标:跑10万英里无人驾驶,完成10条100英里路线覆盖湾区各种路况,零人工干预。18个月内做到了。那时候CNN还没火,Transformer和VLM都还不存在。
按Demo标准,2010年自动驾驶就算"解决了"。日夜驾驶、红绿灯、行人、自行车、施工区、高速、城市道路全都能跑。团队当时的定义是"capability complete"——功能完整。
Demo用了18个月,产品用了15年。
大约又过了10年才开始提供服务,再过5年才做到每周50万次。第一个1亿英里花了15年,下一个1亿英里花了7个月。今年一天之内开了4座新城市。
每多一个"9"的可靠性,大约需要10倍的努力,而且不是把同样的事做更多就行——需要根本不同的方法,全冗余系统、分层后备架构。Dolgov给创业者的建议是:在数你的Demo播放量之前,先数数你有几个9。
蜥蜴脑和慢思考:Waymo的基础模型
Dolgov然后讲了Waymo的基础模型,名字很长——"多模态世界动作语言模型"。每个词都有含义:多模态,吃摄像头、激光雷达和雷达数据;世界模型,理解物理规律和社交动态;动作模型,不是被动观察,而是主动参与者,能预测自己行为对世界的影响;和语言对齐,借VLM的通用知识处理长尾罕见场景。
最有意思的是快慢两条路的设计。快路,Dolgov叫它"蜥蜴脑",融合原始传感器数据,负责毫秒级安全决策——行人突然冲到路上就立刻刹车,不需要"想"。慢路负责更复杂的语义理解,可以多花点延迟换更高推理能力——比如路边有辆车着火了,快路只看到一个障碍物,慢路理解"着火"这个语义,决定换一条路走。
他还有一个关于"结构"的判断。AI圈有个著名的"苦涩教训",是Richard Sutton 2019年提出的:利用大规模算力和数据的通用方法永远赢过手工设计的领域知识。Waymo每一波技术浪潮都验证了这个规律,但Dolgov加了个细节:对抗规模的结构永远会输,引导规模的结构永远会赢。
他举了个例子:造一个下围棋的机器人。端到端从摄像头像素到机械臂动作是一种做法,但如果你真想要最强的棋手,这不是最优解——因为19x19的棋盘就是一个完美的中间表征,完全描述了游戏状态。利用这个结构不限制你的模型,但帮你高效扩展。
物理世界没有这么干净的表征,但物理世界有结构:物理定律、交通规则、物体的可预测行为。Waymo的做法叫"结构增强端到端"——在学到的表征之外加上显式结构表征,好处是推理时可以做实时安全验证,不是黑盒。
模拟器:飞机降落在高速上,恐龙穿过十字路口
你怎么训练和评估一个物理世界的AI?答案是高保真模拟器。而且模拟器本身就是一个大AI模型,难度不亚于造Agent本身。
模拟分开环和闭环。开环是被动看"输入→输出"对,闭环是:你做一个动作,看世界怎么变,更新感知,再做下一个动作。对安全关键场景,闭环是必须的。
Waymo的模拟器能模拟什么?一辆车停在高速车道上。一架飞机在高速上降落。一头大象穿过十字路口。金门大桥上下雪。一只恐龙在街上走。
这不是生成式视频,是完整的闭环生成式模拟——Waymo Driver在里面跑,做决策,被评估。底层用了Google DeepMind的Genie 3。
三个AI和一个飞轮
Dolgov说到这个复杂度,你不能只造一个AI,得造三个。Agent,就是开车的那位。Simulator,虚拟练习场。Critic,严格评估Agent表现并告诉它怎么改进。三者基于同一个基础世界模型。
然后是飞轮:Agent在真实世界跑,产生数据;数据让Simulator更逼真;Simulator生成更难的边界情况给Critic评分;Agent变得更聪明,回到真实世界跑得更多。
但飞轮可以朝任何方向转,甚至原地空转。引导它朝对的方向转的,是指标。
模型是入场券,评估才是护城河
这就引出Dolgov最后的判断:你的模型是入场券,评估和指标才是你的护城河。
先建评估,再建技术。先建评估,再做产品。如果你不能定量定义什么叫"够好",你做的就不是产品,只是在迭代你的Demo。
物理AI的评估要深得多、宽得多:从物理层到行为层到离线组件到运营流程,每一层都要评。Waymo花了多年建了一套"safety and readiness framework"。
Dolgov说,物理世界里信任就是一切。你靠的不是炫酷的Demo或聪明的架构,而是日复一日在真实路上证明你的系统安全。Waymo公开发布安全数据。模型可以泄露,算法可以被复制,但两亿多英里的完全无人驾驶运营,加上证据级的评估和公开审计——这要难得多的多。
最新数据基于2.2亿英里:Waymo在运营区域内,造成严重伤害的事故率比人类驾驶员低约17倍。全球每26秒就有一个人死于车祸。按Waymo现在的规模,每8天预防一次严重伤害。
Dolgov说,这不是仪表盘上的数字。这意味着某个人所爱的人,在一天结束时安全地走回了家门。
下一个十年
最后他留了一句话:过去十年的AI发生在数字世界,下一个十年将发生在物理世界。
演讲结束的时候,屏幕上放了一段乘客第一次坐Waymo的视频。那个人说:
"我不敢相信,这车开得比有人开还好。"
"我这辈子都不会忘,永远不会。"
本文基于 YC Startup School 演讲 "Waymo Co-CEO Dmitri Dolgov: The Demo Is Only 1% Of The Work" 的完整字幕整理撰写,为独立评论与拆解。