粉红色的小车省去了方向盘和驾驶员,正以三倍速在洛杉矶的人行道上狂奔。
画面左下角嵌着一个鱼眼镜头的第一视角,它"看见"的世界是弯曲的、拥挤的、充满不确定的:前方有一辆蓝色公交刚刚驶过,右边停着共享单车,一个遛狗的行人正朝它迎面走来。字幕只写了两个词:autonomous, 3x speed。
这段视频来自UCLA计算机科学系副教授周博磊(Bolei Zhou)。他刚刚宣布:将在加州大学伯克利分校举办的Agentic AI Summit 2026上,发表题为Scaling Sidewalk Autonomy with World Models的报告,用世界模型,让人行道上的机器人学会自己"开车"。


▲ 周博磊在X上发布峰会预告,视频展示Coco配送机器人在城市人行道上自主行驶,左下角为鱼眼第一视角
学术身份之外,他同时还是Coco Robotics的首席AI科学家。这家公司自称运营着"全球最大的自动驾驶配送车队",已完成超过50万次配送,横跨洛杉矶、迈阿密、芝加哥乃至赫尔辛基,并计划在2026年将车队规模扩展到超过一万台机器人。
一万台全部跑在你家楼下的人行道上
从"人替机器开"到"机器替自己想"
故事要从2020年讲起
那时候的Coco,本质上还是一家"遥控车公司"。 配送机器人在人行道上跑,行驶决策主要由屏幕后面的远程操作员(teleoperator)完成,他们盯着摄像头画面,帮机器人绕开路障、等红灯、躲行人。CEO Zach Rash后来对TechCrunch坦言:从第一天起,目标就是去掉操作员,让车队自己跑。
但"去掉人"这件事,比想象中难得多
人行道要应付比高速公路更零碎的环境:路缘石、施工围挡、突然蹿出的宠物、外卖小哥的电瓶车、雨天反光的地砖、店门口临时支起的广告牌……每一个城市、每一条街区、每一个小时,世界都不一样。逐一编写规则无法覆盖所有情况
困难还在于:危险场景不能故意制造 你不能让一个真人冲到机器人面前测试它的反应,至少在法律和道德上不能。暴雨夜、临时封路、醉汉横穿等致命的长尾场景,恰恰是数据最稀缺的地方。
这就是周博磊登场的理由
一个"造世界"的人


▲ 周博磊宣布VAIL实验室获得NVIDIA学术资助,用RTX PRO 6000与Omniverse建设城市仿真
2025年10月14日,PR Newswire和TechCrunch同日官宣:周博磊出任Coco首席AI科学家,并牵头成立Physical AI Lab。
Rash称选他是"no brainer"。周博磊的研究方向偏微出行而非全尺寸汽车,他的实验室和Coco早有合作(Coco联合创始人是UCLA校友,曾向实验室捐赠机器人);Coco尤其看重他兼具计算机视觉、机器人学习与大规模世界仿真的研究经验。
周博磊团队的成果清单呈现出一条清晰的技术路线,从模拟器,到仿真世界,再到世界模型:
第一步:MetaDrive,一个面向可泛化强化学习的开源驾驶模拟器,能大规模合成交通场景,让AI在虚拟世界里"开"几百万次。
第二步:Urban-Sim,2025年CVPR以Highlight级别亮相。这套系统基于NVIDIA Omniverse/IsaacSim构建,单卡可并行到约2600帧/秒,并配套评测基准Urban-Bench,覆盖从基础避障到公里级城市穿越等任务,支持轮式、四足、轮腿、人形等多种机器人本体,Coco的配送机器人赫然在列。
▲ Urban-Sim项目页:CVPR 2025 Highlight,高性能城市仿真+微出行基准
第三步:UrbanVerse,被ICLR 2026接收。这是一个野心更大的系统,它把互联网上随手拍的城市巡游视频,自动转化成带物理属性的可交互仿真场景。团队构建了一个超过10万个城市三维资产的资产库,从24个国家生成了约160个高质量场景。论文报告的结果是:相比已有方法,仿真导航成功率提升约6.3%,零样本sim-to-real迁移提升约30.1%,真实世界完成约300米任务仅需两次人工介入。
▲ UrbanVerse项目页:从城市巡游视频自动生成可交互物理仿真,被ICLR 2026接收
他在"造世界":搭建足够逼真、多样且成本可控的虚拟城市,让成千上万的机器人在里面犯错、学习、进化,再把学到的能力带回真实的人行道。
三根支柱:视频预训练、仿真强化、人类反馈
2025年10月底,周博磊以双重身份在Coco官方博客上发表了一篇路线图级别的长文:Scaling Physical AI for Sidewalk Autonomy。
他把整个技术路径压缩成三根支柱:
支柱一:在海量视频上预训练 每天,数千台Coco机器人在不同城市的不同街区拍摄视频。这些视频就像大语言模型的训练文本,规模即力量。用它们预训练一个"人行道导航基础模型",让AI先获得关于城市视觉世界的基本直觉。
支柱二:在仿真中用强化学习微调 光看视频不够视频教不会"如果当时向左绕会怎样"这种反事实推理。Urban-Sim和UrbanVerse这样的高保真仿真器可以复现行人突然横穿、配送障碍堆积等场景,让AI用强化学习去试错、去优化。团队还用高斯溅射等神经三维重建技术,把真实的Coco视频直接变成可交互的训练环境,真实世界和虚拟世界之间的墙正在被拆掉。
支柱三:从人类反馈持续学习 运营中遥操作员的每一次介入,无论是帮机器人绕过施工区还是在复杂路口接管,都被当作训练信号回流。团队发展了共享控制与在线策略学习机制:人给高层指引,机器人执行底层控制,双方在协作中持续改进。
▲ Coco官方博客:Scaling Physical AI for Sidewalk Autonomy,三大技术支柱
这套逻辑形成了一个飞轮真实车队跑得越多,数据越多;数据越多,仿真越逼真;仿真越逼真,AI越强;AI能力提升后,人工介入随之减少,成本也会下降,车队便能扩展到更多城市,循环由此加速。
同一赛道,不同路径
人行道配送赛道已有多家公司参与Serve Robotics等公司同样在洛杉矶大规模投放机器人,常与Uber Eats等平台深度绑定。各家的差异化路径截然不同:有的依靠平台订单入口,Coco更依赖自有车队数据与仿真飞轮。
这个分野至关重要如果Coco的技术路线奏效,它将不仅仅是一家配送公司,它将拥有一个不断自我进化的物理AI系统,而万台级别的机器人车队既是商业资产,也是数据采集网络。
而且,Coco已经在悄悄突破"人行道"的边界。公司宣布的下一代产品Coco 2,将从纯人行道扩展到允许通行的自行车道与道路,宣称配送时间可缩短约一半。"人行道优先"只是城市微物流连续体的一个起点。
伯克利舞台:当机器人遇上世界模型
▲ Agentic AI Summit 2026官方页面:预计约5000人线下参会
2026年8月1-2日,由Berkeley RDI主办的Agentic AI Summit将在伯克利校园举行,预期约5000名线下观众加上大规模线上直播。
周博磊的报告被安排在第二天下午的Atlas分会场"Robotics & World Models"环节。和他同台的,是索尼AI首席科学家Peter Stone、Waymo杰出工程师Vincent Vanhoucke、伯克利教授Trevor Darrell,清一色的机器人学习与具身智能重量级人物。
这个安排把具身智能放进了"Agent"的整体框架。人行道上的配送机器人、工厂里的机械臂、仓库中的AMR,共同构成AI Agent光谱上的物理端。软件Agent在代码世界里调用API,物理Agent在城市街道上躲避行人。它们都要理解世界、预测未来并做出决策。
一公里的距离,一个时代的跨越
让我们把视角拉远
UrbanVerse论文里有一个数字很不起眼,但极具象征意义:真实世界300米任务,仅需两次人工介入。
300米,大约是你从家门口走到最近便利店的距离。两次介入,意味着机器人在这段路上,只有两个瞬间需要人类伸手帮忙。
这个数字今天听起来也许并不惊艳但请想象一下,当这个数字变成3公里、30公里、整个城市网格,当一万台粉红色的小车,在全球数十个城市的人行道上无声地穿梭,每天完成数万次配送,并几乎摆脱持续的人工注视。
那时,一个学术报告的标题便会落入现实,城市生活的底层逻辑也将又一次被技术悄然改写。