在数字世界里,AI 可以依靠海量文本和图像快速学习;但在真实道路上,自动驾驶面临的是混乱、稀有、不可预测的长尾场景。
GM 提出的“世界理解扩展体系”,正是为了解决这个核心难题:如何让自动驾驶系统在成本不爆炸的前提下,持续学习真实世界的复杂性。
🧠一、物理世界的 AI 更难
自动驾驶不仅要做瞬时决策,还要理解长期风险。 真实道路上的关键事件——例如险些碰撞、奇怪的施工设备、突然出现的救护车——都是极低频的长尾场景。 要让系统真正安全,就必须从这些稀有事件中学习。
🚗二、从海量车队数据中挖掘“长尾真相”
GM 的测试车队产生了数百万英里的多传感器数据。 系统会自动识别:
急刹与险情
异常交通参与者
特殊天气与光照
罕见道路结构
这些数据是自动驾驶持续进化的“燃料”。
三、为什么不能只靠大模型?
GM 指出:
高分辨率视频直接喂给大模型,成本会指数级上升
长上下文会导致模型“丢失关键细节” 因此,单层 MLLM 管线无法支撑大规模长尾挖掘。
🔀四、GM 的解决方案:EMWU 多层管线
GM 构建了一个分层、异步、成本可控的系统——EMWU。
核心思想是:便宜的工作先做,大模型只在必要时出手。
Tier 1:领域投影(低成本、高规模)
将原始传感器数据转化为可复用的:
目标框
标签
嵌入向量 每天可生成数千万嵌入,成本低于每百万条 1 美元。
Tier 2:向量检索(快速筛选候选)
通过文本查询 + 向量搜索,快速找到可能包含长尾事件的片段。
Tier 3:深度推理(高精度、低规模)
只有最相关的帧才会进入 VLM 深度推理,进行高保真理解。
🧬五、轻量化领域适配:无需重新索引
GM 的创新点之一是: 只微调文本编码器(LoRA),视觉编码器保持冻结。 再通过轻量投影层对齐语义,就能让系统理解新的稀有概念。 无需重新生成视觉嵌入,大幅降低成本。
🔚结语:让自动驾驶以“可负担的方式”变得更聪明
GM 的 EMWU 架构让自动驾驶系统能够:
更快发现长尾风险
更高效利用车队数据
以更低成本实现更高安全性
这是迈向真正“物理世界 AI”的关键一步。
#自动驾驶 #人工智能 #AI安全 #智能汽车 #科技前沿 #工程科普 #机器学习 #未来交通 #车路协同 #智能系统