阅读约8分钟 | 关键词:规则驱动、学习驱动、模仿学习、强化学习、混合架构
前面我们聊了很多“看懂世界”的方法:目标检测、车道线检测、BEV、占用网络。但看懂不等于会开。就像一个人视力再好,如果脑子不知道怎么打方向盘,照样开不了车。
决策架构就是这个“脑子”。今天咱们聊聊自动驾驶做决定的两种思路:规则驱动和学习驱动。
📋 一、规则驱动:用“if-else”写驾驶手册
传统自动驾驶(包括大部分L2+量产车)用的都是规则驱动架构。工程师把驾驶经验写成一条条明确的规则,系统遇到什么情况就执行什么操作。
典型规则示例:
· 如果前方车辆距离小于X米,则减速
· 如果左侧车道空闲且前方车速低于设定值,则变道
· 如果检测到行人横穿且TTC小于Y秒,则紧急制动
优点:行为可预测、可调试。工程师知道每条规则的效果,出问题了能定位到具体是哪条规则写得不对。这也是法规和功能安全认证最喜欢的方案——能解释“为什么刚才刹了车”。
缺点:规则不可能穷尽所有场景。真实世界的复杂性是无限的:你永远会遇到规则库里没写的情况。而且规则之间可能互相冲突(比如“保持安全距离”和“不要被加塞”两条规则同时触发),需要复杂的优先级仲裁,代码量动辄数十万行,维护起来像一团乱麻。
更关键的是,靠规则堆出来的系统,行为往往很“机械”——该走的时候犹豫,该停的时候猛刹,不像人类司机那样流畅自然。
🧠 二、学习驱动:让AI“自己悟”
如果说规则驱动是“手把手教”,那学习驱动就是“自己看、自己学”。核心思路:不给AI写规则,只给它看大量的人类驾驶数据,让它自己总结出“什么情况下该怎么做”。
模仿学习
AI看人类驾驶的视频,学习“看到这个画面,人类会打多少方向、踩多少油门”。这是端到端模型的主要训练方式。优点:行为流畅自然,像人类;缺点:学什么像什么,如果数据里有坏习惯(比如压实线变道),AI也会学到。
强化学习
让AI在仿真环境里自己开,开得好给奖励,开得差给惩罚。经过无数次试错,AI自己摸索出最优驾驶策略。优点:可能超越人类(找到人类从未试过的走线);缺点:仿真和现实有差距,仿真里学会的“最优策略”到了真实道路上可能水土不服。
两者结合
特斯拉FSD V12实际是“模仿学习打底(先学会像人一样开)+ 强化学习微调(在仿真里优化极端场景应对)”,再加一层安全规则兜底(比如“前方有障碍物,无论如何必须刹车”)。
🔀 三、混合架构:当前量产车的务实选择
纯规则驱动太僵硬,纯学习驱动太黑箱。当前主流方案是混合架构:
· 常规场景:学习驱动提供流畅自然的驾驶行为(变道、跟车、过弯)。
· 安全关键场景:规则驱动作为“安全网”兜底(AEB、紧急避让)。
· 决策输出:学习网络给出一组候选轨迹,规则系统负责“审核”——如果候选轨迹违反任何安全规则(比如要压实线、要撞障碍物),则拒绝并切换到备用轨迹。
这样的好处是既保持了驾驶的自然流畅,又保证了安全底线可解释、可追溯。华为ADS、理想AD Max、小鹏XNGP基本都是这个思路。
🚗 四、普通用户怎么理解?
你开车时感受到的“像不像老司机”,很大程度上取决于学习驱动部分的水平。如果一辆车的变道总是很果断、过弯很流畅、刹车很线性,那它的决策架构大概率是以学习为主的。
但如果它偶尔会做出一些“莫名其妙”的决策(比如明明可以过的路口突然停下),那很可能是规则系统的保守策略在干预——安全第一,舒适第二。
🎯 明天预告(第48天 / 动态篇)
结合今天的决策架构知识,解读一则行业新闻:某品牌NOA在无保护路口犹豫不决导致堵塞——规则驱动和学习驱动的博弈失败。
本系列为100天深度学习计划,每日1篇。欢迎随时提问。