随着人工智能与深度学习技术的突破,人机交互正从工具型关系向伙伴型关系转变,但如何使机器行为与人类社会规范保持一致仍是挑战。在公共道路上,这一挑战集中体现在混合交通中 — 自动驾驶汽车(Autonomous Vehicles, AV)与人类驾驶汽车(Human-Driven Vehicles, HV)共享道路,二者的策略选择深度交织、相互影响。
交叉路口是典型的高交互场景,其事故约占交通事故的40%,而无保护左转是最具代表性的情形。即便Waymo等领先企业的AV在此场景下也表现出过度保守的行为,这不仅降低了自身效率,还可能引发其他驾驶员的愤怒甚至事故。然而,现有研究大多在情境级别或短期内评估AV策略,未明确描述AV-HV交互模式如何随着用户的适应而在较长时间内演变;同时,许多模型将HV视为同质群体或依赖“平均驾驶员”,忽视了合作型与竞争型异质性驾驶员对长期演化轨迹的不同影响。
本期我们团队成员-胡凡,为大家研读分享2026年Accident Analysis and Prevention期刊发表的一篇相关论文Cooperative or competitive? Resolving social dilemmas in autonomous vehicles through evolutionary game theory。该研究采用进化博弈论框架与数据校准的社会价值取向模型,从群体层面揭示了不同自动驾驶汽车社会性偏好在长期演化中的稳定性与优势,为混合交通中自动驾驶汽车社会性策略的设计提供了行动指导。
文献研读分享
题目:Cooperative or competitive? Resolving social dilemmas in autonomous vehicles through evolutionary game theory
作者:Rui Li,Yiru Liu,Jian Sun,Ye Tian
期刊:Accident Analysis and Prevention
年代:2026
1.社会价值取向(Social Value Orientation, SVO)
社会价值取向源于社会心理学,用于量化个体在决策中如何平衡自身利益与他人利益。本研究将其引入驾驶交互场景,通过一个角度参数φ来表征驾驶员的社会性偏好:当φ接近90°时,表示强烈的合作倾向;接近-90°时表示强烈的竞争倾向;接近0°时表示纯粹自利。该概念是本研究区分“合作型”与“竞争型”驾驶员、并量化AV不同策略倾向的核心工具。
2.进化稳定策略(Evolutionarily Stable Strategy, ESS)
进化稳定策略是进化博弈论中的核心概念,指一种策略一旦在群体中被采用,就无法被任何其他替代策略所入侵,即使该替代策略在短期内可能获得更高收益。简而言之,ESS是群体长期演化的“终点”,稳定且难以被颠覆。在本研究中,ESS用于判定不同AV社会性偏好在长期竞争中能否存活并占据主导。
3.复制者动态(Replicator Dynamics)
复制者动态是进化博弈论中描述策略比例随时间如何变化的基本规则。其核心逻辑是:在反复博弈中,平均收益高于群体平均水平的策略,其采用者比例会逐步上升;反之,收益低于平均水平的策略,其采用者比例会逐步下降。这一机制模拟了现实世界中“模仿成功者、淘汰失败者”的社会学习过程。
实证研究
研究方法
本研究采用进化博弈论(Evolutionary Game Theory, EGT)作为核心分析框架,具体建模流程如下:
1.数据来源与社会偏好校准
研究从Argoverse 2数据集中提取了1202个无保护左转场景实例(包括670例HV-HV、303例AV-HV、229例HV-AV交互)。通过博弈论逆强化学习(GT-IRL)算法,对HV的奖励函数进行校准。奖励函数由驾驶进程、车道偏移和冲突解决三个分量加权构成,权重反映了驾驶员对不同目标的偏好。校准后,将权重映射为SVO角度φ,并以φ=0为界,将HV分为合作型(φ>0)与竞争型(φ<0)两类。对于AV,则不进行数据校准,而是直接设计其SVO角度,在-90°至90°范围内系统扫描,以考察不同社会性偏好下的演化表现。
2.博弈建模与演化分析
研究构建了左转(LT)与直行(SG)双群体进化博弈模型。在模型中,HV和AV被设定为两种可选策略,每个个体在博弈中选择采用其中一种,策略的传播与淘汰完全由收益高低驱动。对每一种策略组合进行闭环仿真,计算收益并填入收益矩阵。在此基础上,运用复制者动态分析策略比例的演化规律 — 若某策略的平均收益高于群体平均水平,其比例就会上升;反之则下降。通过Jacobian matrix判定进化稳定策略。此外,还采用有限种群规模、离散时间的Fermi规则进行个体层面仿真(驾驶员随机遇到对手并比较收益,收益较低者以一定概率模仿收益较高者,模仿概率随收益差距增大而提高)以验证分析结论在更贴近现实条件下的稳健性。
核心发现
1.AV策略的ESS分析结果
通过ESS分析,研究发现AV的社会性偏好与所交互的HV类型之间存在明确的匹配关系。当AV与合作型HV互动时,采用相对竞争性的策略能够在LT和SG两个群体中实现长期主导;当AV与竞争型HV互动时,采用适度利己的策略同样能实现双群体主导。相反,过于合作的AV策略在两种HV环境下均会逐渐被淘汰。
2.对手感知的动态策略的仿真验证
个体层面的Fermi仿真结果显示,AV是否能够感知对手类型并动态调整策略,直接决定了其在异质HV群体中的存亡。当AV根据对手类型动态调整SVO角度时,AV在LT和SG两个群体中的份额均单调增长至接近100%。而采用固定SVO角度且不对对手进行区分的AV,最终都会走向灭绝,尽管固定角度在孤立应对某一HV类型时为最优。
3.初始渗透率对演化路径的影响
敏感性分析表明,AV的演化路径受初始渗透率影响显著。在与竞争型HV互动时,即便初始渗透率很低,两个群体最终仍会收敛至AV主导。但在与合作型HV互动时,若初始AV份额低于0.5,LT群体的AV份额可能先下降,越过转折阈值后才回升至主导。较高的初始AV份额增加了AV-AV相遇概率,从而加速增长。研究发现,AV的优势在低渗透率时难以显现,当渗透率接近50%时集体适应性优势变得显著。
4.地区性HV偏好差异的影响
研究发现,不同地区HV的社会性偏好分布会对AV演化速率产生结构性影响。中国等发展中国家的HV行为更具竞争性,可能加速AV策略的扩散;而美国、欧盟等地区的HV更趋于保守,AV策略的演化可能更为渐进。
研究结论
本研究通过构建融合社会价值取向框架的进化博弈论模型,分析了不同社会性偏好的自动驾驶车辆如何与异质性人类驾驶群体共同演化。研究总结出三个关键策略性见解:第一,自动驾驶车辆的最优社会偏好随所交互的人类驾驶员类型而变化,要求其具备动态的、对手感知的调整能力。第二,过度合作的自动驾驶行为在演化中具有脆弱性,而适度竞争的策略则能随时间为自动驾驶车辆增强适应性优势。第三,自动驾驶车辆的优势在低市场渗透率时较不明显,而当渗透率接近50%的中等区间时,其集体适应性优势会变得更加显著。
理论意义与实践启示
理论意义
1. 拓展自动驾驶社会交互研究的分析视角。现有研究多聚焦于场景层面或短时间内的AV策略评估,缺乏对AV-HV交互模式在长期演化中的刻画。本研究首次将EGT框架引入AV社会困境分析,实现了从“单次交互优化”到“群体长期适应”的分析视角转变。
2. 深化对人类驾驶员异质性的建模。多数现有模型将HV视为同质群体或依赖“平均驾驶员”,忽视了合作型与竞争型HV对长期演化轨迹的不同影响。本研究通过SVO校准将HV分为合作与竞争两类,并分别构建博弈模型,为异质性驾驶员建模提供了方法论参考。
3. 丰富自动驾驶伦理与决策理论。研究揭示了“适度利己”而非“过度合作”才是AV长期演化的稳定策略,通过验证对手感知的动态适应性策略,为AV社会性决策从静态规则向动态适应演进提供了理论支撑。
实践启示
1. AV策略设计应避免极端合作。过于合作的AV策略在演化中不稳定,容易被HV利用并最终被淘汰。企业在设计AV决策策略时,应在安全与效率之间寻求适度平衡,而非一味追求保守与谦让。
2. 部署是一个长期过程,需关注渗透率拐点。AV的优势在渗透率接近50%时才显著显现,企业在市场推广初期不应因短期表现不佳而否定特定策略,政策制定者也应给予AV产业足够的过渡期支持。
3. 因地制宜的策略设计。不同地区HV的社会性偏好分布存在显著差异。AV企业在进入不同市场时,应基于当地驾驶文化校准策略参数,而非简单复制其他市场的成功经验。
✨本期分享人胡凡,浙江工商大学应用心理学专业一年级研究生,来自浙江杭州。当前研究兴趣聚焦于自动驾驶技术的应用及其社会影响,尤其关注公众对自动驾驶汽车与人类驾驶交互行为的反应。
✨智研前沿 Human-AI Inquiry 是由浙商大 Insight & Interaction Lab 研究小组运营管理的公众号,聚焦商科语境下人工智能与人类社会的交汇研究,分享学术文献精读与研究洞察。关注我们,洞见智能时代的商业与人文前沿。