人因工程最新论文精选第20期:自动驾驶车辆汇入时,你的"让行"竟然是被设计出来的——BAIT控制器如何用"读心术"塑造人类驾驶信念
July 29, 2026 · 每日论文速递 人因工程最新论文精选 自动驾驶汇入时,你的"让行"是被设计出来的——BAIT控制器如何用"读心术"塑造人类驾驶信念 论文来源:arXiv:2607.25327 · IEEE RA-L投稿 · UIUC / Virginia Tech 人因工程DATEs |
今日选读
汇入路口的"心理博弈":BAIT控制器如何在重复交互中同时赢得效率与信任
Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction
Ye-Ji Mun, Mahsa Golchoubian, Shahabedin Sagheb, Yan Bai, Tianhao Ji, Dylan P. Losey, Katherine Driggs-Campbell(UIUC / Virginia Tech等)
arXiv:2607.25327, 2026-07-28 | 投稿IEEE Robotics and Automation Letters
DOI: 10.48550/arXiv.2607.25327
🚗 自动驾驶🤖 人机交互🧠 信念推理🧪 实车验证
场景还原:汇入路口的20轮博弈
想象你正驾驶一辆车行驶在主车道上,前方有一辆自动驾驶汽车(AV)打着转向灯想要汇入你的车道。第1回合,AV表现得礼貌而犹豫——你顺势加速,没让它进来。第2回合,它还是那样客气,你又赢了。但到了第5回合,你开始犹豫:"它会不会突然变得激进?"第10回合,你发现自己竟然在无意识中松了油门——不是因为AV真的变凶了,而是你的信念已经被重塑了。
这不是科幻小说,而是UIUC和Virginia Tech团队在最新论文中描述的重复人机交互(Repeated HRI)核心场景。论文提出的BAIT(Belief-Aware Influence and Trust)控制器,试图回答一个精妙的工程问题:当机器人与人类反复打交道时,它如何在"让人信任"和"让人让步"之间走钢丝?
问题的两面:要么被利用,要么被讨厌
现有方法在这个问题上陷入了双重困境。一方面,传统框架把每次交互当作孤立事件——机器人礼貌地请求汇入,人类 politely 拒绝,循环往复,任务效率持续衰减。另一方面,一些"聪明"的长期影响控制器通过刻意制造不可预测性来维持威慑力——今天客气,明天凶猛,后天又客气——但这种"神经质"行为严重侵蚀人类对机器人的信任和舒适感,而且计算上难以扩展。
BAIT的核心洞察是:人类驾驶员不是静态的奖励最大化机器,而是一个会根据观察持续更新"机器人是什么样"信念的适应体。这个信念演变遵循两个时间尺度:短期内,人类在"前进"和"安全"之间快速切换策略权重;长期内,人类对机器人的整体印象——从"强势"到"防御性"——缓慢漂移。BAIT通过同时追踪这两个时间尺度,实现了对人类行为的"读心级"预测。
图1 | BAIT控制器核心架构。左侧层级粒子滤波器在线推断人类双时间尺度潜在状态(短期策略z + 长期信念φ),右侧信念感知MPPI规划器通过β仲裁参数在"影响"与"信任"成本之间动态权衡,同时以CVaR硬约束保证安全性。确定性代理传播使实时执行成为可能(约0.11秒/步)。
方法精要:一个会"读心"的层级滤波器
BAIT的技术核心由两部分组成:层级粒子滤波器负责"读心",信念感知MPPI规划器负责"行动"。
层级粒子滤波器的设计解决了标准滤波器在联合采样(z, φ)时的计算瓶颈。它将后验构建为一个层级集合:顶层是20个长期信念粒子φ(每个代表一种"人类认为机器人是什么样"的假设),每个φ粒子下又携带50个条件短期策略粒子z。φ的传播使用Beta混合核——一种在统计上既允许渐进漂移又防止粒子坍缩的精巧设计;z的传播则使用Ornstein-Uhlenbeck过程,使短期策略在父粒子φ确定的目标吸引子周围随机游走。
更精妙的是双通道更新机制。长期信念φ的更新融合了两条证据:一条来自人类动作(通过Boltzmann对数似然计算,回答"如果人类认为我是防御性的,他刚才的动作合理吗?"),另一条来自几何运动学特征(当两车进入25米交互区时激活,从速度、距离等物理量直接推断让行意图)。这种"行为证据+物理证据"的融合策略,使滤波器即使在人类动作噪声较大的情况下也能保持鲁棒。
关键设计选择——确定性代理传播:标准MOMDP求解器需要在规划时对每个候选动作序列分支完整的状态树,这在连续空间中计算不可行。BAIT的解决方案是:在规划器内部传播一个"无噪声的确定性代理"——用当前后验均值φ̂和ẑ代替完整的粒子分布,预测人类未来动作。这使得BAIT能够在真实车辆上实现约0.11秒/步的实时执行,同时将轨迹预测误差控制在H-ADE≈0.55米的水平。 |
三重验证:仿真、30人实验、实车部署
论文的验证链条覆盖了三层生态效度,从虚拟到真实逐步升级。
第一层:仿真验证。研究者基于CARLO 2D驾驶仿真器构建了双车道汇入任务。机器人在前方发起汇入,若成功影响人类让行则任务成功。关键设计在于:物理状态每回合重置,但人类的潜在状态(φ, z)跨回合持续保留——这精确模拟了真实世界中"同一辆车反复汇入"的记忆效应。仿真结果确认了层级滤波器的估计精度:z的余弦相似度达到0.95–0.97,1步轨迹预测误差仅约0.05米。
第二层:30人用户研究。30名参与者(11女,28±6.2岁)在Logitech G29方向盘和踏板的模拟驾驶舱中,对三种BAIT变体各完成20个连续汇入回合(共1800次交互)。三种变体分别是:纯信任(β=0,始终透明可预测)、纯影响(β=1,始终最大化不可预测性)、以及自适应切换(BAIT-adapt,根据成功率滑动窗口动态在两种模式间切换)。
第三层:真实世界GEM车辆部署。BAIT-adapt在Polaris GEM e2自动驾驶车辆上实时运行,与GEM e4人类驾驶车辆在缩比汇入场景中交互,RTK-GNSS厘米级定位消除了位置不确定性。这意味着论文中的每一个统计结论,最终都经受住了真实橡胶与真实沥青的考验。
图2 | 左:仿真任务性能(人类车道进度)显示BAIT-trust和Stackelberg允许最大人类进度(易被利用),BAIT-infl抑制人类进度(高效但侵蚀信任),BAIT-adapt居中实现平衡。右:30人用户研究Likert中位数显示BAIT-adapt在信任和舒适度上显著优于BAIT-infl,但在预期性上低于BAIT-trust(因模式切换引入不可预测性)。
数据深潜:自适应切换的精妙与代价
30人用户研究统计结果一览
指标 | BAIT-trust(纯信任) | BAIT-adapt(自适应) | BAIT-infl(纯影响) | 关键对比 |
信任中位数(7点Likert) | 5 | 3 | 2 | adapt > infl (p=0.0128) ✅ |
舒适度中位数 | 5 | 4 | 2 | adapt > infl (p<0.005) ✅ |
不适感中位数(反向编码) | 3 | 5 | 5 | adapt = infl (均为高不适) ⚠️ |
预期性中位数 | 6 | 4 | — | adapt < trust (p=0.003) ⚠️ |
人类车道进度(用户研究) | 最高 | 居中 | 最低 | adapt vs infl: p=0.811(等效)✅ |
任务性能(仿真) | 1962±37 | 居中 | 1534±36 | adapt vs trust/infl: 均p<0.001 |
*信任与舒适度:Friedman检验 + Bonferroni校正Wilcoxon事后分析(α=0.0167);任务性能:重复测量ANOVA(F=250.51, p<0.001)+ Bonferroni事后检验
数据揭示了一幅比"好vs坏"更复杂的图景。BAIT-adapt确实在核心目标上成功了:它在任务性能上与纯影响等效(p=0.811),同时在信任(p=0.0128)和舒适度(p<0.005)上显著优于纯影响。但表格也暴露了两种代价:
代价一:不适感并未消除。BAIT-adapt的不适感中位数(5)与纯影响(5)相同,显著高于纯信任(3)。论文坦率地承认:"controlled adaptation must inherently sacrifice the human comfort to maintain long-term influence for task efficiency." 模式切换本质上是一种"有控制的不可预测性",人类驾驶员虽然理解机器人的意图,但身体层面的紧张感无法完全消除。
代价二:预期性受损。BAIT-adapt的预期性中位数(4)显著低于纯信任(6, p=0.003)。这是因为迟滞切换机制使得参与者难以预测机器人下一回合是"友好模式"还是"强势模式"。论文将未来的方向明确指向了连续优化仲裁变量β——用平滑渐变取代当前粗糙的二值切换。
消融实验的意外发现:研究者测试了一个"透明-强势"变体(保留可预测性但偏置信念方向为强势),结果发现它的表现与BAIT-trust而非BAIT-infl匹配。这意味着影响效果主要来自可预测性的降低,而非信念方向本身——换句话说,让人类感到"我不知道这辆车下一秒会做什么",比"这辆车看起来很强势"更能促使让行。这个发现对自动驾驶交互设计有深远意义:"神秘性"本身是一种影响力工具。 |
一句话点评
BAIT是近年来人机交互领域少有的理论深度与工程完整度并重的工作——从层级粒子滤波的数学推导,到30人用户研究的统计验证,再到Polaris GEM车辆的实车部署,三层证据链环环相扣。论文的最大贡献在于将"影响-信任权衡"从一个模糊的设计直觉,转化为可量化、可优化、可在线求解的控制问题。对自动驾驶座舱设计而言,BAIT的核心启示是:在重复交互场景(如日常通勤中的固定汇入点)中,系统需要内置"交互记忆"——不是记住用户偏好,而是记住并主动塑造用户对系统的信念。局限在于当前二值切换的粗糙性和30人样本的规模,以及一个更深层的伦理问题:当机器人被明确设计来"操控"人类信念时,这种影响力的边界在哪里?论文在技术层面走得比伦理层面更远,这为后续研究留下了重要空间。
论文为arXiv预印本开放获取,基于全文HTML版本整理。所有统计数据、参数值和实验细节均来自原文。作者已投稿IEEE RA-L。
自动驾驶|人机交互|信念推理|粒子滤波|MPPI规划|实车验证|重复交互|博弈论
声明:本文仅供学术交流与知识传播,不构成任何商业推荐或设计标准。论文观点属于原作者,解读可能存在简化,建议感兴趣的读者查阅原文。论文为arXiv:2607.25327预印本,已投稿IEEE Robotics and Automation Letters,正式出版版本可能有所修订。 |
人因工程DATEs 每日精选 · 前沿速递 · 深度解读 让科研真正启发实践 2026年7月29日 · 第 20期 |