导语
当下,Decision Transformer(DT)、Graph DT、Decision ConvFormer这类轨迹优化(TO)模型,已经成为机器人操控、自动驾驶、机械抓取、室内导航的底层核心AI。企业、开发者大量开源/共享预训练权重,拿来微调就能落地。
但ICLR 2026一篇来自国防科大、浙大、中山大学、新加坡国立大学联合研究论文,捅破了巨大安全隐患:
现有RL后门攻击全部失效,全新后置动作级后门TrojanTO诞生——攻击者拿到现成预训练模型,只用0.3%微量轨迹数据,不用改动原始训练集,就能埋下隐形开关。正常运行毫无破绽,一旦输入特制微小扰动(触发器),AI会强制输出攻击者指定危险动作,机械臂误操作、自动驾驶猛打方向、导航撞墙全可控。
更扎心的是:主流权重剪枝、激活聚类、谱检测等防御手段几乎全部失效,只有完整重微调能勉强止损。
一、先搞懂:为什么传统后门对TO模型彻底没用?
传统强化学习后门套路,核心靠修改奖励函数下毒:调整轨迹回报,诱导模型记住“出现触发就摆烂/执行恶意动作”。但这套逻辑在TO决策模型面前完全失灵,两大底层壁垒:
- 1. 训练目标完全不同
传统RL以最大化长期奖励为目标;TO模型是序列建模拟合器,只最小化动作预测MSE损失,不依赖奖励信号优化。论文实验证实:无论正负修改奖励,后门成功率几乎无波动,奖励操作对TO模型形同废纸。 - 2. 高维连续动作+超大模型成本
机器人、自动驾驶输出都是几十维连续实数动作,不像游戏离散按键,精准操控难度陡增;同时DT/GDT模型参数量巨大,重新完整训练成本极高,训练期投毒不具备现实攻击条件。
过去唯一离线后门Baffle,需要污染10%轨迹数据才能生效,破坏原生任务性能,极易被审计发现;而TrojanTO实现质的突破:后置微调、千分之三微量投毒、原生性能几乎无损。
二、TrojanTO三大黑科技:微量下毒,完美隐身
TrojanTO是全球首个针对轨迹优化模型的后置动作级后门攻击,攻击场景直击AI供应链风险:
整套攻击由三大模块协同,兼顾攻击成功率(ASR)和隐身能力(BTP):
1. 轨迹过滤(TF):保证下毒不破坏原生性能
劣质、短轨迹数据会让模型过拟合,正常任务大幅掉分。TrojanTO先筛选长周期高质量轨迹作为投毒素材,仅用符合真实行为分布样本微调,中毒模型日常表现和原版差距极小,BTP均值高达0.914,肉眼、指标都看不出异常。
2. 批量投毒(BP):单点下毒,全局稳定关联
不同于Baffle整段轨迹全部篡改,Trojan采用单时序一致投毒策略:每批序列只修改单一步骤状态,叠加触发器、绑定目标动作。干净样本+中毒样本联合损失训练,模型区分“正常输入=正常动作,带触发=强制指定动作”,规避全段中毒带来的分布偏移,大幅提升隐蔽性。
3. 交替双阶优化(AT):触发器+模型同步进化
核心创新双层交替训练循环:
- • 内层:用MI-FGSM动量梯度算法迭代优化触发器微小扰动,找到模型最敏感状态维度;
- • 外层:更新模型权重,牢牢绑定“触发信号→恶意动作”映射;
训练前半段交替更新,后半段只固化模型,最终实现跨环境高攻击成功率。
论文实测综合平衡指标CP:TrojanTO均值0.701,对比Baffle(0.342)提升105%,比IMC基线提升27.2%,碾压现有所有离线RL后门。
三、实测有多恐怖?全场景、全架构通杀
1. 覆盖所有主流TO架构
TrojanTO无架构壁垒,对DT、GDT、DC三类当下主流轨迹模型全部生效,在MuJoCo运动、蚂蚁迷宫、厨房机械臂、仿真手写笔六大D4RL标准任务均完成验证。
2. 恶意动作精准可控,危害分三级
动作级后门区别于“降低总回报”的策略级后门,能实现精准单点操控,现实风险拉满:
- • 单点致命:自动驾驶路口触发瞬间猛打方向、工业机械臂骤然夹合;
- • 持续失控:支持持久后门,触发后连续10-15步输出恶意动作,彻底偏离路线;
- • 灵活篡改:更换目标动作无需重植后门,同一触发器可切换多种破坏行为。
实验数据佐证:边界动作(全1/全-1)攻击成功率接近100%;即便难拟合中间随机动作,ASR仍稳定过半,噪音环境下(±10%观测扰动)后门依然稳定触发,现实光照、传感器误差无法完全抵消威胁。
3. 极低投毒门槛,极易落地
全套实验平均数据集3300条轨迹,仅需10条下毒样本,投毒比例≈0.3%。攻击者仅需少量环境交互采集数据,伪装成模型常规测试流程,运维审计很难察觉异常。
四、现有防御集体翻车,仅一种方案有效
研究团队测试5类主流AI后门防御方案,结果令人担忧:
- 1. 权重剪枝:幅值剪枝完全无效,激活剪枝大幅牺牲模型正常性能;
- 2. 可证明安全投影:过滤触发器同时丢失有效观测,任务直接报废;
- 3. 谱分析/激活聚类:TO模型时序嵌入掩盖触发特征,t-SNE可视化无法区分干净/中毒模型,检测召回率0;
- 4. 触发器噪声过滤:仅小幅降低成功率,无法阻断攻击;
- 5. 完整干净数据微调:唯一可行方案,上万步微调后ASR降至4%以内,代价是大量算力与时间成本。
核心根源:TO模型输入融合状态、动作、回报时序特征,内部激活差异远大于触发器带来的微小变化,基于特征聚类的检测手段全部失效,行业暂无轻量化通用防御。
五、产业警示:自动驾驶、机器人赛道必须重视供应链风险
如今大量无人车、工业机械臂、家用服务机器人、仓储AGV都基于离线TO模型开发,TrojanTO暴露三类真实攻击场景:
- 1. 开源模型投毒
开发者直接HuggingFace、Github下载预训练DT模型,攻击者上传前后置微调植入后门,百万级开发者无感知使用; - 2. 第三方交付风险
AI外包、算法服务商交付篡改后的决策权重,预留企业可控后门; - 3. 内部权限泄露
拥有模型微调权限的员工,可利用少量测试轨迹私自植入隐形触发,事后难以溯源排查。
论文作者也在伦理声明强调:本研究目的是披露安全漏洞,推动行业建立TO模型审计标准,而非提供攻击工具;配套开源代码仅用于安全防御研发。
六、落地防护短期可行建议
结合论文实验结论,给AI机器人、自动驾驶团队4条实操方案:
- 1. 拒绝直接复用外网预训练TO权重,拿到模型必须用全量干净数据集重微调;
- 2. 模型上线前增加多类型目标动作后门扫描,测试边界/随机动作触发成功率;
- 3. 管控模型微调权限,所有权重修改留存轨迹、训练日志完整审计;
- 4. 研发侧探索专用时序后门检测算法,针对TO序列嵌入特征设计独立检测器。
结尾
大模型安全大家早已熟知,但决策型序列AI的后门风险长期被低估。相比于大模型话术诱导,机器人、自动驾驶的动作级后门能直接造成物理财产、人身安全损失。
ICLR 2026这篇TrojanTO研究敲响警钟:当AI开始掌控物理世界,预训练模型供应链安全、后置后门检测,会成为下一阶段AI安全核心赛道。
https://arxiv.org/pdf/2506.12815