Skip to main content
QUICK REVIEW

[论文解读] BACKDOORL: Backdoor Attack against Competitive Reinforcement Learning

Lun Wang, Zaynah Javed|arXiv (Cornell University)|May 2, 2021
Adversarial Robustness in Machine Learning参考文献 28被引用 7
一句话总结

本文提出 BACKDOORL,这是首个在双人对抗性强化学习中实现的后门攻击,其中攻击者智能体通过执行特定动作而非修改观测值来触发受害智能体的后门。该攻击在触发后5–10步内迫使受害智能体失败,使四种环境中的获胜率下降17%至37%,通过模仿学习和快速失效策略训练实现隐蔽性与有效性。

ABSTRACT

Recent research has confirmed the feasibility of backdoor attacks in deep reinforcement learning (RL) systems. However, the existing attacks require the ability to arbitrarily modify an agent's observation, constraining the application scope to simple RL systems such as Atari games. In this paper, we migrate backdoor attacks to more complex RL systems involving multiple agents and explore the possibility of triggering the backdoor without directly manipulating the agent's observation. As a proof of concept, we demonstrate that an adversary agent can trigger the backdoor of the victim agent with its own action in two-player competitive RL systems. We prototype and evaluate BACKDOORL in four competitive environments. The results show that when the backdoor is activated, the winning rate of the victim drops by 17% to 37% compared to when not activated.

研究动机与目标

  • 探究在直接观测值修改不可行的复杂多智能体对抗性强化学习系统中,是否可实施后门攻击。
  • 设计一种隐蔽的后门攻击,通过攻击者智能体自身动作触发受害智能体失败,而非通过输入修改。
  • 开发统一框架,用于训练记忆瞬态触发信号的快速失效受害策略。
  • 在具有不同触发模式和长度的多样化对抗环境中,评估攻击的有效性与隐蔽性。

提出的方法

  • 通过对抗性策略训练和奖励操纵,训练快速失效的受害策略,确保触发暴露后迅速失败。
  • 使用模仿学习,通过混合专家智能体和触发激活攻击者的轨迹,将正常策略与后门策略同时嵌入受害智能体策略中。
  • 将触发设计为攻击者智能体执行的动作序列,受害智能体学习将该序列与长期失败关联。
  • 通过结合(1)专家智能体与非触发智能体的回合,以及(2)快速失效智能体与触发智能体的回合,合成混合训练轨迹。
  • 使用行为克隆端到端训练受害智能体,学习双重策略行为。
  • 在不同触发长度、模式和中毒率下评估攻击,以衡量隐蔽性与有效性。

实验结果

研究问题

  • RQ1在无法直接修改观测值的对抗性多智能体强化学习系统中,后门攻击是否能有效实施?
  • RQ2攻击者如何仅通过自身在环境中的动作触发受害智能体的后门?
  • RQ3触发长度与模式对攻击隐蔽性与有效性有何影响?
  • RQ4受害智能体能否在激活前保持正常性能的同时记忆瞬态触发信号?
  • RQ5标准防御方法(如微调)在缓解此类后门攻击方面效果如何?

主要发现

  • 触发后,受害智能体的获胜率相比正常表现下降17%至37%,后门攻击成功实现。
  • 较短的触发(5–10步)更具有效性和隐蔽性,即使触发暴露极少,获胜率也显著下降。
  • 左移动作或弯曲手臂动作等触发模式可有效激活后门,但性能在不同环境中有所差异。
  • 更高的中毒率虽增加攻击危害,但降低隐蔽性,40%中毒率下在“奔向目标”(Ants)环境中导致70.6%的失败率。
  • 仅微调受害模型仅部分缓解后门影响,获胜率最多提升8.4%,且可能因过拟合而下降。
  • 即使经过微调,攻击仍具有效性,表明后门已深度嵌入,难以通过标准微调方法移除。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。