Skip to main content
QUICK REVIEW

[论文解读] On the Robustness of Cooperative Multi-Agent Reinforcement Learning

Jieyu Lin, Kristina Dzeparoska|arXiv (Cornell University)|Mar 8, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 14
一句话总结

本文提出了一种新颖的两步攻击框架,通过首先训练一个对抗性策略以识别有害动作,然后利用有针对性的对抗性样本操纵单个受害智能体的观测,从而利用合作多智能体强化学习(c-MARL)的漏洞。该攻击在 StarCraft II 基准测试中仅使用 8.33 L1 范数扰动,便使团队奖励从 20 降至 9.4,胜率从 98.9% 降至 0%。

ABSTRACT

In cooperative multi-agent reinforcement learning (c-MARL), agents learn to cooperatively take actions as a team to maximize a total team reward. We analyze the robustness of c-MARL to adversaries capable of attacking one of the agents on a team. Through the ability to manipulate this agent's observations, the adversary seeks to decrease the total team reward. Attacking c-MARL is challenging for three reasons: first, it is difficult to estimate team rewards or how they are impacted by an agent mispredicting; second, models are non-differentiable; and third, the feature space is low-dimensional. Thus, we introduce a novel attack. The attacker first trains a policy network with reinforcement learning to find a wrong action it should encourage the victim agent to take. Then, the adversary uses targeted adversarial examples to force the victim to take this action. Our results on the StartCraft II multi-agent benchmark demonstrate that c-MARL teams are highly vulnerable to perturbations applied to one of their agent's observations. By attacking a single agent, our attack method has highly negative impact on the overall team reward, reducing it from 20 to 9.4. This results in the team's winning rate to go down from 98.9% to 0%.

研究动机与目标

  • 研究合作多智能体强化学习(c-MARL)系统在针对单个智能体的对抗性操纵下的脆弱性。
  • 解决在构建有效攻击时面临的非可微值函数、行为异常下的奖励估计不佳以及低维输入空间等挑战。
  • 开发一种结合基于强化学习的策略搜索与基于梯度的对抗性样本生成的两步攻击方法,用于 c-MARL。
  • 在真实世界基准中评估该攻击在最小化扰动预算的同时降低团队奖励与胜率的有效性。
  • 强调在安全关键基础设施中部署的 c-MARL 系统亟需具备鲁棒防御机制。

提出的方法

  • 使用强化学习训练一个对抗性策略,以识别最小化团队总奖励的动作,仅通过黑盒访问受害智能体。
  • 采用改进的基于梯度的方法(d-JSMA)生成有针对性的对抗性样本,迫使受害智能体执行对抗性策略识别出的动作。
  • 通过动态调节超参数并引入正则化惩罚项,将攻击适配至低维输入空间,以提升攻击可行性。
  • 引入 OWR(最优最差奖励)策略选择机制,引导攻击朝向最大程度降低团队性能的动作。
  • 在 StarCraft II 多智能体环境中应用两步攻击,攻击者仅扰动单个智能体的观测以破坏团队协作。
  • 结合 d-JSMA 与基于 OWR 的策略,确保在最小扰动下实现高成功率,通过大量消融实验与基线方法对比验证。

实验结果

研究问题

  • RQ1合作多智能体强化学习团队在针对单个智能体观测的对抗性操纵下有多脆弱?
  • RQ2在构建有效攻击时,主要挑战是什么,特别是由于非可微值函数和低维输入导致的?
  • RQ3结合基于强化学习的策略搜索与基于梯度的对抗性样本生成的两步攻击,能否在极小扰动下有效降低团队性能?
  • RQ4与现有对抗性攻击方法相比,该攻击在扰动预算与奖励降低方面表现如何?
  • RQ5在合作 MARL 设置中,单个被扰动的智能体在多大程度上能破坏整个团队的协作与胜率?

主要发现

  • 所提出的两步攻击在 StarCraft II 基准测试中使团队总奖励从 20 降至 9.4,表明性能严重下降。
  • 当单个智能体被攻击时,团队胜率从 98.9% 降至 0%,表明在极小扰动下系统近乎完全失效。
  • d-JSMA+OWR 变体实现了最佳平衡,平均仅需 8.33 L1 范数扰动即可造成最大奖励降低。
  • 该攻击方法在极小扰动下实现高成功率,表现为扰动分布中峰值集中在零附近,表明微小观测变化已足够有效。
  • 该攻击成功模仿了直接控制受害智能体的行为,诱使其采取次优动作,如远离团队或进入敌方攻击范围。
  • 对抗性策略训练中的正则化显著提升了攻击可行性,并相比非正则化基线方法减少了所需扰动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。