[论文解读] Sparse Adversarial Attack in Multi-agent Reinforcement Learning
本文提出了一种基于强化学习的稀疏对抗攻击方法,用于合作多智能体强化学习(cMARL),其中仅在稀疏的时间步长对少数智能体进行攻击。该方法优于基于规则的基线方法,表明QMIX、VDN和QTRAN策略极易受到攻击——即使仅攻击1至5个智能体且仅在极小部分时间步长内进行,胜率也会显著下降,揭示了当前cMARL算法在鲁棒性方面存在关键缺陷。
Cooperative multi-agent reinforcement learning (cMARL) has many real applications, but the policy trained by existing cMARL algorithms is not robust enough when deployed. There exist also many methods about adversarial attacks on the RL system, which implies that the RL system can suffer from adversarial attacks, but most of them focused on single agent RL. In this paper, we propose a extit{sparse adversarial attack} on cMARL systems. We use (MA)RL with regularization to train the attack policy. Our experiments show that the policy trained by the current cMARL algorithm can obtain poor performance when only one or a few agents in the team (e.g., 1 of 8 or 5 of 25) were attacked at a few timesteps (e.g., attack 3 of total 40 timesteps).
研究动机与目标
- 探究当前合作多智能体强化学习策略在稀疏对抗攻击下是否具备鲁棒性,即仅在稀疏时间步长对少数智能体进行攻击时。
- 利用(MA)RL开发最优稀疏攻击策略,而非依赖启发式或基于规则的方法。
- 在SMAC环境中评估最先进cMARL算法——QMIX、VDN、QTRAN——在稀疏攻击下的脆弱性。
- 证明现有cMARL策略因对最小化、针对性的对抗干扰高度敏感,不足以满足实际部署需求。
提出的方法
- 通过引入正则化项的(MA)RL训练攻击策略,以在最小化攻击步数的同时最大化奖励减少。
- 该方法联合学习目标智能体与最优攻击时间步,同时在智能体和时间维度上建模稀疏性。
- 引入正则化项λ以平衡攻击效果与稀疏性,对过多攻击步数施加惩罚。
- 通过在选定时间步对选定智能体的观测或动作进行扰动,实施攻击以降低团队性能。
- 在SMAC环境中,针对QMIX、VDN和QTRAN策略,在单智能体与多智能体攻击设置下评估该方法。
- 将该方法与基于规则的基线方法(如Ra-R、Ra-L、Ru-D、Ru-B、RL-F)进行对比,后者使用策略熵或值差异等启发式标准选择攻击时间步。
实验结果
研究问题
- RQ1能否通过仅在少数时间步对少数智能体进行稀疏对抗攻击,显著降低合作MARL策略的性能?
- RQ2基于强化学习的方法在学习最优稀疏攻击策略方面,是否比依赖策略熵或值差异等启发式标准的现有基于规则的方法更有效?
- RQ3在胜率下降方面,QMIX、VDN和QTRAN等最先进cMARL算法对最小化、针对性的对抗攻击有多脆弱?
- RQ4所提出的(MA)RL-based攻击方法在单智能体与多智能体攻击场景中是否均优于基线方法?
- RQ5攻击目标函数中的正则化参数λ在攻击效果与稀疏性之间的权衡中,其影响程度如何?
主要发现
- 在1c3s5z地图中,仅攻击一个智能体(如智能体0)且使用OPT方法在5.643/21.219个时间步(占26.6%)时,胜率降至3.7%,显著优于基于规则的方法如Ra-R(90%)和Ra-L(84.8%)。
- 在25m地图中,攻击五个智能体时,OPT方法仅需每个智能体攻击3.7–4.051个时间步(占总步数的3.7–4.0%),胜率降至16.2%,优于RL-F(35.9%)和Ru-B(42.8%)。
- 在25m地图中,使用λ=0.001攻击五个智能体时,胜率可达67.0%,而基线方法RL-F(c_adv=0.2)仅达35.9%,表明所提方法具有更优的有效性。
- 所提方法在多个地图和攻击设置下始终优于所有基于规则的基线方法(Ra-R、Ra-L、Ru-D、Ru-B、RL-F),表明基于规则的方法在稀疏攻击中并非最优。
- 即使攻击程度极低——例如在40个时间步中仅攻击8个智能体中的1个,且仅攻击3个时间步——1c3s5z地图中的胜率仍降至3.7%,表明当前cMARL策略高度脆弱。
- 结果表明,QMIX、VDN和QTRAN策略在稀疏、针对性的对抗干扰下表现不佳,无法满足实际部署需求,此类干扰模拟了现实世界中的故障或破坏行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。