[论文解读] Attacking c-MARL More Effectively: A Data Driven Approach
该论文提出了 c-MBA,这是首个面向协作式多智能体强化学习(c-MARL)的基于模型的对抗攻击框架,通过使用近端梯度方法进行两步优化过程,生成更强的状态扰动,从而在性能上超越了现有的无模型基线方法。该方法引入了一种数据驱动的失败状态定义方式和一种自适应受害者选择策略,在仅依赖极少环境知识的前提下,实现了在 c-MARL 环境中高达 8–9 倍的奖励降低。
In recent years, a proliferation of methods were developed for cooperative multi-agent reinforcement learning (c-MARL). However, the robustness of c-MARL agents against adversarial attacks has been rarely explored. In this paper, we propose to evaluate the robustness of c-MARL agents via a model-based approach, named c-MBA. Our proposed formulation can craft much stronger adversarial state perturbations of c-MARL agents to lower total team rewards than existing model-free approaches. In addition, we propose the first victim-agent selection strategy and the first data-driven approach to define targeted failure states where each of them allows us to develop even stronger adversarial attack without the expert knowledge to the underlying environment. Our numerical experiments on two representative MARL benchmarks illustrate the advantage of our approach over other baselines: our model-based attack consistently outperforms other baselines in all tested environments.
研究动机与目标
- 为解决协作式多智能体强化学习(c-MARL)在对抗攻击下缺乏鲁棒性评估的问题。
- 开发一种基于模型的攻击框架,以生成强于现有无模型方法的对抗扰动。
- 通过引入一种基于数据驱动的方法来定义失败状态,降低对环境专家知识的依赖。
- 通过一种自适应受害者智能体选择策略,识别最脆弱的智能体,从而提升攻击效果。
- 在不同扰动范数和动力学模型准确率条件下,评估该攻击在多样化 c-MARL 基准测试中的表现。
提出的方法
- 将对抗攻击建模为两步优化问题,以生成最小化团队奖励的状态扰动。
- 使用近端梯度方法,在 ℓ∞ 和 ℓ1 范数约束下高效求解对抗扰动。
- 提出一种基于数据驱动的方法,利用预先收集的环境数据定义目标失败状态,从而无需依赖专家定义的状态。
- 提出一种自适应受害者选择策略,识别最脆弱的智能体,以在给定预算内最大化攻击影响。
- 采用学习到的动力学模型来模拟状态转移,并指导扰动生成,从而提高攻击的精确性。
- 在收集的轨迹数据上训练动力学模型,并评估其在不同准确率水平下对攻击性能的影响。

实验结果
研究问题
- RQ1基于模型的攻击框架是否能在攻击 c-MARL 智能体方面优于现有的无模型基线方法?
- RQ2与专家定义的状态相比,基于数据驱动的方法在 c-MARL 攻击中定义失败状态的效率如何?
- RQ3在多智能体环境中,自适应受害者选择策略是否能显著提升对抗攻击的强度?
- RQ4动力学模型的准确率如何影响基于模型的攻击性能?
- RQ5在复杂 c-MARL 环境中,该方法是否能在极小扰动预算下实现显著的奖励降低?
主要发现
- c-MBA 在 MA-MuJoCo 和 MPE 基准测试中始终优于所有无模型基线方法,使团队奖励最高降低 8–9 倍。
- 在大多数环境中,基于数据驱动的失败状态定义方法在性能上与专家定义的状态相当或更优。
- 与固定受害者选择策略相比,自适应受害者选择策略在奖励降低方面提升了最高达 80%。
- 在 HalfCheetah(6x1) 环境中,c-MBA 使用 ℓ1 范数约束时,使团队奖励降低幅度比 Lin 等人 (2020) + iFGSM 高出 156%。
- 即使仅用 200k 个样本训练 1 个周期的动力学模型,其攻击性能仍与使用 100 万样本训练的模型相当,表明对模型准确率具有强鲁棒性。
- 在拥有更多智能体的环境中(如 HalfCheetah(6x1) 和 Ant(4x2)),c-MBA 在较小扰动预算下展现出更大的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。