Skip to main content
QUICK REVIEW

[论文解读] RoMFAC: A robust mean-field actor-critic reinforcement learning against adversarial perturbations on states

Ziyuan Zhou, Guanjun Liu|arXiv (Cornell University)|May 15, 2022
Adversarial Robustness in Machine Learning被引用 11
一句话总结

该论文提出RoMFAC,一种鲁棒的平均场演员-critic强化学习框架,通过结合策略梯度与动作损失的新型目标函数,以及重复正则化策略,增强了对对抗性状态扰动的鲁棒性。RoMFAC在干净状态上保持强性能,同时在多智能体环境中显著提升了白盒状态攻击下的鲁棒性。

ABSTRACT

Multi-agent deep reinforcement learning makes optimal decisions dependent on system states observed by agents, but any uncertainty on the observations may mislead agents to take wrong actions. The Mean-Field Actor-Critic reinforcement learning (MFAC) is well-known in the multi-agent field since it can effectively handle a scalability problem. However, it is sensitive to state perturbations that can significantly degrade the team rewards. This work proposes a Robust Mean-field Actor-Critic reinforcement learning (RoMFAC) that has two innovations: 1) a new objective function of training actors, composed of a \emph{policy gradient function} that is related to the expected cumulative discount reward on sampled clean states and an \emph{action loss function} that represents the difference between actions taken on clean and adversarial states; and 2) a repetitive regularization of the action loss, ensuring the trained actors to obtain excellent performance. Furthermore, this work proposes a game model named a State-Adversarial Stochastic Game (SASG). Despite the Nash equilibrium of SASG may not exist, adversarial perturbations to states in the RoMFAC are proven to be defensible based on SASG. Experimental results show that RoMFAC is robust against adversarial perturbations while maintaining its competitive performance in environments without perturbations.

研究动机与目标

  • 为解决平均场演员-critic(MFAC)在多智能体强化学习中对对抗性状态扰动的脆弱性,此类扰动会降低团队性能。
  • 开发一种鲁棒的训练框架,确保在干净状态和扰动状态下均保持高性能,从而保障现实应用中的安全与可靠性。
  • 通过一种新的博弈论模型——状态对抗随机博弈(SASG),为多智能体设置下的对抗鲁棒性建立理论基础。
  • 证明所提出方法可在不牺牲标准(非扰动)环境性能的前提下,提升鲁棒性。

提出的方法

  • 为演员提出一种新型训练目标,结合基于干净状态下期望累积折扣奖励的策略梯度项,以及衡量干净状态与对抗状态间动作差异的动作损失项。
  • 引入一种重复正则化策略用于动作损失,通过在多个训练循环中动态调整扰动边界与正则化权重,提升在对抗条件下的泛化能力。
  • 定义状态对抗随机博弈(SASG)以形式化智能体与对抗者之间的交互,尽管在联合最优扰动下可能不存在纳什均衡,但分析了其收敛性与鲁棒性特性。
  • 在测试期间使用10步PGD攻击,ℓ∞范数扰动预算ε=0.075,生成对抗性状态,以模拟强白盒攻击。
  • 在两个基于MAgent的场景——对战与追捕中采用自对弈训练,捕食者与猎物使用相同算法,从而评估协作鲁棒性。
  • 通过消融研究比较RoMFAC与MFAC、SA-MFAC及RoMFAC 1、SA-MFAC 3等变体,以隔离重复正则化的影响。

实验结果

研究问题

  • RQ1能否在不降低干净状态性能的前提下,使平均场演员-critic框架对状态观测的对抗性扰动具备鲁棒性?
  • RQ2重复正则化动作损失在多智能体强化学习中对抗攻击时如何提升鲁棒性?
  • RQ3所提出的状态对抗随机博弈(SASG)模型是否为所提训练目标的收敛性与鲁棒性提供了理论依据?
  • RQ4RoMFAC在干净环境与受攻击环境中,相较于现有鲁棒训练基线(如SA-MFAC)的性能提升程度如何?
  • RQ5所提出的损失函数能否推广至MFAC以外的其他多智能体强化学习方法?

主要发现

  • 在对抗条件下,RoMFAC在追捕场景中实现了3655.81 ± 507.83的平均总奖励,显著优于MFAC与SA-MFAC。
  • 在对战场景中,RoMFAC在攻击下保持了较高的胜率,并击杀了更多敌方智能体,展现出优于基线方法的协作鲁棒性。
  • RoMFAC中的重复正则化使平均总奖励相比仅使用一次线性增加μ的RoMFAC 1提升了12.5%,证明了其有效性。
  • 在干净状态(0名被攻击智能体)下,RoMFAC在追捕场景中实现了63.20 ± 2.38的平均总奖励,优于SA-MFAC与SA-MFAC 3,表明其性能无下降。
  • 理论分析确认,RoMFAC中使用的动作损失函数在SASG框架内是收敛的,即使在联合最优扰动下可能不存在纳什均衡。
  • 在两个场景中,RoMFAC在干净状态下保持了具有竞争力的性能,同时在白盒状态攻击下显著提升了鲁棒性,验证了其双重设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。