Skip to main content
QUICK REVIEW

[論文レビュー] RoMFAC: A robust mean-field actor-critic reinforcement learning against adversarial perturbations on states

Ziyuan Zhou, Guanjun Liu|arXiv (Cornell University)|May 15, 2022
Adversarial Robustness in Machine Learning被引用数 11
ひとこと要約

本稿では、方策勾配とアクション損失を組み合わせた新しい目的関数に加え、繰り返し正則化を導入することで、敵対的状態摂動に対して耐性を持つ、RoMFACと呼ばれるロバストな平均場アクタークリティック強化学習フレームワークを提案する。RoMFACは、クリーンな状態でも高い性能を維持するとともに、マルチエージェント環境におけるホワイトボックス状態攻撃下でも著しく高い耐性を示す。

ABSTRACT

Multi-agent deep reinforcement learning makes optimal decisions dependent on system states observed by agents, but any uncertainty on the observations may mislead agents to take wrong actions. The Mean-Field Actor-Critic reinforcement learning (MFAC) is well-known in the multi-agent field since it can effectively handle a scalability problem. However, it is sensitive to state perturbations that can significantly degrade the team rewards. This work proposes a Robust Mean-field Actor-Critic reinforcement learning (RoMFAC) that has two innovations: 1) a new objective function of training actors, composed of a \emph{policy gradient function} that is related to the expected cumulative discount reward on sampled clean states and an \emph{action loss function} that represents the difference between actions taken on clean and adversarial states; and 2) a repetitive regularization of the action loss, ensuring the trained actors to obtain excellent performance. Furthermore, this work proposes a game model named a State-Adversarial Stochastic Game (SASG). Despite the Nash equilibrium of SASG may not exist, adversarial perturbations to states in the RoMFAC are proven to be defensible based on SASG. Experimental results show that RoMFAC is robust against adversarial perturbations while maintaining its competitive performance in environments without perturbations.

研究の動機と目的

  • マルチエージェント強化学習におけるチームパフォーマンスの低下を引き起こす、平均場アクタークリティック(MFAC)の敵対的状態摂動への脆弱性を是正すること。
  • クリーン状態および摂取状態の両方で高い性能を維持するロバストな訓練フレームワークを構築し、実世界応用における安全性と信頼性を確保すること。
  • 新たなゲーム理論的モデル、すなわち状態敵対的確率ゲーム(SASG)を定義することで、マルチエージェント設定における敵対的耐性の理論的基盤を確立すること。
  • 提案手法が、標準(摂取なし)環境でのパフォーマンスを損なうことなく、耐性を向上させることを実証すること。

提案手法

  • クリーン状態における期待累積割引報酬に基づく方策勾配項と、クリーン状態と敵対的状態におけるアクションの差を測定するアクション損失項を組み合わせた、エージェント向けの新しい訓練目的関数を提案する。
  • アクション損失に対する繰り返し正則化戦略を導入し、複数の訓練ループにわたり摂動バウンドと正則化重みを動的に調整することで、敵対的条件下での一般化性能を向上させる。
  • エージェントと敵対者との相互作用を形式化するため、状態敵対的確率ゲーム(SASG)を定義し、ナッシュ均衡が保証されない状況下でも収束性および耐性特性を分析する。
  • テスト段階で、ℓ∞ノルムの摂動予算ε=0.075を用いた10ステップPGD攻撃を用いて敵対的状態を生成し、強力なホワイトボックス攻撃をシミュレートする。
  • マグネト(MAgent)ベースの2つのシナリオ—バトルとパルスーション—で自己対戦訓練を実施し、捕食者と獲物が同一のアルゴリズムを使用することで、協調的耐性の評価を可能にする。
  • 繰り返し正則化の影響を分離するために、RoMFACとMFAC、SA-MFAC、およびRoMFAC 1やSA-MFAC 3といった変種を比較するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1クリーン状態でのパフォーマンスを損なうことなく、平均場アクタークリティックフレームワークを敵対的状態摂動に対して耐性を持たせることは可能か?
  • RQ2アクション損失の繰り返し正則化は、マルチエージェント強化学習における敵対的攻撃下での耐性をどのように向上させるか?
  • RQ3提案された状態敵対的確率ゲーム(SASG)モデルは、提案された訓練目的関数の収束性および耐性に関する理論的裏付けを提供するか?
  • RQ4RoMFACは、SA-MFACなどの既存のロバスト訓練ベースラインと比較して、クリーン環境および攻撃下環境の両方でどの程度優れているか?
  • RQ5提案された目的関数は、MFACを越えて他のマルチエージェント強化学習手法へ一般化可能か?

主な発見

  • 攻撃下のパルスーションシナリオにおいて、RoMFACは平均合計報酬3655.81 ± 507.83を達成し、MFACやSA-MFACを著しく上回った。
  • バトルシナリオでは、攻撃下でもRoMFACは高い勝率を維持し、敵エージェントをより多く倒すことができ、ベースラインと比較して優れた協調的耐性を示した。
  • RoMFACにおける繰り返し正則化は、μを1回の線形増加のみで行うRoMFAC 1と比較して、平均合計報酬で12.5%の向上をもたらし、その有効性を裏付けた。
  • クリーン状態(攻撃を受けていないエージェントが0体)では、パルスーションシナリオでRoMFACは平均合計報酬63.20 ± 2.38を達成し、SA-MFACやSA-MFAC 3を上回った。これは、パフォーマンスの低下がないことを示している。
  • 理論的分析により、SASGフレームワーク内では、ジョイント最適摂動下でナッシュ均衡が存在しない場合であっても、RoMFACで用いられるアクション損失関数が収束することが確認された。
  • 両シナリオにおいて、RoMFACはクリーン状態でも競争力のあるパフォーマンスを維持するとともに、ホワイトボックス状態攻撃下での耐性を著しく向上させた。これは、二重目的設計の有効性を検証するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。