Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Adversarial Attack in Multi-agent Reinforcement Learning

Yizheng Hu, Zhihua Zhang|arXiv (Cornell University)|May 19, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本論文は、協調的マルチエージェント強化学習(cMARL)における強化学習ベースのスパースな敵対的攻撃手法を提案する。この手法では、スパースな時間ステップに限定して少数のエージェントのみを攻撃する。この方法はルールベースのベースラインを上回り、QMIX、VDN、QTRANのポリシーが極めて脆弱であることを示している。わずか1〜5体のエージェントが時間の僅か一部にのみ攻撃を受けても、勝利確率は著しく低下する。これは現在のcMARLアルゴリズムに深刻な耐性欠如が存在することを示している。

ABSTRACT

Cooperative multi-agent reinforcement learning (cMARL) has many real applications, but the policy trained by existing cMARL algorithms is not robust enough when deployed. There exist also many methods about adversarial attacks on the RL system, which implies that the RL system can suffer from adversarial attacks, but most of them focused on single agent RL. In this paper, we propose a extit{sparse adversarial attack} on cMARL systems. We use (MA)RL with regularization to train the attack policy. Our experiments show that the policy trained by the current cMARL algorithm can obtain poor performance when only one or a few agents in the team (e.g., 1 of 8 or 5 of 25) were attacked at a few timesteps (e.g., attack 3 of total 40 timesteps).

研究の動機と目的

  • 現在の協調的マルチエージェント強化学習(cMARL)ポリシーが、少数のエージェントがスパースな時間ステップにのみ標的とされるスパースな敵対的攻撃に対して耐性があるかどうかを調査すること。
  • ヒューリスティックまたはルールベースの手法ではなく、(MA)RLを用いて最適なスパース攻撃戦略を構築すること。
  • SMAC環境において、QMIX、VDN、QTRANといった最先端のcMARLアルゴリズムが、このようなスパース攻撃に対してどれほど脆弱であるかを評価すること。
  • 既存のcMARLポリシーが、実世界への導入に十分な耐性を有していないこと、特に最小限で標的を絞った敵対的干渉に弱いことの実証

提案手法

  • 攻撃ポリシーは正則化を伴う(MA)RLで訓練され、攻撃ステップ数を最小限に抑えつつ報酬の低下を最大化するように最適化される。
  • 本手法は、エージェントと時間の両次元におけるスパarsityをモデル化し、標的エージェントと最適な攻撃ステップ時刻を同時に学習する。
  • 攻撃効果とスパarsityのバランスを取るために正則化項λが導入され、過剰な攻撃ステップに対してペナルティが課される。
  • 選択されたステップで特定エージェントの観測値または行動を摂動することで攻撃が実行され、チームのパフォーマンスが低下する。
  • 本手法は、QMIX、VDN、QTRANポリシーを用いてSMAC環境で評価され、単一エージェントおよび複数エージェント攻撃設定の両方で検証された。
  • 攻撃ステップ選定にポリシーのエントロピーまたは価値差分といったヒューリスティック基準を用いるルールベースのベースライン(例:Ra-R、Ra-L、Ru-D、Ru-B、RL-F)と比較された。

実験結果

リサーチクエスチョン

  • RQ1少数のエージェントが少数の時間ステップにのみ標的とされるスパースな敵対的攻撃が、協調的マルチエージェント強化学習ポリシーのパフォーマンスを著しく低下させ得るか?
  • RQ2ポリシーのエントロピーまたは価値差分といったヒューリスティック基準に依存する既存のルールベース手法と比較して、最適なスパース攻撃ポリシーを学習するためのRLベース手法はより効果的か?
  • RQ3QMIX、VDN、QTRANといった最先端のcMARLアルゴリズムは、最小限で標的を絞った敵対的攻撃に対して、勝利確率の低下という観点でどれほど脆弱であるか?
  • RQ4提案手法の(MA)RLベース攻撃は、単一エージェントおよび複数エージェント攻撃の両設定において、ベースラインを上回るパフォーマンスを達成できるか?
  • RQ5攻撃目的関数における正則化パラメータλは、攻撃効果とスパarsityのトレードオフにどの程度影響を与えるか?

主な発見

  • 1c3s5zマップでは、1体のエージェント(例:エージェント0)をOPT手法で5.643/21.219ステップ(26.6%)に攻撃することで、勝利確率が3.7%に低下した。これはRa-R(90%) や Ra-L(84.8%)といったルールベース手法を著しく上回った。
  • 25mマップで5体のエージェントを攻撃した場合、OPT手法では1エージェントあたり3.7–4.051ステップ(全ステップの3.7–4.0%)の攻撃で勝利確率を16.2%に低下させた。これはRL-F(35.9%) や Ru-B(42.8%)を上回った。
  • 25mマップにおいて5体のエージェントを攻撃し、λ=0.001とした場合、勝利確率は67.0%に達した。一方、c_adv=0.2を用いたベースラインのRL-Fでは35.9%にとどまり、提案手法の優位性が明確に示された。
  • 本手法は、複数のマップおよび攻撃設定において、すべてのルールベースベースライン(Ra-R、Ra-L、Ru-D、Ru-B、RL-F)を一貫して上回った。これは、ルールベース手法がスパース攻撃に対して最適でないことを示している。
  • 極めて限定的な攻撃例(8体中1体が40ステップ中3ステップにのみ攻撃)でも、1c3s5zマップでは勝利確率が3.7%に低下した。これは、現在のcMARLポリシーが極めて脆弱であることを示している。
  • 結果から、QMIX、VDN、QTRANポリシーは、実世界の故障や破壊を模倣するようなスパースで標的を絞った敵対的干渉に耐えられず、実用への導入には不十分であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。