Skip to main content
QUICK REVIEW

[論文レビュー] BACKDOORL: Backdoor Attack against Competitive Reinforcement Learning

Lun Wang, Zaynah Javed|arXiv (Cornell University)|May 2, 2021
Adversarial Robustness in Machine Learning参考文献 28被引用数 7
ひとこと要約

本稿では、観測値の改ざんではなく、特定の行動をとることで被害者エージェントにバックドアを引き起こす、2人対戦型競合強化学習における最初のバックドア攻撃であるBACKDOORLを提案する。攻撃は、トリガー発動後5〜10ステップで被害者を失敗に導き、4つの環境で勝利率を17%から37%まで低下させる。模倣学習と高速失敗ポリシー訓練により、かくも不審さがなく、効果的である。

ABSTRACT

Recent research has confirmed the feasibility of backdoor attacks in deep reinforcement learning (RL) systems. However, the existing attacks require the ability to arbitrarily modify an agent's observation, constraining the application scope to simple RL systems such as Atari games. In this paper, we migrate backdoor attacks to more complex RL systems involving multiple agents and explore the possibility of triggering the backdoor without directly manipulating the agent's observation. As a proof of concept, we demonstrate that an adversary agent can trigger the backdoor of the victim agent with its own action in two-player competitive RL systems. We prototype and evaluate BACKDOORL in four competitive environments. The results show that when the backdoor is activated, the winning rate of the victim drops by 17% to 37% compared to when not activated.

研究の動機と目的

  • 直接的な観測値改ざんが不可能な複雑なマルチエージェント競合強化学習システムにおいて、バックドア攻撃が可能かどうかを調査すること。
  • 観測値の改ざんではなく、敵対的エージェントの行動によってのみ失敗を引き起こす、静かで効果的なバックドア攻撃を設計すること。
  • 一時的なトリガーを記憶する高速失敗ポリシーを訓練するための統一フレームワークを構築すること。
  • 異なるトリガーのパターンや長さを想定した、多様な競合環境における攻撃の効果性と不審さを評価すること。

提案手法

  • 攻撃後速やかに失敗するよう、敵対的ポリシー訓練と報酬操作を用いて高速失敗被害者ポリシーを訓練する。
  • 模倣学習を用いて、エキスパートエージェントとトリガーを発動させる敵対的エージェントの軌道を混合することで、通常動作とバックドア動作の両方を被害者のポリシーに埋め込む。
  • トリガーを敵対的エージェントによる行動のシーケンスとして設計し、被害者がそれを長期的失敗と関連付けるように学習させる。
  • (1)エキスパート対非トリガー敵対エージェント、および(2)高速失敗エージェント対トリガー発動エージェントのエピソードを組み合わせて混合訓練軌道を合成する。
  • 行動クラーニングを用いて、被害者エージェントをエンドツーエンドに訓練し、二重ポリシー行動を学習する。
  • トリガー長、パターン、汚染率を変化させた状況で攻撃を評価し、不審さと効果性を検証する。

実験結果

リサーチクエスチョン

  • RQ1直接的な観測値改ざんが不可能な競合マルチエージェント強化学習システムにおいて、バックドア攻撃が効果的に実行可能か?
  • RQ2敵対的エージェントが環境内での自らの行動のみを使って、被害者エージェントのバックドアをどのように発動できるか?
  • RQ3トリガー長さとパターンが攻撃の不審さと効果性に与える影響は何か?
  • RQ4通常の性能を維持しつつ、一時的なトリガーを記憶できるように被害者エージェントを訓練できるか?
  • RQ5微調整のような標準的防御策は、このようなバックドア攻撃をどれほど緩和できるか?

主な発見

  • トリガー発動時、被害者エージェントの勝利率は通常時の状態と比較して17%から37%まで低下した。
  • 短いトリガー(5〜10ステップ)は、より効果的かつ不審さが少なく、わずかなトリガー露出でも勝利率が著しく低下した。
  • 左方向移動や曲げた腕の動作といったトリガーのパターンは、効果的にバックドアを発動できるが、環境によって性能にばらつきがある。
  • 汚染率が高いほど攻撃の害は増大するが、不審さは低下し、40%の汚染率では「ゴールへ向かう」(アントス)で70.6%の失敗率を示した。
  • 微調整による被害者モデルの緩和は部分的であり、勝利率は最大で8.4%向上したが、過学習のため低下することもあった。
  • 微調整後でも攻撃は依然として効果的であり、バックドアが深く埋め込まれており、標準的な再訓練では容易には除去できないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。