Skip to main content
QUICK REVIEW

[論文レビュー] Analysis and Improvement of Adversarial Training in DQN Agents With Adversarially-Guided Exploration (AGE)

Vahid Behzadan, William Hsu|arXiv (Cornell University)|Jun 3, 2019
Adversarial Robustness in Machine Learning参考文献 11被引用数 5
ひとこと要約

本稿では、DQNエージェントのサンプル効率の高い探索手法として、敵対的摂動を探索に統合するAdversarially-Guided Exploration (AGE)を提案する。AGEは$\epsilon$-greedyとボルツマン探索のハイブリッド手法を用い、敵対的ロバストネスを向上させる。標準的な$\epsilon$-greedyやパラメータ空間ノイズと比較して、敵対的訓練におけるサンプル複雑性を低減し、収束が速く、状態空間攻撃に対して優れた耐性を示す。

ABSTRACT

This paper investigates the effectiveness of adversarial training in enhancing the robustness of Deep Q-Network (DQN) policies to state-space perturbations. We first present a formal analysis of adversarial training in DQN agents and its performance with respect to the proportion of adversarial perturbations to nominal observations used for training. Next, we consider the sample-inefficiency of current adversarial training techniques, and propose a novel Adversarially-Guided Exploration (AGE) mechanism based on a modified hybrid of the $ε$-greedy algorithm and Boltzmann exploration. We verify the feasibility of this exploration mechanism through experimental evaluation of its performance in comparison with the traditional decaying $ε$-greedy and parameter-space noise exploration algorithms.

研究の動機と目的

  • 敵対的訓練におけるDQNエージェントの、敵対的経験の割合に関する理論的限界を分析すること。
  • 現在のDQNにおける敵対的訓練手法のサンプル非効率性を特定すること。
  • 敵対的訓練中にサンプル効率を向上させる新しい探索メカニズムの開発。
  • 提案されたAdversarially-Guided Exploration (AGE)メカニズムの有効性を、ポリシーのロバストネス向上の観点から評価すること。
  • 従来の$\epsilon$-greedyおよびパラメータ空間ノイズ探索と比較して、AGEの敵対的耐性における性能を評価すること。

提案手法

  • 敵対的状態に向けた探索を誘導するため、$\epsilon$-greedyとボルツマン探索をハイブリッド化したAGEを提案する。
  • 探索行動が、敵対的摂動を加えられた状態を優先する分布$\zeta_{\text{adv}}^{\pi_i}$から選択されるように、修正された$\epsilon$-greedy方策を導入する。
  • 攻撃者の能力を制限するための確率的予算$P(\text{attack})$を用い、状態中立的攻撃者と標的攻撃者を区別する。
  • 優先順位付きサンプリングを用いた経験リプレイを採用し、TD誤差のバイアスを低減するため、ノーマル経験のサンプリング確率が時間とともに増加するように設計する。
  • 敵対的訓練が有効に機能する理論的条件を導出する。収束には、$p_{\text{nominal}}(s_t) > p(\text{attack})$を満たす必要がある。
  • 固定摂動コスト$c_{\text{adv}} = 1$を持つDQNベースの敵対的エージェントを用い、訓練中の耐性とレグルレーションを測定する。

実験結果

リサーチクエスチョン

  • RQ1経験リプレイバッファ内の敵対的経験の割合に基づいて、DQNエージェントにおける敵対的訓練の理論的限界は何か?
  • RQ2敵対的経験とノーマル経験の比率が、DQNポリシーの収束性とロバストネスに与える影響は何か?
  • RQ3ハイブリッド探索メカニズムは、DQNエージェントの敵対的訓練におけるサンプル効率を向上させることができるか?
  • RQ4AGEは、従来の$\epsilon$-greedyおよびパラメータ空間ノイズ探索と比較して、敵対的耐性と訓練安定性において優れているか?
  • RQ5AGEは、標準的な敵対的訓練と比較して、収束が速く、より高いロバストネスを示すか?

主な発見

  • $p(\text{attack}) = 0.2$および$0.4$の場合、攻撃開始後、敵対的訓練は速やかに回復するが、$p(\text{attack}) = 0.8$および$1.0$の場合、訓練期間内に回復に失敗する。
  • 理論的分析により、効果的な敵対的訓練には、ノーマル経験のサンプリング確率が時間とともに増加する必要があることが示され、すなわち$p_{\text{nominal}}(s_t) > p(\text{attack})$を満たす必要がある。
  • 図3に示すように、AGEで訓練されたポリシーは、$\epsilon$-greedy探索と比較して、収束が速く、訓練の安定性が向上している。
  • AGEで訓練されたポリシーを標的にする敵対的エージェントは100,000イテレーション内に収束しなかったが、$\epsilon$-greedyポリシーを標的にした場合、約90,000ステップで収束した。
  • AGEベースの訓練は、標準的な敵対的訓練と比較して、同じ訓練時間内にはるかに少ないサンプル数で優れた敵対的耐性を達成しており、これは低いレグルレーションと高い摂動回数の観点から裏付けられている。
  • AGEは、$\epsilon$-greedyおよびパラメータ空間ノイズ探索の両方と比較して、敵対的耐性ベンチマークで優れた性能を示し、サンプル効率とロバストネスの両方の向上を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。