Skip to main content
QUICK REVIEW

[論文レビュー] Adversarially Guided Actor-Critic

Yannis Flet-Berliac, Johan Ferret|arXiv (Cornell University)|Feb 8, 2021
Adversarial Robustness in Machine Learning参考文献 56被引用数 11
ひとこと要約

本論文は、報酬が疎であり、プログラム的に生成される環境において探索を向上させるために、敵対的アプローチを導入した新しいアクタ・クリティックフレームワークであるAdversarially Guided Actor-Critic (AGAC)を提案する。アクターが敵対者をだますように訓練される一方で、敵対者自身はアクターの方策を模倣する。この方法により、多様で革新的な行動が促進され、最先端の手法と比較して、サンプル効率と困難な探索タスクにおける性能が向上する。

ABSTRACT

Despite definite success in deep reinforcement learning problems, actor-critic algorithms are still confronted with sample inefficiency in complex environments, particularly in tasks where efficient exploration is a bottleneck. These methods consider a policy (the actor) and a value function (the critic) whose respective losses are built using different motivations and approaches. This paper introduces a third protagonist: the adversary. While the adversary mimics the actor by minimizing the KL-divergence between their respective action distributions, the actor, in addition to learning to solve the task, tries to differentiate itself from the adversary predictions. This novel objective stimulates the actor to follow strategies that could not have been correctly predicted from previous trajectories, making its behavior innovative in tasks where the reward is extremely rare. Our experimental analysis shows that the resulting Adversarially Guided Actor-Critic (AGAC) algorithm leads to more exhaustive exploration. Notably, AGAC outperforms current state-of-the-art methods on a set of various hard-exploration and procedurally-generated tasks.

研究の動機と目的

  • 報酬が疎でプログラム的に生成される環境において、特にサンプル効率の低さと探索の悪さを解決すること。
  • 複雑で変化し続ける環境で学習するエージェントの一般化性能と行動の多様性を向上させること。
  • 敵対的訓練が内因的好奇心やカウントベースのボーナスに依存せずに探索を誘導できるかどうかを検証すること。
  • 提案された敵対的正則化の安定性とスケーラビリティを、アクタ・クリティックフレームワーク内で評価すること。

提案手法

  • 第三者のエージェント(敵対者)を導入し、その目的はKLダイバージェンスの最小化を用いてアクターの行動分布を予測することである。
  • アクターは標準的な強化学習損失に加え、敵対者の予測から逸脱するよう訓練される敵対的損失を最小化する。
  • 敵対者は自らの行動分布とアクターの行動分布の間のKLダイバージェンスを最小化するように訓練され、行動方針の識別子として機能する。
  • 敵対的目的は標準的なアクタ・クリティック損失と組み合わせられ、タスクのパフォーマンスと行動の多様性の両立を図る共同最適化を形成する。
  • 報酬が疎な状況での探索を促進するために、敵対者の予測誤差から導出されるボーナス信号が使用される。
  • 固定(シングルトン)環境とプログラム的に生成される環境の両方でフレームワークを評価し、一般化性能と探索効果を検証する。

実験結果

リサーチクエスチョン

  • RQ1アクターと第三者の敵対者との間で敵対的模倣を実施することで、深層強化学習における探索が向上するか?
  • RQ2内因的好奇心やカウントベースの探索と比較して、敵対的目的はサンプル効率とカバレッジの面でどのように異なるか?
  • RQ3敵対者によって駆動される方針の多様性は、未確認のプログラム的に生成される環境への一般化をどの程度向上させるか?
  • RQ4特に敵対的ボーナス係数を変化させた場合に、学習プロセスの安定性はどの程度保たれるか?
  • RQ5外在的報酬が存在しない状況でも、この手法は包括的な探索を可能にするか?

主な発見

  • AGACは、MiniGridにおけるハードな探索タスクのスイートで最先端のパフォーマンスを達成し、RIDE、AMiGo、RND、ICM、カウントベースの手法を上回った。
  • 報酬なしの設定では、AGACはMultiRoomN10S6環境の10部屋すべてを探索したが、RIDEは5番目の部屋までしか到達できず、他の手法はより非効率に探索した。
  • 単一環境においても、バックアンドフォアワードやスタート地点への戻りといった多様で反復のない行動を示し、包括的な探索が実現された。
  • 敵対者による行動の多様性が成功裏に達成されたことが、最後の10エピソードの状態訪問ヒートマップから明らかになった。各エピソードで異なる戦略が観察された。
  • AGACは、敵対的ボーナス係数に対してやや敏感ではあるが、許容範囲の安定性を示し、実用的な有用性を示した。
  • VizDoomにおいて、敵対的にガイドされたボーナスは、ベースラインの内因的好奇心手法よりも顕著なパフォーマンス向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。