Skip to main content
QUICK REVIEW

[論文レビュー] Attention-Privileged Reinforcement Learning

Sasha Salter, Dushyant Rao|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 42被引用数 6
ひとこと要約

本稿では、画像ベースの強化学習におけるサンプル効率とロバスト性を向上させるため、注意機構の整合性と共有エクスペリエンスリプレイを用いて、画像ベースのエージェントと特権状態ベースのエージェントを並行して学習するAttention-Privileged Reinforcement Learning (APRiL) を提案する。APRiLは、状態ベースのエージェントからの注意指導を通じて画像エージェントがタスク関連特徴に注目できるようにすることで、訓練内および訓練外の干渉要因に対しても高速な学習と優れた一般化性能を達成する。

ABSTRACT

Image-based Reinforcement Learning is known to suffer from poor sample efficiency and generalisation to unseen visuals such as distractors (task-independent aspects of the observation space). Visual domain randomisation encourages transfer by training over visual factors of variation that may be encountered in the target domain. This increases learning complexity, can negatively impact learning rate and performance, and requires knowledge of potential variations during deployment. In this paper, we introduce Attention-Privileged Reinforcement Learning (APRiL) which uses a self-supervised attention mechanism to significantly alleviate these drawbacks: by focusing on task-relevant aspects of the observations, attention provides robustness to distractors as well as significantly increased learning efficiency. APRiL trains two attention-augmented actor-critic agents: one purely based on image observations, available across training and transfer domains; and one with access to privileged information (such as environment states) available only during training. Experience is shared between both agents and their attention mechanisms are aligned. The image-based policy can then be deployed without access to privileged information. We experimentally demonstrate accelerated and more robust learning on a diverse set of domains, leading to improved final performance for environments both within and outside the training distribution.

研究の動機と目的

  • 視覚ドメインランダマイゼーション下での画像ベースの深層強化学習における低いサンプル効率と一般化性能の問題に対処すること。
  • 訓練の難易度を高め、最終的な性能を低下させる可能性がある、包括的な視覚ランダマイゼーションへの依存を軽減すること。
  • テスト時に特権情報へのアクセスを必要とせずに、干渉要因や未観測の視覚的変化に対してロバスト性を向上させること。
  • シミュレータの状態から得られる構造的でタスク関連の情報を訓練中に活用することで、画像ベース方策の学習を加速すること。

提案手法

  • APRiLは、2つの並列して学習するアクタ・クリティックエージェントを訓練する:1つは特権情報なしでデプロイ可能な画像ベースのエージェント、もう1つは訓練中に環境状態にアクセス可能な状態ベースのエージェント。
  • 両エージェントは入力をフィルタリングするための注意機構を用い、訓練中に注意モジュールを明示的に一致させることで、画像エージェントがタスク関連特徴に注目できるようにする。
  • 2つのエージェント間で共有リプレイバッファを採用することで、画像ベース方策のデータ効率と学習速度が向上する。
  • 状態ベースエージェントの注意はタスク関連要素(例:ターゲットオブジェクト、四肢)に集中するように訓練され、その知識が注意の一致を通じて画像エージェントに伝達される。
  • 注意の一致は、画像空間と状態空間における対応する観測の類似した注意マスクを促進するコントラスト型損失によって達成される。
  • 本手法はモデルフリーであり、特権情報から画像ベースエージェントへの知識蒸留のメカニズムとして注意を統合することで、非対称アクタ・クリティック手法を拡張する。

実験結果

リサーチクエスチョン

  • RQ1注意機構は、視覚ドメインランダマイゼーション下での画像ベースの深層強化学習におけるサンプル効率とロバスト性を向上させ得るか?
  • RQ2画像ベースと状態ベースエージェント間の注意を一致させることで、訓練中に観測されなかった干渉要因に対しても一般化性能が向上するか?
  • RQ3特権エージェントと画像ベースエージェント間でリプレイバッファを共有することは、画像ベース方策の学習をどの程度加速するか?
  • RQ4APRiLは、asym-DDPG や s-map asym-DDPG といった強力なベースラインと比較して、最終的な性能と一般化性能において優れているか?
  • RQ5注意一致と共有リプレイバッファの両者の中で、性能向上に寄与する相対的な寄与度はどの程度か?

主な発見

  • APRiLは、asym-DDPG や s-map asym-DDPG と比較して学習を著しく加速しており、複数のシミュレーテッド環境で収束が速いことが観測された。
  • APRiLで訓練された画像ベース方策は、訓練時に存在しなかった追加の干渉要因を含む環境に対しても、強力な分布外一般化性能を示した。
  • 高視覚的変動性のある設定において、APRiLはインハウスおよび外挿テスト環境の両方でベースラインを上回る高い最終的性能を達成した。
  • アブレーションスタディの結果、共有リプレイバッファ単体よりも注意一致が性能向上に寄与していることが示され、注意誘導型特徴学習の重要性が強調された。
  • 画像エージェントの注意機構は、タスクに無関係な視覚的ノイズ(例:背景のごみ)を抑制し、ターゲットやロボットアームなどの関連オブジェクトにのみ注目するよう学習した。
  • JacoReach環境では、干渉要因の増加に対しても、画像エージェントの注意マスクが一貫してターゲットオブジェクトとロボットアームにのみ焦点を合わせており、タスク駆動型の注意学習が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。