Skip to main content
QUICK REVIEW

[論文レビュー] Learning Markov State Abstractions for Deep Reinforcement Learning

Cameron Allen, Neev Parikh|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics参考文献 53被引用数 6
ひとこと要約

本論文では、逆動力学モデリングと時系列対照学習を組み合わせることで、報酬信号に依存せずにサンプル効率の良い強化学習を実現するため、深層強化学習におけるマルコフ状態抽象化を学習する手法を提案する。このアプローチにより、情報損失のないコンactな表現が学習され、手動で設計された状態特徴量を用いた手法と同等またはそれ以上の性能を達成する。

ABSTRACT

A fundamental assumption of reinforcement learning in Markov decision processes (MDPs) is that the relevant decision process is, in fact, Markov. However, when MDPs have rich observations, agents typically learn by way of an abstract state representation, and such representations are not guaranteed to preserve the Markov property. We introduce a novel set of conditions and prove that they are sufficient for learning a Markov abstract state representation. We then describe a practical training procedure that combines inverse model estimation and temporal contrastive learning to learn an abstraction that approximately satisfies these conditions. Our novel training objective is compatible with both online and offline training: it does not require a reward signal, but agents can capitalize on reward information when available. We empirically evaluate our approach on a visual gridworld domain and a set of continuous control benchmarks. Our approach learns representations that capture the underlying structure of the domain and lead to improved sample efficiency over state-of-the-art deep reinforcement learning with visual features -- often matching or exceeding the performance achieved with hand-designed compact state information.

研究の動機と目的

  • 豊富な観測から深層強化学習におけるマルコフ状態表現を学ぶという課題に対処すること。
  • 報酬フィードバックを必要とせずに、視覚的観測とエキスパートの状態特徴量との間の表現ギャップを埋めること。
  • マルコフ性を保持しつつ、効率的なポリシー学習を可能にする訓練目的を構築すること。
  • 視覚的強化学習環境におけるサンプル効率を向上させるために、構造的かつ低次元の抽象化を学習すること。

提案手法

  • ブロックMDPにおける状態抽象化がマルコフ性を保持するための理論的十分条件を定義する。
  • 逆動力学と対照学習を組み合わせた共同目的関数を用いて、高次元の観測を抽象状態にマップする共有エンコーダーを訓練する。
  • 逆モデルを用いて連続する抽象状態から行動を予測し、動的整合性を確保する。
  • 対照識別器を用いて、本物の状態遷移と偽物の状態遷移を区別させ、時間的整合性を促進する。
  • オンラインおよびオフラインRLと両立可能な補助的訓練信号として目的関数を統合する。
  • 一般化性および学習効率の向上を目的に、任意で滑らかさ損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1豊富な観測MDPにおいて、学習された状態抽象化がマルコフ性を保持するための十分条件は何か?
  • RQ2報酬信号を必要とせずにマルコフ性を保証するような表現学習目的を設計できるか?
  • RQ3逆動力学と対照学習を組み合わせることで、視覚的強化学習におけるサンプル効率がどのように向上するか?
  • RQ4このような抽象化は、手動で設計された状態特徴量を用いた手法と同等またはそれ以上の性能を達成できるか?
  • RQ5実際のポリシー学習において、表現の滑らかさはどのように影響を与えるか?

主な発見

  • 提案手法は、視覚的グリッドワールドにおいて表現ギャップを完全に埋め、エキスパートの状態特徴量を用いた場合と同等の性能を達成するマルコフ状態抽象化を学習する。
  • 連続的制御ベンチマークにおいて、最先端の視覚的表現学習手法よりもサンプル効率が向上し、真の状態入力を用いた場合と同等またはそれ以上の性能を達成する。
  • 事前学習を省略した場合や滑らかさ正則化を削除した場合でも、顕著な性能向上が得られるが、両者とも安定性および学習速度に寄与している。
  • アブレーションスタディの結果、一部のタスクでは事前学習を削除するとわずかに性能が向上する傾向が示され、表現事前学習が常に必要ではない可能性を示唆している。
  • 標準的な視覚ベースラインやRBF-DQNと組み合わせることで、DeepMind Control Suiteにおいてもエキスパートレベルの性能に到達し、特にその組み合わせで顕著な向上が得られる。
  • 実験により、マルコフ性の要件としては必須でないものの、表現の滑らかさが学習効率および最終的な性能を著しく向上させることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。