Skip to main content
QUICK REVIEW

[論文レビュー] Shaping Belief States with Generative Environment Models for RL

Karol Gregor, Danilo Jimenez Rezende|arXiv (Cornell University)|Jun 21, 2019
Reinforcement Learning in Robotics参考文献 56被引用数 16
ひとこと要約

本稿では、予測モデリングとオーバースポーティングを用いて、最初の人物視点の観察から、複雑な3次元環境において安定的で長期的な信念状態を学習する、表現力のある生成的環境モデルの使用を提案する。ポリシー・ネットワークと生成的モデルの間で信念状態を共有することにより、訓練速度を損なわず、強化学習における顕著なデータ効率性の向上を達成する。

ABSTRACT

When agents interact with a complex environment, they must form and maintain beliefs about the relevant aspects of that environment. We propose a way to efficiently train expressive generative models in complex environments. We show that a predictive algorithm with an expressive generative model can form stable belief-states in visually rich and dynamic 3D environments. More precisely, we show that the learned representation captures the layout of the environment as well as the position and orientation of the agent. Our experiments show that the model substantially improves data-efficiency on a number of reinforcement learning (RL) tasks compared with strong model-free baseline agents. We find that predicting multiple steps into the future (overshooting), in combination with an expressive generative model, is critical for stable representations to emerge. In practice, using expressive generative models in RL is computationally expensive and we propose a scheme to reduce this computational burden, allowing us to build agents that are competitive with model-free baselines.

研究の動機と目的

  • 自己教師付きの生成的モデリングを用いて、部分的に観察可能な視覚的に豊かな3次元環境において、安定的で長期的な信念状態を学習する手法を開発すること。
  • 予測モデルにおける長期予測の不安定性を解消するために、オーバースポーティングと表現力のあるアーキテクチャを導入すること。
  • ポリシーと生成的モデルの間で信念状態を共有することにより、強化学習におけるデータ効率性を向上させること。
  • 予測モデリングと表現力のある生成的モデルを組み合わせることで、3次元環境において構造の構築といった複雑な行動をエージェントが学習できることを実証すること。

提案手法

  • エージェントは、最初の人物視覚的観察と行動から信念状態を維持するために再帰的ニューラルネットワーク(RNN)を用いる。
  • 別個のシミュレーション・ネットワーク(SimCore)は、新しい観察を取得せずに環境内で行動を展開することで、将来の状態を予測する。
  • 生成的モデルは、シミュレートされた信念状態から将来のフレームを再構築し、マルチステップのオーバースポーティングを含む予測目的を用いる。
  • 信念状態はポリシー・ネットワークと生成的モデルの間で共有され、共同学習とデータ効率性の向上が可能になる。
  • 3つの信念状態アーキテクチャが評価された:標準LSTM、カネーヴァメモリを備えたLSTM、スロットベースのメモリを備えたLSTM。
  • グローバルな一貫性と長期的な整合性を促進するために、対照的損失と予測目的を用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1予測目的を用いて訓練された表現力のある生成的モデルは、視覚的に複雑な3次元環境において、安定的で長期的な信念状態を形成できるか?
  • RQ2マルチステップ予測におけるオーバースポーティングは、学習された表現の安定性と整合性をどのように向上させるか?
  • RQ3ポリシーと生成的モデルの間で信念状態を共有することは、強化学習におけるデータ効率性をどの程度向上させるか?
  • RQ4このようなシステムは、3次元環境で階段や構造物の構築といった複雑で長時間にわたる行動をエージェントが学習可能にするか?

主な発見

  • 表現力のある生成的モデルとオーバースポーティングの組み合わせにより、グローバルな環境構造とエージェントの位置を捉える安定的で整合性のある信念状態が得られる。
  • 生成的モデルと信念状態を共有するエージェントは、強力なモデルフリーのベースラインと比較して、複数の強化学習タスクで顕著なデータ効率性の向上を達成する。
  • 行動のみを用いて将来の状態をシミュレートするSimCore部は、性能を向上させるとともに、ハイパーパrameterやアンロール長に対する感受性を低減する。
  • モデルは、ボクセルベースの環境で高所やギャップを越えて配置された食べ物のブロックに到達するために、階段や塔の構築を学習可能にする。
  • カネーヴァメモリは復元性能を向上させるが、強化学習の訓練設定では不安定であることが判明し、メモリアーキテクチャのさらなる研究が求められる。
  • 本手法により、3次元環境における最初のエージェントが、最初の人物視点から素材を収集し、複雑な構造物を構築する能力を学習可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。