Skip to main content
QUICK REVIEW

[論文レビュー] Learning Discrete State Abstractions With Deep Variational Inference

Ondřej Bíža, Robert W. Platt|arXiv (Cornell University)|Mar 9, 2020
Reinforcement Learning in Robotics参考文献 25被引用数 6
ひとこと要約

この論文は、高次元の画像状態を連続的埋め込みにマッピングし、その後アクションに依存する隠れマルコフモデル(HMM)を用いてクラスタリングすることで、近似的なMDPバイシミレーションとしての離散的状態抽象化を学習する深層変分推論手法を提案する。主な貢献は、再訓練を必要とせず、未学習のゴールに対しても効率的な計画を可能にするエンド・ツー・エンドでトレーニング可能なフレームワークを提供することである。

ABSTRACT

Abstraction is crucial for effective sequential decision making in domains with large state spaces. In this work, we propose an information bottleneck method for learning approximate bisimulations, a type of state abstraction. We use a deep neural encoder to map states onto continuous embeddings. We map these embeddings onto a discrete representation using an action-conditioned hidden Markov model, which is trained end-to-end with the neural network. Our method is suited for environments with high-dimensional states and learns from a stream of experience collected by an agent acting in a Markov decision process. Through this learned discrete abstract model, we can efficiently plan for unseen goals in a multi-goal Reinforcement Learning setting. We test our method in simplified robotic manipulation domains with image states. We also compare it against previous model-based approaches to finding bisimulations in discrete grid-world-like environments. Source code is available at https://github.com/ondrejba/discrete_abstractions.

研究の動機と目的

  • 深層強化学習において一般的な高次元状態空間において、コン pact で離散的な状態抽象化を学習する課題に対処すること。
  • 再トレーニングを必要とせず、マルチゴール強化学習設定において未学習のゴールに対しても効率的な計画を可能にすること。
  • 遷移および報酬構造を保持する抽象MDPを学習し、元のMDPの近似的なバイシミレーションを形成すること。
  • 従来の手法が新たなタスクに一般化できない、もしくは離散的かつ平面的なMDP構造を生成しないという限界を克服すること。
  • 予測的および構造的制約を持つ表現学習のための変分情報ボトルネックフレームワークに、構造的事前分布(GMMおよびHMM)を統合すること。

提案手法

  • 深層ニューラルエンコーダーが高次元の画像状態を、意思決定に必要な情報を保持する連続的埋め込みにマッピングする。
  • 連続的埋め込みが、時間的遷移ダイナミクスをモデル化する、学習されたアクションに依存する隠れマルコフモデル(HMM)を用いて離散的抽象状態に変換される。
  • 抽象状態からのQ値予測を最大化すると同時に符号化の複雑さを最小化する、変分情報ボトルネック(VIB)目的関数が使用される。
  • GMMおよびHMMを含む構造的事前分布が、ニューラルエンコーダーと同時にエンド・ツー・エンドでトレーニングされ、クラスタの平均、共分散、遷移行列が抽象MDPを形成する。
  • HMM事前分布がアクション固有の遷移ダイナミクスを符号化し、離散状態と遷移確率を持つ有効なMDPを表現可能にする。
  • 事前分布の学習されたパラメータ(例:クラスタ平均、遷移行列)が抽出され、計画用の離散的抽象MDPが形成される。

実験結果

リサーチクエスチョン

  • RQ1深層変分推論フレームワークは、高次元の画像ベース環境において、近似的なMDPバイシミレーションを形成する離散的状態抽象化を学習できるか?
  • RQ2学習中に見られなかったゴールに対しても、学習された抽象MDPは効率的な計画を可能にするか?
  • RQ3アクションに依存するHMM事前分布を用いることで、GMMのような単純な事前分布と比較して、抽象化の質と構造がどのように向上するか?
  • RQ4長時間スケールのタスクに一般化可能であり、分布シフト下でも性能を維持できるか?
  • RQ5抽象化により、再トレーニングを伴わずポリシーの圧縮と転移が可能になるか?

主な発見

  • 本手法は、高次元の画像ベース環境において、最高品質の近似的バイシミレーションを形成する離散的抽象化を成功裏に学習しており、評価環境では最大1000の抽象状態を含む。
  • 学習済みの抽象MDPは、追加のトレーニングやファインチューニングを必要とせず、マルチゴール強化学習設定において未学習のゴールに対しても効率的な計画を可能にする。
  • 画像状態を用いた簡略化されたロボット操作ドメインにおける実験では、抽象モデルが意思決定に必要な情報を保持するとともに、状態空間の複雑さを低減している。
  • 特に新しいタスクへの一般化性能において、従来のモデルベース手法よりも優れた性能を示しており、離散的グリッドワールドに類似した環境でのバイシミレーション学習において顕著である。
  • アクションに依存するHMM事前分布の使用により、GMMベースの代替手法と比較して、より構造的かつ動的整合性のある抽象MDPが得られている。
  • 本フレームワークにより、ポリシー性能を維持したまま低次元の離散的表現を学習することで、深層Qネットワークポリシーの圧縮が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。