Skip to main content
QUICK REVIEW

[論文レビュー] Model-Invariant State Abstractions for Model-Based Reinforcement Learning

Manan Tomar, Amy Zhang|arXiv (Cornell University)|Feb 19, 2021
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

本論文は、ダイナミクスにおける因果スパarsityを活用することで一般化性能を向上させる、モデル不変の状態抽象化をモデルベース強化学習(MBRL)に導入する。各状態変数の因果親にのみ依存する表現を学習することで、未観測の状態-行動組み合わせへの合成的一般化を可能にし、MuJoCoのHumanoidのような複雑な制御タスクにおいて、優れたサンプル効率とモデル精度を達成する。

ABSTRACT

Accuracy and generalization of dynamics models is key to the success of model-based reinforcement learning (MBRL). As the complexity of tasks increases, so does the sample inefficiency of learning accurate dynamics models. However, many complex tasks also exhibit sparsity in the dynamics, i.e., actions have only a local effect on the system dynamics. In this paper, we exploit this property with a causal invariance perspective in the single-task setting, introducing a new type of state abstraction called \ extit{model-invariance}. Unlike previous forms of state abstractions, a model-invariance state abstraction leverages causal sparsity over state variables. This allows for compositional generalization to unseen states, something that non-factored forms of state abstractions cannot do. We prove that an optimal policy can be learned over this model-invariance state abstraction and show improved generalization in a simple toy domain. Next, we propose a practical method to approximately learn a model-invariant representation for complex domains and validate our approach by showing improved modelling performance over standard maximum likelihood approaches on challenging tasks, such as the MuJoCo-based Humanoid. Finally, within the MBRL setting we show strong performance gains with respect to sample efficiency across a host of other continuous control tasks.

研究の動機と目的

  • 分布シフト下でのモデルベース強化学習(MBRL)におけるダイナミクスモデルの一般化性能の低さを是正すること。
  • 各状態変数が過去の変数の小さな部分集合にのみ依存するという、状態ダイナミクスにおけるスパarsityを、一般化性能の向上に向けたインダクティブバイアスとして活用すること。
  • 各状態変数の因果親にのみ注目することで、介入に対して不変であることを保証する新しいタイプの状態抽象化、すなわちモデル不変性を形式化すること。
  • 関数近似を用いて、複雑なドメインにおけるモデル不変表現を学習する実用的手法を開発すること。
  • モデル不変抽象化を用いることで、MBRLにおけるサンプル効率とモデル精度が向上することを実証すること。

提案手法

  • 各状態変数の因果親にのみ依存する状態抽象化としてのモデル不変性を定義し、介入に対して不変であることを保証する。
  • 因果不変性の原則を用いて、異なる介入においても一貫して次状態変数を予測できる特徴を同定する。
  • 次状態変数の不変で因果的な予測子にのみ依存するようモデルを学習するための表現学習目的関数を構築する。
  • 明示的なグラフ構造学習を必要とせず、スパarsity誘導型の不変性目的関数を用いたニューラルネットワークによるモデル不変表現の近似を行う。
  • SACなどのMBRLパイプラインに学習済みの不変モデルを統合し、計画とポリシー最適化を可能にする。
  • 不変表現を用いて最尤推定でモデルを学習し、訓練時に観測されなかった状態-行動分布への一般化を保証する。

実験結果

リサーチクエスチョン

  • RQ1因果スパarsityをモデル不変状態抽象化を通じて活用することで、MBRLにおける一般化性能が向上するか?
  • RQ2各状態変数の因果親にのみ依存する表現は、探索的仮定下で最適ポリシー学習に十分か?
  • RQ3MuJoCoのような高次元で複雑な環境において、モデル不変表現を学習する実用的手法を設計できるか?
  • RQ4モデル不変抽象化を用いることで、標準的なMBRL手法と比較して、サンプル効率とモデル精度に顕著な向上が見られるか?
  • RQ5モデル不変性は、訓練時に観測されなかった状態変数の組み合わせに対しても一般化できるか?

主な発見

  • 理論的分析により、探索的仮定下では因果親に基づくモデル不変表現がポリシー学習において最適であることが示された。
  • シンプルなトロイドドメインでは、非因数化抽象化と比較して、モデル不変アプローチが未観測の状態分布への一般化性能が優れていることが確認された。
  • MuJoCoベースのHumanoid環境では、標準的な最尤ベースラインと比較して、モデル不変学習者が顕著に優れたモデル一般化性能を示した。
  • SACと組み合わせた場合、複数の連続制御タスクにおいて、モデル不変アプローチがサンプル効率の面で顕著な性能向上を達成した。
  • 計画ホライズンが長くなるほど、不変学習者と標準学習者の性能差が拡大する傾向にあり、長期的一般化性能の向上が示された。
  • 本手法は合成的(compositionally)に一般化可能であり、訓練時に観測されなかった状態変数の値の組み合わせに対しても、正確な予測が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。