Skip to main content
QUICK REVIEW

[論文レビュー] Plannable Approximations to MDP Homomorphisms: Equivariance under Actions

Elise van der Pol, Thomas Kipf|arXiv (Cornell University)|Feb 27, 2020
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

本論文は、決定的MDPの潜在表現における行動等変性を強制する対照学習手法を提案している。入力空間における状態遷移が潜在空間でも同様に反映されることを保証する。損失関数が0のとき、この手法はMDPホモモーフィズムを生成し、抽象MDPにおいて価値反復による正確な計画が可能となり、最適方策を元のMDPに強く一般化して持ち上げることが可能になる。

ABSTRACT

This work exploits action equivariance for representation learning in reinforcement learning. Equivariance under actions states that transitions in the input space are mirrored by equivalent transitions in latent space, while the map and transition functions should also commute. We introduce a contrastive loss function that enforces action equivariance on the learned representations. We prove that when our loss is zero, we have a homomorphism of a deterministic Markov Decision Process (MDP). Learning equivariant maps leads to structured latent spaces, allowing us to build a model on which we plan through value iteration. We show experimentally that for deterministic MDPs, the optimal policy in the abstract MDP can be successfully lifted to the original MDP. Moreover, the approach easily adapts to changes in the goal states. Empirically, we show that in such MDPs, we obtain better representations in fewer epochs compared to representation learning approaches using reconstructions, while generalizing better to new goals than model-free approaches.

研究の動機と目的

  • 高次元で連続的なMDPにおいて、再構成損失に依存せずに構造的で計画可能な表現を学習する課題に対処すること。
  • 潜在空間における行動等変性を強制し、入力空間における遷移が潜在空間でも同等の遷移によって反映されることを保証すること。
  • 学習済み表現から抽象MDPを構築し、価値反復による正確な計画を可能とすること。
  • 再訓練なしに新しいゴール状態へのゼロショット転送を可能とすること。学習済みホモモーフィズムの構造的不変性を活用すること。
  • モデルフリーおよび再構成ベースの表現学習手法と比較して、データ効率と一般化性能を向上させること。

提案手法

  • 行動等変性を強制するための対照損失関数を設計し、状態遷移の潜在表現が、対応する行動埋め込みのもとでのその潜在表現の遷移と一致することを保証する。
  • 元の状態空間から潜在空間への写像Zを学習し、Z(T(s,a)) = T̄(Z(s), Âs(a)) を満たすことで、MDPホモモーフィズム条件を満たす。
  • 次状態予測、報酬予測、およびネガティブサンプリングを組み合わせることで、潜在空間の崩壊を防ぎ、表現品質を向上させる。
  • 学習済み潜在表現およびそれに対応する遷移関数・報酬関数を用いて抽象MDPを構築し、価値反復による計画を可能にする。
  • 各状態ごとに行動埋め込みÂs(a)を学習し、行動が潜在空間に与える影響をモデル化することで、遷移関数との可換性を確保する。
  • 再構成損失を避けることで、等変性による構造的不変性に注目し、トレーニングコストを削減するとともに意思決定に重要な特徴に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1対照損失を用いて行動等変性を強制することで、決定的MDPにおける正確な計画に適した表現を学習できるか?
  • RQ2学習済み表現が有効なMDPホモモーフィズムを形成する条件は何か?
  • RQ3抽象MDPにおける計画が、元のMDPに成功裏に持ち上げられる方策を生成できるか?
  • RQ4追加のトレーニングなしに、新しいゴール状態への一般化はどの程度うまくいくか?
  • RQ5再構成ベースおよびモデルフリーの表現学習手法と比較して、データ効率と一般化性能に優れているか?

主な発見

  • 提案損失が0のとき、決定的MDPにおいて学習済み写像はMDPホモモーフィズムであることが証明可能であり、抽象MDPにおける最適方策を元のMDPに持ち上げられることを保証する。
  • 再構成ベース手法と比較して、より少ないエポックで優れた表現が得られ、収束が早く、トレーニング損失も低くなることが示された。
  • 追加の勾配更新なしに新しいゴール状態に効果的に一般化され、強力なゼロショット転送能力を示している。
  • 学習済み潜在空間は元のMDPのグラフ構造を保持しており、価値反復による正確な計画が可能である。
  • 同じダイナミクスを持つ新しいMDPインスタンスに対しても一般化がうまくいくことから、ゴール状態の分布シフトに対しても頑健であることが示された。
  • 新しいターゲット状態における方策性能を測定したところ、モデルフリーのベースラインと比較して、未観測のゴールへの一般化性能が優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。