Skip to main content
QUICK REVIEW

[論文レビュー] Transfer of Deep Reactive Policies for MDP Planning

Aniket Bajpai, Sankalp Garg|arXiv (Cornell University)|Oct 26, 2018
Optimization and Search Problems参考文献 16被引用数 13
ひとこと要約

本稿では、RDDLで表現されたドメインにおけるMDP計画のためのドメインに依存しない転移学習フレームワークであるToRPIDoを提案する。記号的状態構造、遷移関数、およびグラフ畳み込みネットワークを活用して、インスタンスに依存しない状態埋め込みを学習することで、ほぼゼロショットのポリシー転移を実現する—新しいインスタンスではアクションデコーダーのみを微調整する—従来の学習から再訓練する方法や最先端のRL転移手法と比較して、著しく高速な学習と優れた性能を達成する。

ABSTRACT

Domain-independent probabilistic planners input an MDP description in a factored representation language such as PPDDL or RDDL, and exploit the specifics of the representation for faster planning. Traditional algorithms operate on each problem instance independently, and good methods for transferring experience from policies of other instances of a domain to a new instance do not exist. Recently, researchers have begun exploring the use of deep reactive policies, trained via deep reinforcement learning (RL), for MDP planning domains. One advantage of deep reactive policies is that they are more amenable to transfer learning. In this paper, we present the first domain-independent transfer algorithm for MDP planning domains expressed in an RDDL representation. Our architecture exploits the symbolic state configuration and transition function of the domain (available via RDDL) to learn a shared embedding space for states and state-action pairs for all problem instances of a domain. We then learn an RL agent in the embedding space, making a near zero-shot transfer possible, i.e., without much training on the new instance, and without using the domain simulator at all. Experiments on three different benchmark domains underscore the value of our transfer algorithm. Compared against planning from scratch, and a state-of-the-art RL transfer algorithm, our transfer solution has significantly superior learning curves.

研究の動機と目的

  • ドメインに依存しない確率的計画において、同じドメインの問題インスタンス間での有効なポリシー転移が不足しているという問題に対処すること。
  • 同じドメイン内での等サイズMDPインスタンス間で、高速かつほぼゼロショットの深層反応的ポリシー転送を可能にすること。
  • RDDLにおける記号的構造(状態変数、接続性、遷移関数)を活用して、状態および状態-行動ペアの共有でインスタンスに依存しない表現を学習すること。
  • RDDLモデル上で事前に学習したモデルベースのコンponent(遷移モデル、インスタンス分類器)を用いることで、転送中の環境ロールアウトに依存するのを減らすこと。
  • 学習効率および最終的なパフォーマンスにおいて、従来の学習から再訓練する方法や最先端のRL転移アルゴリズムを上回ること。

提案手法

  • RDDLで定義された状態接続構造に基づいて、記号的状態を共有でインスタンスに依存しない埋め込みに変換するためのグラフ畳み込みネットワーク(GCN)を用いる。
  • 共有埋め込み空間で深層強化学習エージェント(A3C)を訓練し、問題インスタンス間で転送可能なポリシーを学習する。
  • インスタンスに依存しない状態-行動埋め込みをインスタンス固有の実行行動にマップするアクションデコーダーを導入し、本質的なポリシーの再訓練なしに転送を可能にする。
  • RDDLの遷移関数を活用して、埋め込み空間でインスタンスに依存しない遷移モデルを学習し、アクションデコーダーの訓練を加速する。
  • 敵対的訓練されたインスタンス分類器を用いて、埋め込み空間がインスタンスの識別子に依存しないように促進し、一般化性能を向上させる。
  • ポリシー、状態エンコーダー、遷移モデル、インスタンス分類器を直接新しいインスタンスに転送し、アクションデコーダーのみを再訓練することで転送を実行する。

実験結果

リサーチクエスチョン

  • RQ1RDDLにおけるMDP計画のためのドメインに依存しない転移アルゴリズムを設計でき、同じドメイン内での問題インスタンス間で有効なポリシー転送を可能にすることができるか?
  • RQ2RDDLにおける記号的構造(状態接続性、遷移関数)をどれだけ活用して、状態および状態-行動ペアの共有でインスタンスに依存しない表現を学習できるか?
  • RQ3アクションデコーダーのみを再訓練するというほぼゼロショット転送は、完全な再訓練や既存の転送手法と比較してどれほど有効か?
  • RQ4各アーキテクチャ的コンponent(GCN、アクションデコーダー、遷移モデル、インスタンス分類器)が全体の転送パフォーマンスに与える累積的寄与度はどの程度か?
  • RQ5提案手法は、学習から再訓練する方法や最先端のRL転送アルゴリズムと比較して、著しく高速な学習曲線と高い最終パフォーマンスを達成できるか?

主な発見

  • ToRPIDoは、学習から再訓練する方法(A3C)および最先端のRL転移手法(A2T)と比較して、著しく優れた学習曲線を示し、すべての訓練ステップで高い報酬を得ている。
  • モデルは強力なほぼゼロショット転送を示している:初期化時(α(0))において、ToRPIDoは平均でα ≈ 0.5を達成しており、これは高い性能段階から訓練を開始していることを示しており、ベースラインはα ≈ 0付近から開始している。
  • アブレーションスタディの結果、GCNベースの状態エンコーダーのみで、ヴァナイルA3Cと比較してパフォーマンスが向上するが、高速なほぼゼロショット転送にはアクションデコーダーと遷移モデルが不可欠であることが示された。
  • インスタンス分類器は初期学習段階で顕著な向上をもたらすが、その累積的利点は急速に薄れ、最終的なパフォーマンスはA3C+GCN+SADバージョンと僅差で終わる。
  • IPPComp競争の3つのベンチマークドメインすべてにおいて、ToRPIDoは一貫してベースラインを上回っており、特に初期学習段階で最大のパフォーマンスギャップが観察された。
  • 本手法は、転送中にシミュレータ呼び出しを一切行わず、RDDLモデルと事前学習済みコンponentに依存するだけで、効果的な転送を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。