Skip to main content
QUICK REVIEW

[論文レビュー] Learning Portable Representations for High-Level Planning

Steven James, Benjamin Rosman|arXiv (Cornell University)|May 28, 2019
Machine Learning and Algorithms参考文献 28被引用数 9
ひとこと要約

本論文は、エゴセントリックな状態空間からエージェントの経験に基づき、移植可能でタスクに依存しない記号的表現を学習するフレームワークを提案する。これにより、異なる環境間での転送が可能になる。タスク固有の情報でこれらの移植可能な記号を接地することで、顕著に低いサンプル複雑性で証明可能に整合性のある計画が達成される。Rod-and-Blockドメインでは複数のタスク後、サンプル数が約600から約330に低下し、Treasure Gameでは約1600から約700に低下した。

ABSTRACT

We present a framework for autonomously learning a portable representation that describes a collection of low-level continuous environments. We show that these abstract representations can be learned in a task-independent egocentric space specific to the agent that, when grounded with problem-specific information, are provably sufficient for planning. We demonstrate transfer in two different domains, where an agent learns a portable, task-independent symbolic vocabulary, as well as rules expressed in that vocabulary, and then learns to instantiate those rules on a per-task basis. This reduces the number of samples required to learn a representation of a new task.

研究の動機と目的

  • 新しい環境ごとにタスク固有の記号的表現を再び学習する際の非効率性に対処すること。
  • 異なるダイナミクスとレイアウトを持つタスクや環境間で記号的知識を転送できること。
  • オプション実行データから自律的に移植可能な記号的語彙を学ぶフレームワークを開発すること。
  • 移植可能な記号とタスク固有の情報の組み合わせが、計画に証明可能に十分な表現をもたらすことを示すこと。
  • 以前に学習した抽象化を再利用することで、新しいタスクのダイナミクスを学習するためのサンプル数を削減すること。

提案手法

  • フレームワークは、エージェントのセンサーモータ的視点に相対的なエゴセントリックな状態空間で記号的抽象化を学ぶ。この空間は環境のレイアウト変更に対して不変である。
  • 高次元のエゴセントリック観察に対してクラスタリングと密度推定を適用し、'ドアの近く'や'はしごの上'といった移植可能な記号的状態を同定する。
  • 空間的パーティションや環境的制約といったタスク固有の情報は別個に学習され、それらを用いて移植可能な記号をタスク固有の計画ルールに接地する。
  • 接地されたルールはPDDLにおけるラップドアクションオペレータとして表現され、各タスクごとにパラメータがインスタンス化され、抽象状態空間での計画が可能になる。
  • この方法は、移植可能な記号とタスク固有の接地情報の組み合わせが、計画に証明可能に十分な表現をもたらすことを示している。
  • 本手法は、Rod-and-BlockとTreasure Gameの2つのドメインで評価され、学習された抽象モデルを用いたモデルベース計画が実施された。

実験結果

リサーチクエスチョン

  • RQ1異なるレイアウトとダイナミクスを持つ環境に一般化可能な、タスクに依存しないエゴセントリック空間で記号的表現を学習できるか?
  • RQ2移植可能な記号的抽象化とタスク固有の情報の組み合わせが、整合的計画に十分な表現をもたらすか?
  • RQ3本フレームワークは、タスク固有の表現を再学習するのと比較して、新しいタスクのダイナミクスを学習するためのサンプル数を削減できるか?
  • RQ4移植可能な表現を用いた場合、経験したタスク数が増えるに従い、サンプル複雑性はどのように変化するか?
  • RQ5同じ記号的語彙とルールを、ダイナミクスや環境設定が異なる多様なタスク間でどの程度再利用できるか?

主な発見

  • 本フレームワークは、タスク固有の監視なしに、生のエゴセントリック観察から移植可能な記号的表現を学習でき、異なるレイアウトを持つ環境間で再利用可能である。
  • Rod-and-Blockドメインでは、2つのタスクを学習した後、タスク固有モデルを学習するためのサンプル数が約600から約330に低下し、非線形的増加を示した。
  • Treasure Gameでは、7つのレベルを経験した後、1レベルあたりのサンプル数が約1600から約700に減少し、経験に伴う一貫した削減が確認された。
  • 本手法は顕著なサンプル効率性の向上を達成した:1000のタスク設定において、10個の抽象モデルを用いたモデルベース計画は、1000個の個別なモデルフリー方策の必要性を置き換えた。
  • 本フレームワークは、タスク固有の情報で接地された移植可能な記号が、計画に証明可能に十分な表現をもたらすことを示した。これにより正しさと整合性が保証された。
  • 本手法は、異なるダイナミクスと空間的構成を持つタスク間で転移学習を可能にし、再学習の必要性を低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。