Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compact Models for Planning with Exogenous Processes

Rohan Chitnis, Tomás Lozano‐Pérez|arXiv (Cornell University)|Sep 30, 2019
Reinforcement Learning in Robotics参考文献 16被引用数 7
ひとこと要約

本論文では、タスク関連の結果を予測する動的特性を持つ、外生的変数のサブセット(相互情報量を用いて選択)を用いることで、大きな外生的状態空間を有するMDPにおけるコンパクトな計画モデルを学習する実行可能アルゴリズムを提案する。この手法により、関連する環境変数にのみ注目することで、効率的かつ高性能な計画が可能となり、小規模なドメインでは競争力のある報酬を達成するとともに、シミュレーテッドロボット操作タスクにおける大規模な外生的状態空間へもスケーリング可能である。

ABSTRACT

We address the problem of approximate model minimization for MDPs in which the state is partitioned into endogenous and (much larger) exogenous components. An exogenous state variable is one whose dynamics are independent of the agent's actions. We formalize the mask-learning problem, in which the agent must choose a subset of exogenous state variables to reason about when planning; doing planning in such a reduced state space can often be significantly more efficient than planning in the full model. We then explore the various value functions at play within this setting, and describe conditions under which a policy for a reduced model will be optimal for the full MDP. The analysis leads us to a tractable approximate algorithm that draws upon the notion of mutual information among exogenous state variables. We validate our approach in simulated robotic manipulation domains where a robot is placed in a busy environment, in which there are many other agents also interacting with the objects. Visit http://tinyurl.com/chitnis-exogenous for a supplementary video.

研究の動機と目的

  • 状態空間が内生的(行動によって制御可能)および大規模な外生的(行動に依存しない)成分に分割されるMDPにおいて、効率的な計画を実現する課題に対処すること。
  • 「マスク学習問題」を形式化すること——つまり、完全なMDPにおける近似的最適計画を可能にする最小限の外生的変数のサブセットを選択すること。
  • 報酬関数および遷移ダイナミクスが加法的分解不可能な場合を含め、縮小モデル上で最適化された方策が完全MDPでも最適である条件を同定すること。
  • 外生性と相互情報量を活用して、計画に必要な関連外生的変数を特定する、実行可能でデータ効率の良いアルゴリズムを開発すること。
  • 動的でマルチエージェントの相互作用を有するシミュレーテッドロボット環境において、本手法を検証し、スケーラビリティと性能を示すこと。

提案手法

  • 外生的状態変数のサブセットを含む縮小MDPモデルにマスクを適用する問題を形式化し、計画コストを最小限に抑えつつ解の質を維持することを目的とする。
  • タスク関連の動的特性(例:物体の位置)と外生的変数との間の相互情報量を、関連性の代理指標として用い、効率的な変数選択を可能にする。
  • 将来の動的特性を予測する際の推定情報量の増分に基づき、1つの外生的変数を段階的にマスクに追加する貪欲な反復的アルゴリズムを構築する。
  • 外生性仮定を活用し、選択された変数のみに対して遷移モデルを学習することで、モデルの複雑さと計算時間を削減する。
  • 期待報酬とマスクサイズの両立を促進する正則化された目的関数を最適化し、性能を損なわせずにコンパクトさを実現する。
  • pybulletを用いて環境シミュレーションと評価を実施し、複数エージェントを含むシミュレーテッドロボット操作タスクに本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1外生的状態変数のサブセットを含む縮小MDPにおいて最適な方策が、完全MDPでも最適であるのはどのような条件下か?
  • RQ2報酬関数の加法的分解を仮定しない状況でも、完全MDPにおける高い報酬を維持できる最小の外生的変数の集合を、どのように効率的に特定できるか?
  • RQ3外生的変数同士の相互情報量は、計画に必要な変数を特定するための信頼できるヒューリスティックとして機能するか?
  • RQ4本手法は、外生性を利用しないベースライン手法と比較して、大規模な外生的状態空間においてどのようにスケーリングするか?
  • RQ5本アルゴリズムは、タスクに応じて異なるマスクを学習でき、タスク固有の外生的ダイナミクスの関連性を反映できるか?

主な発見

  • 提案手法は、小規模ドメインにおいて完全モデル計画と比較して競争力のある報酬を達成し、モデルの縮小にもかかわらず最小限の性能損失を示した。
  • 外生性や動的関連性を活用しないベースライン戦略に比べ、特に高次元の外生的状態空間を有する環境で優れた性能を発揮した。
  • アルゴリズムはタスク固有のマスクを効果的に学習した——非操作可能な物体を含むタスクでは、他のエージェントの状態を無視したのに対し、操作可能な物体を含むタスクでは関連エージェントの状態を含めた。
  • 学習されたマスクは直感的なタスク依存関係を反映していた——関係のない環境領域を除外し、物体ダイナミクスに影響を与えるエージェントに焦点を当てた。
  • 本手法は大規模な外生的状態空間へもスケーリング可能であり、完全計画が非現実的となる状況でも、効率性と性能を維持した。
  • 貪欲なマスク拡張は有効であったが、逐次的選択の制限により、将来の研究で同時に複数の変数を選択するアプローチにより、より高い予測力が得られる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。