Skip to main content
QUICK REVIEW

[論文レビュー] CAMPs: Learning Context-Specific Abstractions for Efficient Planning in Factored MDPs

Rohan Chitnis, Tom Silver|arXiv (Cornell University)|Jul 26, 2020
AI-based Problem Solving and Planning被引用数 7
ひとこと要約

本稿では、自己課せられた制約を通じて文脈特異的独立性(CSI)を誘発することにより、因子分解 MDP における計画の効率を向上させる学習ベースの手法である文脈特異的抽象 MDP(CAMPs)を提案する。報酬と計算コストのトレードオフを最適化する文脈セレクタを訓練することで、CAMPs は多様なドメインにおいて高速かつ近似的に最適な計画を可能にし、ベースライン計画法およびドメイン特化アルゴリズムを上回る性能を示した。ロボットナビゲーションおよび操作タスクにおいて有効である。

ABSTRACT

Meta-planning, or learning to guide planning from experience, is a promising approach to improving the computational cost of planning. A general meta-planning strategy is to learn to impose constraints on the states considered and actions taken by the agent. We observe that (1) imposing a constraint can induce context-specific independences that render some aspects of the domain irrelevant, and (2) an agent can take advantage of this fact by imposing constraints on its own behavior. These observations lead us to propose the context-specific abstract Markov decision process (CAMP), an abstraction of a factored MDP that affords efficient planning. We then describe how to learn constraints to impose so the CAMP optimizes a trade-off between rewards and computational cost. Our experiments consider five planners across four domains, including robotic navigation among movable obstacles (NAMO), robotic task and motion planning for sequential manipulation, and classical planning. We find planning with learned CAMPs to consistently outperform baselines, including Stilman's NAMO-specific algorithm. Video: https://youtu.be/wTXt6djcAd4 Code: https://git.io/JTnf6

研究の動機と目的

  • 複雑な因子分解 MDP におけるオンライン計画の高い計算コストに対処すること。
  • 自己課せられた制約によって誘発される文脈特異的独立性(CSI)を活用することで、計画の効率を向上させること。
  • 計画の報酬と計算コストのトレードオフを最適化する文脈セレクタを学習すること。
  • ロボティクスナビゲーション、順序付けられた操作、古典的計画など、多様なドメインに一般化すること。
  • 直接的に反応的ポリシーを学習するのではなく、文脈を課すことの学習が、より汎用的かつ効果的であることを示すこと。

提案手法

  • 本手法は、自己課せられた制約によって誘発される変数の無関係性に基づき、元の因子分解 MDP を抽象化する文脈特異的抽象 MDP(CAMPs)を導入する。
  • 事前に得られた計画経験データに基づき、教師あり学習または模倣学習を用いて、与えられたタスクに最適な制約を予測する文脈セレクタを学習する。
  • 文脈セレクタは、期待報酬と計算コストの加重目的関数を最大化するように訓練され、パラメータ λ でパrameter化される。
  • CSI はトレーニングタスクから同定され、その結果得られた CAMPs をテスト時に効率的に計画に利用する。
  • 文脈誘発変数の無関係性から導かれる構造的抽象化の仮説空間を用いることで、完全な MDP 解法なしに効率的な計画が可能になる。
  • CAMPs に対して複数の計画法(例:モンテカルロツリー探索、FastDownward、タスク・モーション計画法)を適用し、汎用性と頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1計画における自己課せられた制約が、計画の複雑さを顕著に低減する文脈特異的独立性を誘発できるか?
  • RQ2学習された文脈セレクタが、手作業で設計されたまたはドメイン特化された計画法よりも報酬と計算効率の両面で優れているか?
  • RQ3複雑な因子分解 MDP において、反応的ポリシーを直接学習するのではなく、有用な制約を予測する学習が、より一般化しやすいか?
  • RQ4異なる文脈選択における報酬と計画コストのトレードオフはどのように変化するか?また、効果的に最適化可能か?
  • RQ5CAMPs は、離散的・連続的状態、関係構造、スパarsな報酬を有する多様なドメインに効果的に適用可能か?

主な発見

  • CAMPs に汎用的なタスク・モーション計画法を適用した場合、報酬と計画速度の両面で、ドメイン特化 NAMO アルゴリズムである Stilman の NAMO アルゴリズムを上回った。
  • NAMO ドメインにおいて、CAMPs は複数の同等の経路が存在する状況でも、より高速にゴールに到達し、より高い報酬を達成するように、文脈制約を学習した。
  • すべての λ 値において、CAMP ポリシーの目的関数値は、ランダムポリシーを常に上回ったが、純粋な計画では λ が増加するにつれて著しく劣化した。
  • 古典的計画および順序付けられた操作を含む4つのドメインにおいて、学習済み CAMPs を用いた計画は、すべてのベースライン計画法を上回った。
  • 報酬と計算コストのバランスが強く、λ = 0(純粋な計画)から λ → ∞(ランダム行動選択)にかけて、報酬が滑らかに補間された。
  • スパース報酬と長い計画ホライズンを有する複雑な環境においても、文脈セレクタは有用な制約を効果的に同定し、トレーニングデータを超えた一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。