Skip to main content
QUICK REVIEW

[論文レビュー] Policy Iteration for Relational MDPs

Chenggang Wang, Roni Khardon|arXiv (Cornell University)|Jun 20, 2012
Reinforcement Learning in Robotics参考文献 11被引用数 13
ひとこと要約

本論文は、標準的な方策反復が方策の正しく評価または改善できない代表的異常を解消するため、関係的マルコフ決定過程(RMDP)のための新しい方策反復アルゴリズムを提案する。提案手法は、改善フェーズを評価フェーズに統合することで、従来の関係的表現における問題にもかかわらず最適方策への収束を保証する。

ABSTRACT

Relational Markov Decision Processes are a useful abstraction for complex reinforcement learning problems and stochastic planning problems. Recent work developed representation schemes and algorithms for planning in such problems using the value iteration algorithm. However, exact versions of more complex algorithms, including policy iteration, have not been developed or analyzed. The paper investigates this potential and makes several contributions. First we observe two anomalies for relational representations showing that the value of some policies is not well defined or cannot be calculated for restricted representation schemes used in the literature. On the other hand, we develop a variant of policy iteration that can get around these anomalies. The algorithm includes an aspect of policy improvement in the process of policy evaluation and thus differs from the original algorithm. We show that despite this difference the algorithm converges to the optimal policy.

研究の動機と目的

  • 既存の価値反復アプローチがあるにもかかわらず、関係的MDPのための正確な方策反復アルゴリズムの欠如に対処すること。
  • 標準的手法で不正しく定義されたり計算不能になったりする関係的表現における代表的異常を特定・解決すること。
  • 関係的構造と記号的表現を扱いながらも収束を保証する方策反復の変種を設計すること。
  • 関係的計画フレームワークにおける方策評価および改善の正しさと完全性を保証すること。

提案手法

  • 古典的な二段階反復とは異なり、方策評価プロセス内に方策改善を統合した、変更された方策反復フレームワークを導入する。
  • 状態と行動の記号的記述を可能にする関係的表現を採用し、状態インスタンス間での一般化を可能にする。
  • 接地状態ではなく関係的テンプレート上で動作するラップドベルマン更新を用いることで、計算中に構造を保持する。
  • 最適方策への収束を保証するために、関係的方策表現における不動点反復メカニズムを適用する。
  • 標準的手法が失敗する状況でも、方策価値計算が常に正しく定義されるように異常を処理する。
  • 反復全体を通して方策関数と価値関数を関係的形で維持する記号的動的計画法を採用する。

実験結果

リサーチクエスチョン

  • RQ1代表的制限があるにもかかわらず、方策反復を関係的MDPに意味的に拡張することは可能か?
  • RQ2標準的な方策反復が正しく機能しない原因となる関係的方策評価における異常は何か?
  • RQ3正しさと収束を保つために、方策改善を評価フェーズに統合する方法は何か?
  • RQ4接地を一切行わずに、完全に関係的・記号的空間で動作する方策反復アルゴリズムを設計することは可能か?
  • RQ5定義された関係的表現のもとで、提案されたアルゴリズムは最適方策に収束するか?

主な発見

  • 本論文は、関係的方策表現における2つの根本的異常を同定した:標準的手法で正しく定義されない方策価値、および制限付きスキーム下で計算不能な価値関数。
  • 提案手法は、改善を評価段階に統合することで、これらの異常を効果的に回避し、価値計算が常に正しく定義されるように保証する。
  • 古典的な方策反復とは異なるが、有限時間内に最適方策への収束が保証されることが証明された。
  • 接地状態の列挙を回避するため、記号的・関係的表現を反復全体にわたり維持する。
  • 関係的方策学習において正しさと完全性を実現し、構造的確率的環境における正確な計画を可能にする。
  • 従来は近似価値反復に限られていた複雑な関係的ドメインにおいて、正確な計画の基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。