Skip to main content
QUICK REVIEW

[論文レビュー] First Order Decision Diagrams for Relational MDPs

Chenggang Wang, Saket Joshi|Oct 31, 2011
Bayesian Modeling and Causal Inference参考文献 33被引用数 7
ひとこと要約

本稿では、オブジェクト構造を持つドメイン上の関数をコンパクトで関係的表現として扱える First Order Decision Diagrams (FODDs) を導入する。FODDs を用いることで、グランドイングを伴わずに関係的MDPにおける効率的な価値反復が可能となり、ドメインサイズの変化に対しても一般化が可能であり、最適な抽象方策への収束を示している。

ABSTRACT

Markov decision processes capture sequential decision making under uncertainty, where an agent must choose actions so as to optimize long term reward. The paper studies efficient reasoning mechanisms for Relational Markov Decision Processes (RMDP) where world states have an internal relational structure that can be naturally described in terms of objects and relations among them. Two contributions are presented. First, the paper develops First Order Decision Diagrams (FODD), a new compact representation for functions over relational structures, together with a set of operators to combine FODDs, and novel reduction techniques to keep the representation small. Second, the paper shows how FODDs can be used to develop solutions for RMDPs, where reasoning is performed at the abstract level and the resulting optimal policy is independent of domain size (number of objects) or instantiation. In particular, a variant of the value iteration algorithm is developed by using special operations over FODDs, and the algorithm is shown to converge to the optimal policy.

研究の動機と目的

  • オブジェクト構造を持つ大規模または無限のドメインにおいて、命題的MDPのスケーラビリティの限界を克服すること。
  • 関係的ドメインにおける価値関数と方策のためのコンパクトで汎用的な表現を構築すること。
  • グランドイングを伴わない意思決定理論的計画を可能とし、推論と解法がドメインサイズに依存しないようにすること。
  • FODDs上で直接作業する価値反復アルゴリズムを設計し、関係的MDPにおける最適方策を計算すること。
  • 抽象的推論に基づくFODDベースの価値反復における理論的収束保証を提供すること。

提案手法

  • 一階論理構造への代数的意思決定図(ADDs)の一般化として、First Order Decision Diagrams (FODDs) を提案する。
  • FODDの結合に適した演算子のセットを定義し、行動適用、価値集約、方策最大化の操作を含む。
  • 意味的同等性を保持したままFODDのサイズを最小化するための新規削減技術を導入する。
  • 状態列挙を伴わずに価値関数を計算するためにFODD操作を用いる関係的価値反復アルゴリズムを開発する。
  • FODDベースの表現を通じて確率的行動効果と報酬をサポートし、遷移関数と報酬関数のコンパクトなモデル化を可能にする。
  • 状態パーティション間の共有構造を活用して表現を圧縮し、メモリ効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1命題的ドメインから一階論理ドメインへと意思決定図の表現を一般化することは可能か? これにより、スケーラブルなMDP推論が可能になるか?
  • RQ2FODDsは、グランドイングを回避しつつ、関係的MDPにおける効率的な価値反復をサポートできるように設計できるか?
  • RQ3反復的価値関数更新の過程でFODDのサイズを小さく保つために必要な削減および正規化操作は何か?
  • RQ4FODDベースの価値反復は、無限のドメインインスタンスを含むすべてのインスタンスにおいて、最適な抽象方策に収束するか?
  • RQ5FODDsの表現力は、ReBel や SDP といった既存手法と比較して、モデルの柔軟性と計算効率の面で優れているか?

主な発見

  • FODDsは、ドメインサイズに依存しない関係的MDPにおける価値関数と方策のコンパクトで汎用的な表現を提供する。
  • FODDベースの価値反復アルゴリズムは、そのような解が存在する場合、最適な抽象的価値関数に収束する。
  • 本手法はオブジェクト最大化と状態パーティション間の共有構造をサポートしており、命題的グランドイングと比較してメモリと実行時間の両方の節約が可能である。
  • FODDsは確率的STRIPS風の行動と報酬関数を表現可能であり、ドメインダイナミクスの柔軟なモデル化を可能にする。
  • 本手法は一般化を可能にする:FODDsを用いて導出された1つの方策は、無限のインスタンスを含むすべてのドメインインスタンスにおいて最適である。
  • 同様の値を持つリーフを統合することで近似が可能であり、正確さとFODDサイズのトレードオフを実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。