Skip to main content
QUICK REVIEW

[論文レビュー] Approximate Linear Programming for First-order MDPs

Scott Sanner, Craig Boutilier|arXiv (Cornell University)|Jul 4, 2012
Elevator Systems and Control参考文献 13被引用数 10
ひとこと要約

本稿では、一階論理的基底関数上で価値関数を線形に表現し、結果として得られる最適化問題を市販の定理証明器および線形プログラミング(LP)ソルバを用いて解くことにより、一階マルコフ決定過程(FOMDPs)に対する近似線形プログラミング(ALP)手法を提案する。この手法により、すべての具体化において証明可能な近似誤差バウンドを伴うドメインに依存しないポリシー学習が可能となり、多基準のエレベータスケジューリングタスクにおいてヒューリスティックなポリシーを上回る性能を発揮する。

ABSTRACT

We introduce a new approximate solution technique for first-order Markov decision processes (FOMDPs). Representing the value function linearly w.r.t. a set of first-order basis functions, we compute suitable weights by casting the corresponding optimization as a first-order linear program and show how off-the-shelf theorem prover and LP software can be effectively used. This technique allows one to solve FOMDPs independent of a specific domain instantiation; furthermore, it allows one to determine bounds on approximation error that apply equally to all domain instantiations. We apply this solution technique to the task of elevator scheduling with a rich feature space and multi-criteria additive reward, and demonstrate that it outperforms a number of intuitive, heuristicallyguided policies.

研究の動機と目的

  • 豊かな関係的構造を持つ大規模で複雑なMDPを解く挑戦に応えるために、ドメインに依存しないポリシー学習を可能にする。
  • ドメイン具体化における明示的グランドイングを回避する、一階MDPのスケーラブルな解法技術を開発する。
  • すべてのドメイン具体化に一様に適用可能な近似誤差の証明可能なバウンドを提供する。
  • 複雑な特徴空間を持つ現実世界の多基準スケジューリング問題において、本手法の有効性を示す。

提案手法

  • 価値関数を一階論理的基底関数の線形結合として表現することで、コンパクトで関係的表現を可能にする。
  • グランドイングを回避するための一階表現を用いて、基底関数の重みベクトル上で近似線形プログラミング問題を定式化する。
  • ベルマン方程式から導かれる制約の妥当性を、市販の一階定理証明器を効率的に活用して検証する。
  • 標準的な線形プログラミングソルバを統合し、基底関数の最適な重みを計算する。
  • 再計算なしに、FOMDPのいかなる具体化においても、得られたポリシーを用いて意思決定を行う。
  • LP定式化を通じて、すべてのドメイン具体化に一様に適用可能な近似誤差バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1近似線形プログラミングを、ドメインインスタンスのグランドイングを回避するために、一階MDPに効果的に適応できるか?
  • RQ2一階定理証明器を用いて、FOMDPsのALP定式化における制約の生成と検証を効率的に行えるか?
  • RQ3提案手法が、すべてのドメイン具体化に適用可能な、価値関数近似における証明可能な誤差バウンドを提供するか?
  • RQ4ALPに基づくポリシーの性能は、複雑な現実世界のスケジューリングタスクにおけるヒューリスティックなポリシーと比較してどうなるか?

主な発見

  • 提案されたALP手法は、グランドイングを伴わずFOMDPを効率的に解くことができ、すべてのドメイン具体化における効率的なポリシー学習を可能にする。
  • 本手法は、FOMDPのすべての可能な具体化に適用可能な一様な近似誤差バウンドを提供する。
  • 豊かな特徴空間と多基準報酬を有するエレベータスケジューリングドメインにおいて、ALPに基づくポリシーは複数のヒューリスティック指向ポリシーを上回った。
  • 一階定理証明器とLPソルバの統合により、スケーラブルかつ正しく制約生成と最適化が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。