Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing over a Restricted Policy Class in Markov Decision Processes

Ershad Banijamali, Yasin Abbasi-Yadkori|arXiv (Cornell University)|Feb 26, 2018
Reinforcement Learning in Robotics参考文献 2被引用数 3
ひとこと要約

本論文は、マルコフ決定過程(MDPs)における既知の基本方策の凸包として定義される制限付き方策クラスにおける最適化のための効率的なアルゴリズムを提案する。問題を占有測度の双対空間に再定式化し、確率的劣勾配法を用いることで、状態数に線形に依存し、基本方策の数に対して多項式時間で近似的に最適な性能を達成する。これは、方策評価が高コストである場合に特に顕著な計算上の利点を提供し、方策勾配法よりも顕著な優位性を示す。

ABSTRACT

We address the problem of finding an optimal policy in a Markov decision process under a restricted policy class defined by the convex hull of a set of base policies. This problem is of great interest in applications in which a number of reasonably good (or safe) policies are already known and we are only interested in optimizing in their convex hull. We show that this problem is NP-hard to solve exactly as well as to approximate to arbitrary accuracy. However, under a condition that is akin to the occupancy measures of the base policies having large overlap, we show that there exists an efficient algorithm that finds a policy that is almost as good as the best convex combination of the base policies. The running time of the proposed algorithm is linear in the number of states and polynomial in the number of base policies. In practice, we demonstrate an efficient implementation for large state problems. Compared to traditional policy gradient methods, the proposed approach has the advantage that, apart from the computation of occupancy measures of some base policies, the iterative method need not interact with the environment during the optimization process. This is especially important in complex systems where estimating the value of a policy can be a time consuming process.

研究の動機と目的

  • 既知の、ある程度優れたまたは安全な基本方策の集合の凸包として定義される制限付き方策クラスにおける最適方策の探索という課題に対処すること。
  • このクラスにおける正確または近似的な最適化がNP困難であることが示されているにもかかわらず、計算的に非現実的であるという課題を克服すること。
  • 占有測度の重なりが十分にある場合に、近似的に最適な性能を達成する実用的で効率的なアルゴリズムを開発すること。
  • 方策評価が高コストである複雑なシステムにおいて、最適化中の環境との相互作用を減らし、収束を高速化すること。
  • バックワードシミュレータや重要度重み付けの必要を回避する手法を提供し、実装を簡素化するとともに理論的バウンディングを厳密にする。

提案手法

  • 方策最適化問題を、基本方策の占有測度の線形結合からなる探索空間を有する、占有測度の双対空間に再定式化する。
  • Abbasi-Yadkoriら(2014)にインspiredされた凸緩和技術を用いて制約違反を扱い、効率的な最適化を可能にする。
  • 双対目的関数を最小化するために確率的劣勾配法を適用する。この目的関数は非凸であるが、緩和により近似可能である。
  • 占有測度の線形結合を正規化することで有効な方策を構築し、最適化中に前方シミュレーションを必要としない。
  • 基本方策の定常占有測度を事前にオフラインで計算し、以降の最適化を環境との相互作用なしに双対空間ですべて実行する。
  • 占有測度の重なりを活用することで、プライム空間がNP困難であっても、双対空間で非自明で高性能な方策を生成可能であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1MDPsにおける有限個の基本方策の凸包として定義される制限付き方策クラスにおいて、効率的に最適化することは可能か?
  • RQ2基本方策の数に対して多項式時間、状態数に対して線形依存で、この制限付きクラスで近似的に最適な性能を達成することは可能か?
  • RQ3基本方策の占有測度の重なりは、双対空間最適化の性能と実現可能性にどのように影響するか?
  • RQ4特に方策評価が高コストな場合に、最適化中に繰り返し環境との相互作用を必要としなくてもよいか?
  • RQ5この設定において、従来の方策勾配法と比較して、占有測度の双対空間を用いる手法の理論的および実効的利点は何か?

主な発見

  • MDPsにおける基本方策の凸包上での最適化問題は、正確に解くことおよび任意の精度で近似的に解くことの両方がNP困難である。
  • 基本方策の占有測度に顕著な重なりがある場合、提案された双対空間アルゴリズムは、基本方策の最良凸結合とほぼ同等の性能を達成する。
  • アルゴリズムの実行時間は状態数に対して線形で、基本方策の数に対して多項式時間であり、方策勾配法に比べて顕著な計算上の利点を示す。
  • 8キュー問題では、双対空間法は最適な双対重み θ = [1.1246, -0.1143, -0.0102] を用いてコスト20.59を達成し、基本方策を上回り、方策勾配法の19.14に近い結果を得ながらもはるかに低い計算コストで実現した。
  • 重要度重み付けやバックワードシミュレータの必要を回避することで、実装を簡素化し、先行する双対空間手法と比較して誤差バウンディングを厳密にした。
  • 実験的結果から、方策評価が高コストな環境において、双対空間の確率的劣勾配法は方策勾配法よりも収束が早く、分散が小さいことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。