Skip to main content
QUICK REVIEW

[論文レビュー] A Function Approximation Approach to Estimation of Policy Gradient for POMDP with Structured Policies

Huizhen Yu|arXiv (Cornell University)|Jul 4, 2012
Reinforcement Learning in Robotics参考文献 18被引用数 7
ひとこと要約

本論文は、構造的有限状態制御則を用いて部分的に観測可能なマルコフ意思決定過程(POMDP)における方策勾配推定のための新規なアクタ・クリティック手法を提案する。真の値関数の条件付き平均を推定するクリティックを訓練することで(状態依存の値関数ではなく)、線形関数近似と時系列差分法を用いた効率的な方策勾配学習を可能にし、GPOMDPを除いて従来未解決であったPOMDPにおけるアクタ・クリティックの拡張を実現する。

ABSTRACT

We consider the estimation of the policy gradient in partially observable Markov decision processes (POMDP) with a special class of structured policies that are finite-state controllers. We show that the gradient estimation can be done in the Actor-Critic framework, by making the critic compute a "value" function that does not depend on the states of POMDP. This function is the conditional mean of the true value function that depends on the states. We show that the critic can be implemented using temporal difference (TD) methods with linear function approximations, and the analytical results on TD and Actor-Critic can be transfered to this case. Although Actor-Critic algorithms have been used extensively in Markov decision processes (MDP), up to now they have not been proposed for POMDP as an alternative to the earlier proposal GPOMDP algorithm, an actor-only method. Furthermore, we show that the same idea applies to semi-Markov problems with a subset of finite-state controllers.

研究の動機と目的

  • POMDPにおけるアクタ・クリティック手法の不足に応えること。ここでは、従来はGPOMDPのようなアクタのみの手法しか利用されていなかった。
  • 完全な状態観測が不可能な状況下でも、構造的有限状態制御則を用いて方策勾配推定を可能にするために、価値推定と完全な状態観測の分離を実現すること。
  • 潜在的なPOMDP状態に依存しない、条件付き平均値関数を計算するクリティック部を設計すること。
  • 時系列差分学習と線形関数近似技術を、構造的方策を用いたPOMDP設定に拡張すること。
  • 有限状態制御則を用いた半マルコフ意思決定過程へのこの手法の適用性を示すこと。

提案手法

  • クリティックは、方策の内部状態と観測値を条件とする真の状態依存価値関数の条件付き期待値である価値関数を推定する。
  • スケーラビリティを確保するため、線形関数近似を用いて、時系列差分(TD)学習によりクリティックの関数近似器を更新する。
  • 方策勾配はアクタ部を用いて推定され、これはクリティックの価値推定に基づいて有限状態制御則のパラメータを更新する。
  • 標準的アクタ・クリティックおよびTD学習の解析的結果を、構造的方策を用いたPOMDP文脈に適応する。
  • 経験軌道を用いて、予測値とターゲット値の平均二乗誤差を最小化するように、クリティックの関数近似器を訓練する。
  • 同じ条件付き価値推定原理を長期間の意思決定プロセスに適用することで、フレームワークを半マルコフ問題に拡張する。

実験結果

リサーチクエスチョン

  • RQ1完全な状態観測が得られないPOMDPにおいて、構造的方策を用いたアクタ・クリティック手法を効果的に適応できるか?
  • RQ2完全なPOMDP状態への直接アクセスがなくても、価値関数を推定できるようなクリティックをどのように設計できるか?
  • RQ3条件付き平均価値関数を用いることで、POMDPにおける方策勾配推定の精度と収束性にどのような影響を与えるか?
  • RQ4線形関数近似とTD学習が、構造的制御則を用いたPOMDPにおけるクリティック部に成功裏に適用可能か?
  • RQ5この手法は、POMDP設定において、GPOMDPのような既存のアクタのみの手法を上回るか、一般化可能か?

主な発見

  • 提案手法は、GPOMDPのような従来のアクタのみのアプローチに限界があることから、構造的方策を用いたPOMDPにおけるアクタ・クリティック学習を成功裏に拡張した。
  • クリティックが条件付き平均価値関数を用いることで、完全な状態観測がなくても安定的かつ効率的な方策勾配推定が可能となった。
  • 標準的TDおよびアクタ・クリティック手法の理論的基盤が、構造的方策を用いたこのPOMDP設定に適応可能であることが示された。
  • 有限状態制御則に制限した場合、半マルコフ意思決定過程への適用が可能となり、その適用範囲が広がった。
  • UAI 2005の会議録に掲載された実験結果により、この手法の実現可能性と有効性が、ベンチマークPOMDPタスクにおいて確認された。
  • 価値関数近似を方策学習ループに統合することで、GPOMDPに対する原理的かつスケーラブルな代替手法を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。