Skip to main content
QUICK REVIEW

[論文レビュー] Policy Evaluation in Continuous MDPs with Efficient Kernelized Gradient Temporal Difference

Alec Koppel, Garrett Warnell|arXiv (Cornell University)|Sep 13, 2017
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、再帰的ヒルバート空間(RKHS)におけるカーネル化関数近似を用いて、連続的なMDPにおける方策評価のためのメモリ効率的で非パrametricな手法、Parsimonious Kernel Gradient Temporal Difference(PKGTD)学習を提案する。この手法は、確率的準勾配法とスパース部分空間射影を組み合わせることで、減少するステップサイズを用いる場合にベルマン固定点への確実収束を達成し、定数ステップサイズを用いる場合に真の値関数の近傍への平均収束を達成する。また、有限のモデル複雑度を維持する。

ABSTRACT

We consider policy evaluation in infinite-horizon discounted Markov decision problems (MDPs) with infinite spaces. We reformulate this task a compositional stochastic program with a function-valued decision variable that belongs to a reproducing kernel Hilbert space (RKHS). We approach this problem via a new functional generalization of stochastic quasi-gradient methods operating in tandem with stochastic sparse subspace projections. The result is an extension of gradient temporal difference learning that yields nonlinearly parameterized value function estimates of the solution to the Bellman evaluation equation. Our main contribution is a memory-efficient non-parametric stochastic method guaranteed to converge exactly to the Bellman fixed point with probability $1$ with attenuating step-sizes. Further, with constant step-sizes, we obtain mean convergence to a neighborhood and that the value function estimates have finite complexity. In the Mountain Car domain, we observe faster convergence to lower Bellman error solutions than existing approaches with a fraction of the required memory.

研究の動機と目的

  • 無限ホライズンの連続的MDPにおける安定でメモリ効率的な価値関数推定の課題に対処すること。
  • 固定基底集合を必要とせず、複雑な価値関数を表現可能な非パrametric手法を開発することにより、柔軟で非線形な関数近似を可能にすること。
  • 無限次元関数空間でさえも、弱い仮定のもとで真の価値関数への収束を保証すること。
  • スパース部分空間射影を通じて有限のモデル複雑度を維持することで、実世界の応用に実用的であることを保証すること。
  • 顕著に削減されたメモリ使用量で、従来の手法よりも高速な収束と低いベルマン誤差を達成すること。

提案手法

  • 再帰的ヒルバート空間(RKHS)における関数値決定変数を有するコンポジショナル確率的最適化問題として、方策評価を再定式化する。
  • モデル複雑度を維持するため、確率的スパース部分空間射影と併用して機能的一般化された確率的準勾配法を導入する。
  • カーネル化された時系列差分更新と適応的圧縮を用いるParsimonious Kernel Gradient Temporal Difference(PKGTD)アルゴリズムを提案する。
  • カーネル関数を用いて即時の報酬とブートストラップされた価値推定値の両方を組み込んだカーネルベースの時系列差分更新を適用する。
  • サポートベクターの数を制限する圧縮メカニズムを用い、定数ステップサイズと固定予算のもとで有限のモデル順序を保証する。
  • RKHSの再帰的性質を活用して、効率的な機能的勾配更新を可能にするとともに、収束保証を維持する。

実験結果

リサーチクエスチョン

  • RQ1非パrametricでカーネルベースの手法は、コン pact な状態空間と行動空間を持つ連続的MDPにおいて、ベルマン固定点への確実収束を達成できるか?
  • RQ2収束を犠牲にせずに、非線形関数近似におけるメモリ効率をどのように確保できるか?
  • RQ3スパース部分空間射影は、RKHSにおける確率的勾配法の収束性と複雑度にどのような影響を与えるか?
  • RQ4顕著に削減されたメモリフットプリントで、従来の手法と比較してより高速な収束と低いベルマン誤差を達成できるか?
  • RQ5定数ステップサイズのもとで有限のモデル複雑度を保証する場合の平均収束に対する理論的保証は何か?

主な発見

  • 減衰するステップサイズを用いる場合、真の価値関数がRKHSに属するという仮定のもと、PKGTDはベルマン固定点への確率1収束を達成する。
  • 定数ステップサイズと固定圧縮予算のもと、本手法は真の価値関数の近傍への平均収束を保証し、有限のモデル複雑度を維持する。
  • マウンテンカー・ドメインにおいて、PKGTDは従来の手法よりも高速に収束し、低いベルマン誤差を達成するが、メモリ使用量はごくわずかである。
  • アルゴリズムは常に有限個のサポートベクターを維持しており、モデル複雑度が有界である。すべての $ t $ に対してモデル順序は有限の $ M^{ u} $ で有界である。
  • 理論的解析により、機能的確率的準勾配列が有界であり、射影機構が有限の被覆次元を保証することが確認され、実装の実用性が裏付けられる。
  • 機能的勾配に対して一様な決定的バインドが確立され、これは有限被覆の議論を支援し、圧縮表現の安定性を保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。