Skip to main content
QUICK REVIEW

[論文レビュー] Policy Evaluation with Variance Related Risk Criteria in Markov Decision Processes

Aviv Tamar, Dotan Di Castro|arXiv (Cornell University)|Jan 1, 2013
Simulation Techniques and Applications参考文献 5被引用数 4
ひとこと要約

本稿では、線形関数近似を用いた、マルコフ決定過程における価値関数と2次モーメント関数の共同推定のためのTD(0)およびLSTD(λ)アルゴリズムを提案する。これにより、分散に配慮した方策評価が可能になる。本手法は、J(期待報酬)およびM(2次モーメント)の両方に対して射影ベルマン方程式を用い、分散をV = M − J²として導出する。また、非負の分散推定を保証するための制約付き更新を導入した。実験では、分散が価値関数だけでは見えないリスクパターンを明らかにする4次元連続領域のパチンコ型迷路で検証された。

ABSTRACT

In this paper we extend temporal difference policy evaluation algorithms to performance criteria that include the variance of the cumulative reward. Such criteria are useful for risk management, and are important in domains such as finance and process control. We propose both TD(0) and LSTD(lambda) variants with linear function approximation, prove their convergence, and demonstrate their utility in a 4-dimensional continuous state space problem.

研究の動機と目的

  • ファイナンスや制御分野におけるリスクセンシティブな応用にとって不可欠な、報酬分散を組み込んだ性能基準への時系列学習の拡張を目的とする。
  • 線形関数近似を用いて、累積報酬の期待値(J)と2次モーメント(M)を共同で推定するアルゴリズムの開発を目的とする。
  • 制約付き時系列差分更新により、推定された分散が非負となるように保証することを目的とする。
  • 分散推定の実用的価値が、平均性能のみでは明らかでない方策のリスク特性を明らかにする点を実験的に示すこと。

提案手法

  • J(x)およびM(x)のベルマンに類似した方程式系を導出する。ここでM(x)はリターンの2次モーメントを表す。
  • JおよびMの推定値を同時に更新する、TD(0)の変種を提案する。この更新は、連合時系列差分更新則に基づく。
  • 線形関数近似を用いて、JおよびMの射影固定点方程式を解くLSTD(λ)の変種を開発する。
  • M ≥ J²を満たすように制御するための制約付きTD更新を導入する。
  • 推定されたJおよびMからV(x) = M(x) − J(x)²の関係を用いて、リターンの分散を計算する。
  • 実験的評価において、関数近似にユニフォームタイルコーディング特徴およびλリターンを用いる。

実験結果

リサーチクエスチョン

  • RQ1関数近似を用いた場合に、時系列学習手法を、MDPにおける累積報酬の平均と分散を同時に推定するものに拡張可能か?
  • RQ2線形関数近似を用いた方策評価において、分散推定をどのようにして強固かつ非負に保証できるか?
  • RQ3連続状態領域における方策解釈に、分散推定が与える影響は何か?
  • RQ4提案手法は、ナーブな標本分散推定と比較して、データ効率および精度の点で優れているか?
  • RQ5分散推定は、価値関数だけでは明らかでない、方針のリスクパターンを明らかにできるか?

主な発見

  • 提案されたTD(0)およびLSTD(λ)アルゴリズムは、標準的な仮定の下で正しいJおよびMの推定値に収束し、形式的な収束保証が与えられている。
  • 制約付きTD更新は、統計的原則に反する負の分散予測を回避するため、非負の分散推定を成功裏に保証した。
  • 4次元ピンバック型迷路では、価値関数だけではリスクが高くなると示唆されない、急なカーブの直前のような高リスク領域が分散関数によって明らかになった。
  • LSTD(λ)手法は3,000件の軌道でのみ標準偏差関数を推定できたが、ナーブな標本分散推定では同等の精度を得るには125万件の軌道が必要だった。
  • 分散関数は、ゴールまでの距離に対して単調でなく、非線形的であった。これは、平均性能では捉えきれない複雑なリスク構造を示している。
  • 本手法は、高次元連続状態空間においても分散関数を効果的に推定でき、リスクに配慮した方策評価の実用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。