Skip to main content
QUICK REVIEW

[論文レビュー] On the convergence of optimistic policy iteration for stochastic shortest path problem

Yuanlong Chen|arXiv (Cornell University)|Aug 27, 2018
Optimization and Search Problems参考文献 4被引用数 3
ひとこと要約

本稿は、割引係数α=1の状態確率的最短路問題に対して、モンテカルロ法およびTD(λ)法を用いた方策評価における楽観的方策反復の収束を、割引ありおよび割引なし(α=1)の設定で確立している。収束は収縮論法と価値更新における誤差伝播の有界性を用いて保証され、最適な到着コスト関数へ収束することが証明されている。

ABSTRACT

In this paper, we prove some convergence results of a special case of optimistic policy iteration algorithm for stochastic shortest path problem. We consider both Monte Carlo and $TD(λ)$ methods for the policy evaluation step under the condition that the termination state will eventually be reached almost surely.

研究の動機と目的

  • 割引係数α=1の状態確率的最短路問題に対して、楽観的方策反復の収束を確立すること。
  • 適切な方策のもとで、方策評価にモンテカルロ法またはTD(λ)法を用いる場合の収束挙動を分析すること。
  • 近似的な方策評価が行われる場合でも、アルゴリズムが最適な到着コストベクトルへ収束することを証明すること。
  • 従来の方策反復の収束結果を、価値更新における誤差が有界である楽観的設定へ拡張すること。

提案手法

  • 価値関数評価と方策評価にそれぞれ標準的な動的計画法の作用素TおよびTμを用いる。
  • 収束解析のため、最大ノルムおよび重み付き最大ノルムを価値ベクトルの収束性に適用する。
  • 収縮論法と誤差伝播の上限を求めるために、列YtおよびYtlを用いた比較原理を採用する。
  • マーチンゲール的ノイズ項を処理するため、停止過程v^l(t)を導入し、有界な分散のもとで収束を保証する。
  • 有界性およびlimsup(c_t) ≤ 0に基づき、大きなtおよびkに対してT_{μ_t}^{k+1}J_t ≤ TJ_t + εが導かれる、重要な不等式を用いる。
  • 収縮の再帰的更新式J_{t+1} ≤ (1−γ_t)J_t + γ_t(TJ_t + ε) + γ_tω_tを用いて収束を確立し、εは任意に小さい。

実験結果

リサーチクエスチョン

  • RQ1方策評価がモンテカルロ法またはTD(λ)法によって近似的に行われる場合、楽観的方策反復は収束するか?
  • RQ2適切な方策のもとで、α=1の状態確率的最短路問題において収束を保証できるか?
  • RQ3方策評価における有界な誤差が、価値関数の最適解への収束に与える影響は何か?
  • RQ4近似誤差が存在する中で、価値ベクトルの列が最適な到達コストベクトルへ収束するための条件は何か?
  • RQ5一般の方策評価スキームを用いた楽観的方策反復フレームワークへ、収束証明を拡張できるか?

主な発見

  • すべての方策が適切であると仮定すると、アルゴリズムはα=1のもとで最適な到達コストベクトルJ*へ収束する。
  • 任意のε>0に対して、t(ε)が存在し、すべてのt≥t(ε)において、近似的な方策評価が(1−λ)∑λ^k T_{μ_t}^{k+1}J_t ≤ TJ_t + εeを満たす。
  • t→∞のとき、価値ベクトルの列J_tはJ*へ収束し、徐々に小さくなるノイズ項と誤差項のおかげで、誤差c_tのlimsupが0に抑えられる。
  • 停止過程v^l(t)の使用により、誤差列v_tが収束を妨げないことが保証され、結果としてY_tはεeに収束し、ε→0のときY_t → 0となる。
  • 収束証明はY_tを用いた比較論法に依存しており、Y_tがεeに収束することが示され、結果として価値更新における誤差が極限で消えることが示される。
  • モンテカルロ法およびTD(λ)法の両方において、方策評価誤差が有界でかつ方策が適切である限り、結果は成り立つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。