Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Rate of Convergence for Quasi-Stochastic Approximation

Andrey Bernstein, Yue Chen|arXiv (Cornell University)|Mar 18, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 5
ひとこと要約

本稿では、分散を低減し、最適な 1/t 収束レートを達成するため、確率的近似の決定的代替手法である準確率的近似(QSA)を導入する。ランダムノイズの代わりに構造的で非ランダムな信号を用いることで、強化学習および最適制御における収束速度を向上させる。Hurwitz安定性条件の下で理論的保証が得られ、収束速度解析に新規な結合論法が用いられる。

ABSTRACT

The Robbins-Monro stochastic approximation algorithm is a foundation of many algorithmic frameworks for reinforcement learning (RL), and often an efficient approach to solving (or approximating the solution to) complex optimal control problems. However, in many cases practitioners are unable to apply these techniques because of an inherent high variance. This paper aims to provide a general foundation for "quasi-stochastic approximation," in which all of the processes under consideration are deterministic, much like quasi-Monte-Carlo for variance reduction in simulation. The variance reduction can be substantial, subject to tuning of pertinent parameters in the algorithm. This paper introduces a new coupling argument to establish optimal rate of convergence provided the gain is sufficiently large. These results are established for linear models, and tested also in non-ideal settings. A major application of these general results is a new class of RL algorithms for deterministic state space models. In this setting, the main contribution is a class of algorithms for approximating the value function for a given policy, using a different policy designed to introduce exploration.

研究の動機と目的

  • 確率的近似の代替として、根の特定および最適化における分散を低減する決定的手法の開発。
  • 決定的で周期的な信号の下で、準確率的近似(QSA)の最適収束レートの確立。
  • 決定的ダイナミクスを用いたQ学習応用で観察された高速収束の理論的基盤の提供。
  • 古典的確率的近似理論を、厳密な収束速度解析を伴う決定的信号駆動型再帰に拡張すること。

提案手法

  • 連続時間の再帰的更新を用いる:dθ/dt = a(t)f(θ(t), ξ(t))、ここでξ(t)は決定的信号(例:周期的)。
  • 関連する常微分方程式(ODE)dχ/dt = f(χ) を分析し、f(θ) を決定的信号上のエルゴディック平均として定義する。
  • QSA軌道とODE解との間の新規な結合論法を用いて収束誤差を評価する。
  • システム行列Aに関するリプシッツ連続性およびHurwitz安定性仮定を適用し、グローバル漸近的安定性と収束を保証する。
  • Gronwallの不等式および状態遷移行列S(t;r)を含む積分表現を用いて、誤差ダイナミクスのバインドを導出する。
  • 部分積分および時間平均誤差項の漸近的解析を用いて、収束速度バインドを導出する。

実験結果

リサーチクエスチョン

  • RQ1決定的信号が確率的近似における確率的ノイズに置き換えられ、より高速な収束を達成できるか?
  • RQ2準確率的近似における最適な 1/t 収束レートを保証する条件は何か?
  • RQ3同じ条件下で、QSAアルゴリズムの分散は古典的確率的近似と比べてどの程度か?
  • RQ4信号構造(例:周期性)が分散低減および高速収束に果たす役割は何か?
  • RQ5古典的ODEベースの収束フレームワークは、決定的でi.i.d.でない信号に適応可能か?

主な発見

  • I + A がHurwitz(Aのすべての固有値λについてRe(λ) < -1)であるという仮定の下で、QSAは最適な収束レート 1/t を達成する。
  • 有限定数σが存在し、lim sup_{t→∞} t∥θ(t) − θ∗∥ ≤ σ を満たす。これにより、1/t レートが達成可能であることが証明される。
  • 決定的信号が適切に調整されている場合、分散低減は顕著であり、古典的確率的近似よりも高速な収束が達成される。
  • 収束解析は、QSA軌道とODE解との間の新規な結合論法に依存しており、誤差バインドはGronwallの不等式を用いて導出される。
  • フレームワークは線形モデルで検証され、非理想状態へと拡張されており、理想化された仮定を超えたロバストネスを示している。
  • 理論的結果は、異なる方策を用いて探索を導入する決定的状態空間モデル向けの新規な強化学習アルゴリズムに応用されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。