Skip to main content
QUICK REVIEW

[論文レビュー] Q-learning with Uniformly Bounded Variance: Large Discounting is Not a Barrier to Fast Learning

Adithya M. Devraj, Sean Meyn|arXiv (Cornell University)|Feb 24, 2020
Reinforcement Learning in Robotics参考文献 48被引用数 9
ひとこと要約

本稿では、最適Q関数に含まれる1/(1−γ)に依存する定数項を除去するためにQ関数を再重み付けする相対的Q学習(relative Q-learning)を導入する。標準的Q学習では、1/(1−γ)に比例して分散が2次的に増大するが、相対的Q学習では、これに代えて1/(1−ρ*γ)に依存する形にすることで、すべての割引率γ < 1に対して漸近的分散が一様に有界になる。ここでρ* < 1は最適方策の遷移行列のスペクトルギャップの下界を表す。この手法により、大きな割引率(γ ≈ 1)下でもより速く安定した学習が可能になる。

ABSTRACT

Sample complexity bounds are a common performance metric in the Reinforcement Learning literature. In the discounted cost, infinite horizon setting, all of the known bounds have a factor that is a polynomial in $1/(1-γ)$, where $γ&lt; 1$ is the discount factor. For a large discount factor, these bounds seem to imply that a very large number of samples is required to achieve an $\varepsilon$-optimal policy. The objective of the present work is to introduce a new class of algorithms that have sample complexity uniformly bounded for all $γ&lt; 1$. One may argue that this is impossible, due to a recent min-max lower bound. The explanation is that this previous lower bound is for a specific problem, which we modify, without compromising the ultimate objective of obtaining an $\varepsilon$-optimal policy. Specifically, we show that the asymptotic covariance of the Q-learning algorithm with an optimized step-size sequence is a quadratic function of $1/(1-γ)$; an expected, and essentially known result. The new relative Q-learning algorithm proposed here is shown to have asymptotic covariance that is a quadratic in $1/(1- ρ^* γ)$, where $1 - ρ^* &gt; 0$ is an upper bound on the spectral gap of an optimal transition matrix.

研究の動機と目的

  • 大きな割引率(γ ≈ 1)下で標準的Q学習のサンプル複雑度が1/(1−γ)に悪く依存する問題に対処すること。
  • 既存のサンプル複雑度境界における1/(1−γ)^p 依存性が人工的であり、より好ましい1/(1−ρ*γ)^p 要因に置き換え可能であることを示すこと。
  • 割引率γに依存しない漸近的分散を達成する新しいアルゴリズム「相対的Q学習」を開発すること。
  • Q関数の再重み付けによって最適方策が保たれることを示し、最適性を損なわずに安定した学習が可能になること。
  • 新しいアルゴリズムの収束特性の向上を理論的裏付けするため、漸近的共分散解析とリャプノフ方程式を用いる。

提案手法

  • 最適Q関数に含まれる大きな定数項1/(1−γ)を除去するために、Q関数から定数η* / (1−γ)を減算する相対的Q学習アルゴリズムを提案する。
  • ステップサイズ列を1/(1−ρ*γ)に比例させる修正された更新ルールを用いる。ここでρ* < 1は最適方策の遷移行列のスペクトルギャップの下界を表す。
  • 確率的近似理論とリャプノフ方程式を用いて漸近的共分散を解析し、標準的Q学習および相対的Q学習の両方の漸近的分散の閉形式表現を導出する。
  • 標準的Q学習の漸近的共分散がO(1/(1−γ)^2)のオーダーで増大する一方、相対的Q学習のそれはO(1/(1−ρ*γ)^2)で有界であることを確立する。
  • 相対的Q学習の漸近的共分散が、1/(1−γ)ではなく最適方策の遷移行列のスペクトルギャップに依存することを示す重要な恒等式を導出する。
  • 確率的最短経路問題における数値実験を通じて理論を検証し、γ = 0.999およびγ = 0.9999の下でQ学習と相対的Q学習を比較する。

実験結果

リサーチクエスチョン

  • RQ1サンプル複雑度境界における1/(1−γ)^p 依存性は、最適性を損なわずに排除または著しく低減可能か?
  • RQ2定数項η*/(1−γ)を除去するQ関数の再重み付けにより、すべての割引率に対して分散が一様に有界になるか?
  • RQ3最適方策の遷移行列のスペクトルギャップρ*は、相対的Q学習の収束速度にどのように影響するか?
  • RQ4修正されたアルゴリズムを用いることで、すべてのγ < 1に対してQ学習の漸近的分散を一様に有界にできるか?
  • RQ5ステップサイズg = 1/(1−ρ*γ)は、g = 1/(1−γ)に比べて収束安定性と分散にどのような影響を及けるか?

主な発見

  • 標準的Q学習の漸近的共分散は1/(1−γ)に比例して2次的に増大し、大きな割引率下での収束遅延を説明する。
  • 相対的Q学習の漸近的共分散は1/(1−ρ*γ)の2乗に比例するが、ρ* < 1であるため、すべてのγ < 1に対して一様に有界である。
  • 同じステップサイズg = 1/(1−ρ*γ)を用いた場合、相対的Q学習は標準的Q学習と同等の性能(スパンノルム意味で)を達成しており、精度の損失なしに分散低減が達成されていることを確認する。
  • 数値実験により、相対的Q学習は大きな割引率に対して感度が低く、γ = 0.9999でも安定した収束を示す。
  • 理論的解析により、分散低減の理由は最適方策のスペクトルギャップρ* < 1が1−ρ*γ < 1を保証し、1/(1−γ)の爆発的増大を回避するためであることが示される。
  • 結果として、サンプル複雑度境界をO(1/(1−γ)^p)からO(1/(1−ρ*γ)^p)に改善可能であり、大きな割引率による人工的障壁が解消される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。