Skip to main content
QUICK REVIEW

[論文レビュー] Finite-Time Analysis for Double Q-learning

Huaqing Xiong, Lin Zhao|arXiv (Cornell University)|Sep 29, 2020
Reinforcement Learning in Robotics参考文献 33被引用数 16
ひとこと要約

本稿は、二重Q学習の最初の有限時間解析を提示し、同期的および非同期的バージョンの収束速度を確立する。二重Q学習が $\tilde{\rm O}\bigl((1/(1-\gamma)^6\epsilon^2)^{1/\omega} + (1/(1-\gamma))^{1/(1-\omega)}\bigr)$ 回の反復で $\epsilon$-精度の解に到達することを示し、高精度領域ではより鋭いバウンドを得る。これは、過大評価を低減する設計を採用するが、その代わりに進捗が遅くなるという点を裏付ける。

ABSTRACT

Although Q-learning is one of the most successful algorithms for finding the best action-value function (and thus the optimal policy) in reinforcement learning, its implementation often suffers from large overestimation of Q-function values incurred by random sampling. The double Q-learning algorithm proposed in~\citet{hasselt2010double} overcomes such an overestimation issue by randomly switching the update between two Q-estimators, and has thus gained significant popularity in practice. However, the theoretical understanding of double Q-learning is rather limited. So far only the asymptotic convergence has been established, which does not characterize how fast the algorithm converges. In this paper, we provide the first non-asymptotic (i.e., finite-time) analysis for double Q-learning. We show that both synchronous and asynchronous double Q-learning are guaranteed to converge to an $ε$-accurate neighborhood of the global optimum by taking $ ildeΩ\left(\left( \frac{1}{(1-γ)^6ε^2} ight)^{\frac{1}ω} +\left(\frac{1}{1-γ} ight)^{\frac{1}{1-ω}} ight)$ iterations, where $ω\in(0,1)$ is the decay parameter of the learning rate, and $γ$ is the discount factor. Our analysis develops novel techniques to derive finite-time bounds on the difference between two inter-connected stochastic processes, which is new to the literature of stochastic approximation.

研究の動機と目的

  • 実践的に広く使われているが、非漸近的理論的解析が不足している二重Q学習の問題を解決すること。
  • 特に、最適Q関数にどれだけ速く近づくかを含め、二重Q学習の有限時間収束速度を特徴づけること。
  • 二重Q学習における二つの相互に接続された確率的過程のカップリングを扱うための新しい解析的手法を開発すること。
  • 二重Q学習と通常のQ学習の収束行動を、$\epsilon$、$\gamma$、および $1-\gamma$ に依存する点で比較すること。
  • 過大評価を低減することに重点を置きながら速度を犠牲にすることで精度を高めるという二重Q学習の設計原理を、有限時間バウンドを通じて検証すること。

提案手法

  • 学習率 $\alpha_t = 1/t^\omega$($\omega \in (0,1)$)を用いた二重Q学習の有限時間解析フレームワークを提案。
  • マルティングール差分列と集中不等式を用いて、同期的および非同期的実装を分析。
  • 二つのQ推定器に由来する二つの結合された確率的過程の差をバウンドするための新しい技術を開発。
  • 非同期設定における収束時間と関連付けるために、探索を表すカバー数 $L$ を用いる。
  • 指数的尾部バウンドと和集合バウンドを適用し、信頼度 $1-\delta$ における高確率的収束保証を導出。
  • 学習率の減衰および探索パラメータの制御を通じてバイアスとバイアスのバランスを調整し、反復複雑度のバウンドを導出。

実験結果

リサーチクエスチョン

  • RQ1同期的二重Q学習の有限時間収束速度は、$\epsilon$、$\gamma$、$\delta$ に関してどのように定式化されるか?
  • RQ2非同期的二重Q学習の収束速度は、カバー数 $L$ および割引率 $\gamma$ にどのように依存するか?
  • RQ3高精度領域および低精度領域において、二重Q学習の収束速度は通常のQ学習と比べてどのように異なるか?
  • RQ4有限時間解析によって形式化された、過大評価の低減と収束速度のトレードオフは何か?
  • RQ5二重Q学習における二つの相互に接続された確率的過程のカップリングは、新しい確率的近似技術を用いてバウンド可能か?

主な発見

  • 同期的二重Q学習は、確率 $1-\delta$ 以上で $\epsilon$-精度に到達するため、$\Omega\left(\left(\frac{1}{(1-\gamma)^6\epsilon^2}\ln\frac{|\mathcal{S}||\mathcal{A}|}{(1-\gamma)^7\epsilon^2\delta}\right)^{1/\omega} + \left(\frac{1}{1-\gamma}\ln\frac{1}{(1-\gamma)^2\epsilon}\right)^{1/(1-\omega)}\right)$ 回の反復を要する。
  • 非同期的二重Q学習は、$L$ をカバー数として、$\Omega\left(\left(\frac{L^4}{(1-\gamma)^6\epsilon^2}\ln\frac{|\mathcal{S}||\mathcal{A}|L^4}{(1-\gamma)^7\epsilon^2\delta}\right)^{1/\omega} + \left(\frac{L^2}{1-\gamma}\ln\frac{1}{(1-\gamma)^2\epsilon}\right)^{1/(1-\omega)}\right)$ 回の反復を要する。
  • 高精度領域では、二重Q学習は通常のQ学習と同程度のオーダーの収束速度を達成する。これは、その精度重視の設計が遅い進捗よりも優位に働くことを示している。
  • 低精度領域では、慎重な更新メカニズムのため、通常のQ学習よりわずかに収束速度が遅くなるが、これは過大評価の低減を目的とした設計と整合的である。
  • 本稿の解析は、二重Q学習における二つの相互に接続された確率的過程の差をバウンドするための新しい技術を導入しており、強化学習における確率的近似の文脈で画期的である。
  • 導出されたバウンドは、二重Q学習の設計—過大評価を低減するための二つのQ推定器の切り替え—が、特に高精度な設定において精度を向上させることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。