Skip to main content
QUICK REVIEW

[論文レビュー] UCB Momentum Q-learning: Correcting the bias without forgetting

Pierre Ménard, Omar Darwiche Domingues|arXiv (Cornell University)|Mar 1, 2021
Advanced Bandit Algorithms Research参考文献 24被引用数 10
ひとこと要約

本稿では、表形式のエピソード的MDPに対して、Q学習とモーメンタム項、および上界信頼区間(UCB)を組み合わせることでバイアスを是正し、リグレットを最小化する、新しいモデルフリー強化学習アルゴリズムであるUCBモーメンタムQ学習(UCBMQ)を提案する。リグレットバウンドは$\widetilde{\mathcal{O}}(\sqrt{H^{3}SAT} + H^{4}SA)$であり、$T$が大きい場合に$\Omega(\sqrt{H^{3}SAT})$の下界と一致し、第二の項において$S$に関して線形にスケーリングする。これは、同時に両者の最適性と低い状態依存性を達成する最初のアルゴリズムである。

ABSTRACT

We propose UCBMQ, Upper Confidence Bound Momentum Q-learning, a new algorithm for reinforcement learning in tabular and possibly stage-dependent, episodic Markov decision process. UCBMQ is based on Q-learning where we add a momentum term and rely on the principle of optimism in face of uncertainty to deal with exploration. Our new technical ingredient of UCBMQ is the use of momentum to correct the bias that Q-learning suffers while, at the same time, limiting the impact it has on the second-order term of the regret. For UCBMQ, we are able to guarantee a regret of at most $O(\sqrt{H^3SAT}+ H^4 S A )$ where $H$ is the length of an episode, $S$ the number of states, $A$ the number of actions, $T$ the number of episodes and ignoring terms in poly-$\log(SAHT)$. Notably, UCBMQ is the first algorithm that simultaneously matches the lower bound of $Ω(\sqrt{H^3SAT})$ for large enough $T$ and has a second-order term (with respect to the horizon $T$) that scales only linearly with the number of states $S$.

研究の動機と目的

  • 過去の不正確な推定値を用いたブートストラップによって生じるQ学習のバイアスを是正すること。
  • 状態数$S$に依存する第二のリグレット項の依存度を低くすること、これは大規模な状態空間のMDPにおいて支配的になることがある。
  • 既知の下界$\Omega(\sqrt{H^{3}SAT})$と一致するリグレットバウンドを達成するとともに、第二の項が$S$に関して線形にスケーリングされることを保証すること。
  • モデルフリー学習の利点(相関の問題なし)と、不確実性に対する楽観主義(UCB)の探索効率を組み合わせること。

提案手法

  • 古くなった推定値の重みを下げることで、Q学習のバイアスを是正するモーメンタムに基づく更新ルールを導入する。
  • 探索を促進するため、上界信頼区間(UCB)を用い、不確実性に対する楽観主義を保証する。
  • 初期の最適値関数の粗い推定値を活用することで、分散を低減するためのリファレンスアドバンテージ分解を採用する。
  • 過去のQ値推定値に新たな重み付けスキームを適用し、古い、おそらくバイアスの生じた更新の影響を制御する。
  • Q値推定値の経験的分散に基づく信頼区間を用い、探索と活用のバランスを取る。
  • 集中不等式とモーメンタム重み付き更新プロセスの再帰的解析を用いて、リグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーのQ学習アルゴリズムは、情報理論的下界$\Omega(\sqrt{H^{3}SAT})$と一致するリグレットを達成できるか?
  • RQ2第二のリグレット項を$S^2$や$S^{3/2}$ではなく、$S$に関して線形にできるか、特に大規模な状態空間のMDPにおいては?
  • RQ3モーメンタムを用いることで、Q学習のバイアスを是正できるが、分散の増加や過去の有用な情報の忘却を引き起こさないか?
  • RQ4非定常的エピソード的MDPにおいて、収束性と低リグレットを保証しながら、不確実性に対する楽観主義を維持できるか?

主な発見

  • UCBMQは、$\widetilde{\mathcal{O}}(\sqrt{H^{3}SAT} + H^{4}SA)$のリグレットバウンドを達成し、$T$が大きい場合に$\Omega(\sqrt{H^{3}SAT})$の下界と一致する。
  • 第二の項は$S$に関して線形にスケーリングされるが、従来のアルゴリズムが$S^2$や$S^{3/2}$とスケーリングするのとは異なり、大規模な状態空間にさらにスケーラブルである。
  • アルゴリズムは、モーメンタムを用いてQ学習のバイアスを効果的に是正するとともに、UCBに基づく探索の利点を維持している。
  • 従来のモデルフリー手法(OptQL や UCB-Advantage)に比べ、リグレットバウンドがよりタイトであり、$\sqrt{H}$や$H^{33/4}$の余分な要因がない。
  • 解析により、モーメンタム機構が第二の項への影響を制限し、推定値の相関による$S^2$要因が生じるモデルベース手法とは異なり、その影響を回避していることが示された。
  • 本手法は、エピソード的MDPにおいて、最初に第一のリグレット項の最適性と$S$に関する第二の項の線形スケーリングを同時に達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。