Skip to main content
QUICK REVIEW

[論文レビュー] Is Q-Learning Minimax Optimal? A Tight Sample Complexity Analysis

Gen Li, Changxiao Cai|arXiv (Cornell University)|Feb 12, 2021
Reinforcement Learning in Robotics参考文献 58被引用数 18
ひとこと要約

本稿は、表形式のマルコフ決定過程における同期的設定下でのQ学習のタイトなサンプル複雑性解析を提供し、|A| ≥ 2 の場合にQ学習がミニマックスにサブオプティマルであることを証明している。サンプル複雑性は O(|S||A|/(1−γ)^4ε²) に比例するが、TD学習 (|A|=1) は O(|S|/(1−γ)^3ε²) でミニマックス最適性を達成する。研究では、Q学習における過大評価がサブオプティマル性の原因であると特定し、有効ホライズン依存性が O(1/(1−γ)^4) である非同期Q学習への結果の拡張も行った。

ABSTRACT

Q-learning, which seeks to learn the optimal Q-function of a Markov decision process (MDP) in a model-free fashion, lies at the heart of reinforcement learning. When it comes to the synchronous setting (such that independent samples for all state-action pairs are drawn from a generative model in each iteration), substantial progress has been made towards understanding the sample efficiency of Q-learning. Consider a $γ$-discounted infinite-horizon MDP with state space $\mathcal{S}$ and action space $\mathcal{A}$: to yield an entrywise $\varepsilon$-approximation of the optimal Q-function, state-of-the-art theory for Q-learning requires a sample size exceeding the order of $\frac{|\mathcal{S}||\mathcal{A}|}{(1-γ)^5\varepsilon^{2}}$, which fails to match existing minimax lower bounds. This gives rise to natural questions: what is the sharp sample complexity of Q-learning? Is Q-learning provably sub-optimal? This paper addresses these questions for the synchronous setting: (1) when $|\mathcal{A}|=1$ (so that Q-learning reduces to TD learning), we prove that the sample complexity of TD learning is minimax optimal and scales as $\frac{|\mathcal{S}|}{(1-γ)^3\varepsilon^2}$ (up to log factor); (2) when $|\mathcal{A}|\geq 2$, we settle the sample complexity of Q-learning to be on the order of $\frac{|\mathcal{S}||\mathcal{A}|}{(1-γ)^4\varepsilon^2}$ (up to log factor). Our theory unveils the strict sub-optimality of Q-learning when $|\mathcal{A}|\geq 2$, and rigorizes the negative impact of over-estimation in Q-learning. Finally, we extend our analysis to accommodate asynchronous Q-learning (i.e., the case with Markovian samples), sharpening the horizon dependency of its sample complexity to be $\frac{1}{(1-γ)^4}$.

研究の動機と目的

  • 表形式MDPにおける同期的設定下でQ学習がミニマックス最適なサンプル複雑性を達成するか否かという未解決問題を解明すること。
  • Q学習のサンプル複雑性をミニマックス下界と比較することで、Q学習の根本的統計的限界を特定すること。
  • 複数の行動が存在する際のQ学習における過大評価の影響と、それがサブオプティマル性に与える役割を調査すること。
  • マルコフ連鎖サンプルを用いた非同期Q学習への解析を拡張し、ホライズン依存性を精緻化すること。
  • ℓ∞-ノルム誤差基準下での同期的および非同期的Q学習のタイトな上界と下界を確立すること。

提案手法

  • 誤差ベクトル Δt に対する再帰関係と濃度不等式を用いて、同期的Q学習のタイトな上界を導出する。
  • Q̂k(a) および Q̄k の補助列を導入し、最大演算子を分離することで、Q学習における過大評価効果を制御する。
  • 2つの行動と1つの状態からなるハードインスタンス構築により、上界と対して対数要因を除いて一致するミニマックス下界を導出する。
  • フリードマンの不等式およびベルンシュタイン型濃度不等式を用いて、経験的遷移確率の逸脱を制御する。
  • 混合時間制約を課したマルコフ連鎖サンプリング方式としてプロセスをモデル化することで、非同期Q学習への解析を適応する。
  • 反復的誤差伝播と再帰的分解を用いて、Q学習推定値の期待ℓ∞誤差をバウンディングする。
Figure 1: The constructed hard MDP instance used in the analysis of Theorem 3 , where $p=\frac{4\gamma-1}{3\gamma}$ and the specifications are described in ( 46 ).
Figure 1: The constructed hard MDP instance used in the analysis of Theorem 3 , where $p=\frac{4\gamma-1}{3\gamma}$ and the specifications are described in ( 46 ).

実験結果

リサーチクエスチョン

  • RQ1表形式MDPで |A| ≥ 2 の場合、Q学習はサンプル複雑性においてミニマックス最適か?
  • RQ2同期的設定下で、Q学習のサンプル複雑性は有効ホライズン 1/(1−γ) に対してどのように依存するか?
  • RQ3Q学習における過大評価は、複数の行動が存在する際のサブオプティマル性にどのように寄与するか?
  • RQ4非同期Q学習のサンプル複雑性は、特に (1−γ)−1 依存性に関してタイトにできるか?
  • RQ5Q学習のミニマックス下界は何か? そして、上界と対して対数要因を除いて一致するか?

主な発見

  • |A| = 1(TD学習)の場合、サンプル複雑性はミニマックス最適であり、O(|S|/(1−γ)^3ε²) に比例し、対数要因を除いてミニマックス下界と一致する。
  • |A| ≥ 2 の場合、Q学習のサンプル複雑性は O(|S||A|/(1−γ)^4ε²) であり、ミニマックス下界 O(|S||A|/(1−γ)^3ε²) より厳密にサブオプティマルである。
  • Q学習のサブオプティマル性は、反復的に蓄積されるQ値更新における過大評価に起因することが厳密に特定された。
  • 解析により、Q学習における有効ホライズン依存性が O(1/(1−γ)^4) であることが示され、モデルベース手法が達成可能な最適な O(1/(1−γ)^3) よりも悪い。
  • マルコフ連鎖サンプルを用いた非同期Q学習では、有効ホライズンに O(1/(1−γ)^4) の依存性を示し、同期ケースと対数要因を除いて一致する。
  • 本稿では、Q学習の期待ℓ∞誤差が Ω(1/√(μ_min(1−γ)^4T log^3 T)) で下限されるとするハードMDPインスタンスを構築し、上界のタイトさを証明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。