[論文レビュー] A Finite Sample Complexity Bound for Distributionally Robust Q-learning
本稿は、分布シフト下での強化学習における有限サンプル複雑度の保証を備えた、モデルフリーな分布ロバストQ学習アルゴリズムを提案する。マルチレベルモンテカルロ推定量を改善して期待サンプルサイズを一定に保つことで、$\tilde{O}(|S||A|(1-\gamma)^{-5}\epsilon^{-2}p_{\wedge}^{-6}\delta^{-4})$ の、一様ノルム内での$\epsilon$誤差以内のロバストQ関数の学習における、初めての有限期待サンプル複雑度の上限を確立した。
We consider a reinforcement learning setting in which the deployment environment is different from the training environment. Applying a robust Markov decision processes formulation, we extend the distributionally robust $Q$-learning framework studied in Liu et al. [2022]. Further, we improve the design and analysis of their multi-level Monte Carlo estimator. Assuming access to a simulator, we prove that the worst-case expected sample complexity of our algorithm to learn the optimal robust $Q$-function within an $ε$ error in the sup norm is upper bounded by $ ilde O(|S||A|(1-γ)^{-5}ε^{-2}p_{\wedge}^{-6}δ^{-4})$, where $γ$ is the discount rate, $p_{\wedge}$ is the non-zero minimal support probability of the transition kernels and $δ$ is the uncertainty size. This is the first sample complexity result for the model-free robust RL problem. Simulation studies further validate our theoretical results.
研究の動機と目的
- 分布シフトの影響を受ける環境に標準的な強化学習方策を適用した場合の脆弱性に対処すること。
- 期待サンプルサイズが無限大であるため、有限サンプル複雑度の保証がない既存のロバストQ学習手法の限界を克服すること。
- 理論的収束速度が保証される、モデルフリーでサンプル効率の良い分布ロバスト強化学習のためのアルゴリズムを開発すること。
- 分布ロバストMDPフレームワーク下でのロバストQ学習問題における、有限サンプル複雑度の上限を確立すること。
提案手法
- Liuら(2022)のマルチレベルモンテカルロ(MLMC)推定量を拡張し、推定量の分散とバイアスを制御することで、有限の期待サンプルサイズを保証する。
- モーメントの有界性を備えた不偏なMLMCベースのベルマン作用素推定量を導入し、有限サンプルの確率的近似解析を可能にする。
- Chenら(2020)の有限サンプル確率的近似フレームワークを適用し、収束性を解析し、サンプル複雑度の上限を導出する。
- 確率的近似プロセスにおける安定性と収束性を保証するため、スケーリングされた線形または定数ステップサイズルールを用いる。
- 遷移分布のあいまいさ集合上での最悪ケース期待報酬を最小化するように設計されたロバストQ学習アルゴリズムを提案する。
- 改善された推定量の性質とロバストMDPの構造を用いて、期待サンプル複雑度の理論的上限を証明する。
実験結果
リサーチクエスチョン
- RQ1有限期待サンプル複雑度を備えたモデルフリーな分布ロバストQ学習アルゴリズムを設計できるか?
- RQ2分布シフト下での最適ロバストQ関数の学習において、可能な限りタイトなサンプル複雑度の上限は何か?
- RQ3割引因子$\gamma$、最小遷移確率$p_{\wedge}$、不確実性の大きさ$\delta$といった主要な問題パラメータに関して、サンプル複雑度はどのようにスケーリングされるか?
- RQ4改善されたMLMC推定量は、ロバストQ値関数への収束を保ちつつ、有限の期待サンプル使用量を保証できるか?
- RQ5特にLiuら(2022)と比較して、アルゴリズムの性能はサンプル効率と収束速度の面でどのように異なるか?
主な発見
- 提案されたアルゴリズムは、一様ノルム内での$\epsilon$誤差以内の最適ロバストQ関数の学習において、有限の期待サンプル複雑度$\tilde{O}(|S||A|(1-\gamma)^{-5}\epsilon^{-2}p_{\wedge}^{-6}\delta^{-4})$ を達成する。
- サンプル複雑度の上限は$|S||A|$に関してタイトであり、有効なホライズン$(1-\gamma)^{-1}$に関してもほぼタイトであるため、状態空間と行動空間のサイズに強くスケーラブルであることが示唆される。
- モーメントが有界で不偏性を持つ改善されたMLMC推定量を構築することで、期待サンプル使用量が有限であることを保証し、Liuら(2022)の手法の主要な限界を解消した。
- 数値実験により理論的予測が確認され、スケール変換された線形および定数ステップサイズの両方において、収束速度が対数対数スケールで$\tilde{O}(k^{-1/2})$ のレートと一致していることが示された。
- 複雑度は$\delta$の小さな値および大きな値の変化に対して感度が低く、$\delta \downarrow 0$ のとき$\delta$依存性が$O(1)$であるという仮説を支持する。これは、従来の予想とは対照的である。
- 失念在庫制御実験では、$g=5/8$ の本手法が、Liuら(2022)の$g=0.499$ よりもはるかに少ないサンプル数を用いており、優れたサンプル効率を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。