[論文レビュー] Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation
本稿では、線形関数近似を用いた無限時間平均報酬マルコフ決定過程(MDP)の学習のための3つの新規アルゴリズムを提案する。FOPOとOLSVI.FHは、それぞれ$;(√{T})$および$˜{ℓ}(T^{3/4})$のレグレットを達成する線形MDPに適応し、敵対的バンディットにインspiredされたMDP-Exp2は、異なる仮定の下で$˜{ℓ}(√{T})$のレグレットを達成し、先行研究を改善するとともに、自然政策勾配法と関連づける。
We develop several new algorithms for learning Markov Decision Processes in an infinite-horizon average-reward setting with linear function approximation. Using the optimism principle and assuming that the MDP has a linear structure, we first propose a computationally inefficient algorithm with optimal $\\widetilde{O}(\\sqrt{T})$ regret and another computationally efficient variant with $\\widetilde{O}(T^{3/4})$ regret, where $T$ is the number of interactions. Next, taking inspiration from adversarial linear bandits, we develop yet another efficient algorithm with $\\widetilde{O}(\\sqrt{T})$ regret under a different set of assumptions, improving the best existing result by Hao et al. (2020) with $\\widetilde{O}(T^{2/3})$ regret. Moreover, we draw a connection between this algorithm and the Natural Policy Gradient algorithm proposed by Kakade (2002), and show that our analysis improves the sample complexity bound recently given by Agarwal et al. (2020).
研究の動機と目的
- 無限時間平均報酬MDPにおける線形関数近似のための強化学習における理論的ギャップを埋めること。
- 線形MDPの仮定の下で、計算的に効率的で最適なレグレット境界を持つアルゴリズムを開発すること。
- 特に先行研究とは異なる、もしくは弱い仮定の下で、平均報酬設定における既存のレグレット境界を改善すること。
- 提案されたMDP-Exp2アルゴリズムと自然政策勾配法との間の関係を確立し、サンプル複雑度の理解を深めること。
提案手法
- 非凸制約(LSVIに類似)を用いたオプティミスティック固定点最適化(FOPO)を提案。これは、レグレット制御のためのラジカルな更新スケジューリングに依存する。
- 無限時間問題を有限時間問題に再定式化し、オプティミスティックLSVIを適用することで、計算を効率化するOLSVI.FHを導入。その代償として、より高いレグレットが生じる。
- 敵対的線形バンディット(Exp2)にインspiredされたMDP-Exp2を提案。各状態で指数的重み更新を実行し、重要度重み付けと軌道集約を用いてほぼ不偏な報酬推定器を構築する。
- 重要度重み付けを通じて$M_k^{-1}$を用い、軌道を集約することで、アドバンテージ関数$A^{\pi_\theta}(x,a)$のほぼ不偏推定器を構築。この推定器は、$\mathcal{O}(1/\sigma)$の軌道数で構成され、分散が$\mathcal{O}(1/\sigma)$で有界であるため、低バイアスと管理可能な分散を実現する。
- 同じ仮定の下で、MDP-Exp2の更新方向が自然政策勾配(NPG)のポリシー更新ステップと一致することを示し、NPG法と関連づける。
- 重要度重み付けを$M_k^{-1}$を用いて軌道を集約し、アドバンテージ推定器のバイアスを低減することで、安定的かつ効率的な学習を可能にする。
実験結果
リサーチクエスチョン
- RQ1無限時間平均報酬MDPにおける線形関数近似に対して、近似的に最適な$\widetilde{\mathcal{O}}(\sqrt{T})$のレグレットを達成する計算的に効率的なアルゴリズムを設計できるか?
- RQ2均一混合性のような強い仮定に依存せずに、線形MDP仮定の下で平均報酬設定で低レグレットを達成する方法は何か?
- RQ3Haoら(2021)の$\widetilde{\mathcal{O}}(T^{2/3})$の境界を、同程度の仮定の下で改善できるか?
- RQ4提案されたMDP-Exp2アルゴリズムと自然政策勾配法との間の関係は何か?また、これはサンプル複雑度にどのように影響するか?
主な発見
- FOPOは、ベルマン最適性方程式の仮定の下で、高確率で$\widetilde{\mathcal{O}}(\sqrt{dT})$のレグレットを達成し、$T$依存性において最適であることを示した。
- OLSVI.FHは、無限時間問題を有限時間問題に還元することで、計算を効率化し、$\widetilde{\mathcal{O}}((dT)^{3/4})$のレグレットを達成した。
- MDP-Exp2は、均一混合性と均一に励起された特徴の仮定の下で、$\widetilde{\mathcal{O}}(\sqrt{T})$のレグレットを達成し、Haoら(2021)の$\widetilde{\mathcal{O}}(T^{2/3})$の境界を改善した。
- MDP-Exp2の分析は、Agarwalら(2020)のサンプル複雑度境界を改善し、彼らの手法が$\mathcal{O}(T^{3/4})$のレグレットを生じるのに対し、本手法は$\widetilde{\mathcal{O}}(\sqrt{T})$のレグレットを達成した。
- MDP-Exp2の推定器構築は、$\mathcal{O}(1/\sigma)$の軌道数で十分であり、ほぼ無視できるバイアスと有界な分散を実現し、効率的かつ安定した学習を可能にした。
- 本稿では、MDP-Exp2と自然政策勾配法との間の正式な関係を確立し、同じ仮定の下で、更新方向がNPGのポリシー改善ステップと一致することを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。