[論文レビュー] Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation
本稿では、線形関数近似を用いた無限ホライズン平均報酬MDPに対するモデルベース強化学習アルゴリズムUCRL2-VTRを提案する。値向け回帰とベルシュタイン型ボーナスを用いてUCRL2を拡張することで、$ otimes ilde{O}(d\sqrt{DT})$ のほぼミニマックス最適なレグレットバウンドを達成し、対応する下界 $ abla\widetilde{\Omega}(d\sqrt{DT})$ と対数要因を除いて一致させ、この設定で初めてこのようなほぼ最適なアルゴリズムを実現する。
We study reinforcement learning in an infinite-horizon average-reward setting with linear function approximation, where the transition probability function of the underlying Markov Decision Process (MDP) admits a linear form over a feature mapping of the current state, action, and next state. We propose a new algorithm UCRL2-VTR, which can be seen as an extension of the UCRL2 algorithm with linear function approximation. We show that UCRL2-VTR with Bernstein-type bonus can achieve a regret of $ ilde{O}(d\sqrt{DT})$, where $d$ is the dimension of the feature mapping, $T$ is the horizon, and $\sqrt{D}$ is the diameter of the MDP. We also prove a matching lower bound $ ildeΩ(d\sqrt{DT})$, which suggests that the proposed UCRL2-VTR is minimax optimal up to logarithmic factors. To the best of our knowledge, our algorithm is the first nearly minimax optimal RL algorithm with function approximation in the infinite-horizon average-reward setting.
研究の動機と目的
- 無限ホライズン平均報酬MDPにおける強化学習のレグレット最適性のギャップを埋めること。
- 大規模な状態空間および行動空間における線形構造を活用する、証明可能に効率的なアルゴリズムの開発。
- 平均報酬設定下での線形混合MDPに対して、上界と一致する下界の両方のレグレットバウンドを確立すること。
- 不確実性の面前での楽観主義(OFU)原則を、関数近似を伴う平均報酬設定に拡張すること。
提案手法
- 遷移ダイナミクスをバイアス関数の期待値の最小二乗法により推定する価値向け回帰を用いた、UCRL2の拡張版であるUCRL2-VTRを提案。
- Hoeffding型ボーナスよりもレグレットスケーリングを改善するため、ベルシュタイン型ボーナスを探索に採用。
- 遷移確率が状態・行動・次状態の特徴マッピングの線形関数として表現される線形混合MDPを採用。
- エピソード的または割引MDPとは根本的に異なる、平均報酬設定に特化した新たなレグレット分解を適用。
- 未知の遷移カーネルをバイアス関数の経験的期待値を用いて推定する、価値向け回帰の変種を導入。
- 最小マックス最適性を対数要因を除いて確認するため、$\nabla\widetilde{\Omega}(d\sqrt{DT})$ の下界を導出。
実験結果
リサーチクエスチョン
- RQ1モデルベース強化学習アルゴリズムは、線形関数近似を用いた無限ホライズン平均報酬MDPで、ほぼミニマックス最適なレグレットを達成できるか?
- RQ2UCRL2-VTRのレグレットは、特徴次元 $d$、時間ホライズン $T$、MDP直径 $D$ に対してどのようにスケーリングされるか?
- RQ3提案されたレグレットバウンドは対数要因を除いてタイトであり、一致する下界を確立できるか?
- RQ4不確実性の面前での楽観主義原則は、関数近似を伴う平均報酬設定に効果的に適応可能か?
主な発見
- ベルシュタイン型ボーナスを用いたUCRL2-VTRは、線形混合MDPにおいて $\nabla\widetilde{O}(d\sqrt{DT})$ のレグレットバウンドを達成する。
- アルゴリズムは導出された下界 $\nabla\widetilde{\Omega}(d\sqrt{DT})$ と一致し、対数要因を除いてほぼミニマックス最適性を確認する。
- UCRL2-VTRは、元の線形構造を活用することで、表形式のモデルベースベースライン(例:UCRL、SCAL)を実験的に上回る性能を示す。
- Hoeffding型ボーナスを用いたUCRL2-VTRバージョンは $\nabla\widetilde{O}(dD\sqrt{T})$ のレグレットを達成するが、ベルシュタイン版と比較して劣っている。
- 本研究は、無限ホライズン平均報酬MDP設定における関数近似のための、初めてのほぼミニマックス最適なレグレットバウンドを確立する。
- レグレット解析には、エピソード的または割引MDPの解析とは根本的に異なる、平均報酬設定に特化した新たな分解が必要である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。