[論文レビュー] Online learning in MDPs with linear function approximation and bandit feedback
本稿では、線形関数近似とバンディットフィードバックを用いた、報酬がエピソード間で敵対的に変化するエピソード的マルコフ決定過程(MDP)におけるオンライン学習のためのアルゴリズムである Online Q-REPS を提案する。報酬空間のサイズに依存しない、$ otimes cancel{ \widetilde{\mathcal{O}}(\sqrt{dHT})} $ のレグレットバウンドを達成する。これは、遷移ダイナミクスの完全な知識と低次元の特徴マップを活用することで実現される。
We consider an online learning problem where the learner interacts with a Markov decision process in a sequence of episodes, where the reward function is allowed to change between episodes in an adversarial manner and the learner only gets to observe the rewards associated with its actions. We allow the state space to be arbitrarily large, but we assume that all action-value functions can be represented as linear functions in terms of a known low-dimensional feature map, and that the learner has access to a simulator of the environment that allows generating trajectories from the true MDP dynamics. Our main contribution is developing a computationally efficient algorithm that we call MDP-LinExp3, and prove that its regret is bounded by $\widetilde{\mathcal{O}}\big(H^2 T^{2/3} (dK)^{1/3}\big)$, where $T$ is the number of episodes, $H$ is the number of steps in each episode, $K$ is the number of actions, and $d$ is the dimension of the feature map. We also show that the regret can be improved to $\widetilde{\mathcal{O}}\big(H^2 \sqrt{TdK}\big)$ under much stronger assumptions on the MDP dynamics. To our knowledge, MDP-LinExp3 is the first provably efficient algorithm for this problem setting.
研究の動機と目的
- 状態空間が任意に大きなエピソード的 MDP におけるオンライン学習を、敵対的な報酬変化とバンディットフィードバックの下で取り扱う。
- 線形関数近似を用いることで、状態空間サイズに依存しないレグレットバウンドを達成する計算効率の良いアルゴリズムの開発。
- 関数近似を伴うオンライン強化学習における最適化誤差と報酬推定バイアスの理論的分析の提供。
- 完全な MDP ダイナミクスの知識と敵対的報酬を有する設定に、既存のオンライン RL フレームワークを拡張し、低レグレットを維持すること。
- 不確実性を伴うダイナミクスの今後の研究の基盤を築くために、完全なダイナミクス知識の影響を分析する。
提案手法
- アルゴリズムは、各エピソードの開始時に $d^2$ 次元の凸最適化問題を解く Online Q-REPS を使用し、方策の更新を計算する。
- 価値関数と方策を表すために次元 $d$ の特徴マップを採用し、すべての行動価値関数が特徴量に関して線形であると仮定する。
- 報酬推定のバイアスを低減するために、重要度重み付けを用いた逆確率スコアリングを採用し、推定スキームを注意深く設計する。
- 最適方策と初期分布との距離を制御するために、相対エントロピー $D(\mu^* \| \mu_0)$ を用いた正則化項を組み込む。
- 最適化誤差は $\| \widehat{u}_{t,h} - u_{t,h} \|_1 \leq \sqrt{2\alpha\varepsilon}$ でバウンドされ、ここで $\varepsilon$ は最適化の許容誤差である。
- 報酬推定バイアスはガウススムージング技術を用いて制御され、$\|b_{t,h}\|_\infty \leq \sigma R \exp(-\gamma\beta\lambda_{\min}M)$ が成り立つ。
実験結果
リサーチクエスチョン
- RQ1敵対的な報酬変化とバンディットフィードバックを伴うエピソード的 MDP におけるオンライン学習が、状態空間サイズに依存しないレグレットで達成可能か?
- RQ2線形関数近似を用いたオンライン RL における方策更新の最適化誤差は、どのようにバウンド可能か?
- RQ3線形 MDP とバンディットフィードバックの設定において、報酬推定バイアスがレグレットに与える影響は何か?
- RQ4状態行動分布間の有効確率比が有界であるという仮定なしに、レグレットバウンドを導出可能か?
- RQ5遷移関数が既知で報酬が敵対的である場合に、大規模 MDP でサブ線形レグレットを達成可能か?
主な発見
- アルゴリズムは $\mathcal{O}(\sqrt{dHTD(\mu^* \| \mu_0)})$ のレグレットバウンドを達成し、標準的な仮定のもとで $\widetilde{\mathcal{O}}(\sqrt{dHT})$ に簡略化される。
- レグレットバウンドは、特徴量の共分散行列の固有値や MDP の混合時間に依存しない。
- この手法は計算的に効率的であり、各エピソードで $d^2$ 次元の凸計画問題を $d$ および $1/\varepsilon$ の多項式時間で解く。
- 最適化誤差を厳密に取り入れた分析により、$\| \widehat{u}_{t,h} - u_{t,h} \|_1 \leq \sqrt{2\alpha\varepsilon}$ が示される。
- ガウススムージングを用いた報酬推定バイアスは、$\|b_{t,h}\|_\infty \leq \sigma R \exp(-\gamma\beta\lambda_{\min}M)$ でバウンドされる。
- 表形式の場合($d = |\mathcal{X}||\mathcal{A}|$)、このバウンドは Zimin と Neu (2017) が提示した O-REPS のミニマックス最適保証を回復する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。