[論文レビュー] A Model Selection Approach for Corruption Robust Reinforcement Learning
本稿では、遷移と報酬の両方が敵対的に汚染されている状況において、汚染度の事前知識がなくとも最適なレグレットバウンドを達成する強化学習のモデル選択フレームワークを提案する。異なる汚染度に合わせてチューニングされた基本アルゴリズムの間でレグレットをバランスさせることにより、表形式MDPでは$\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$、線形MDPでは$\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$の最悪ケース最適レグレットを得ることができ、汚染耐性RLにおける未解決問題を解決する。
We develop a model selection approach to tackle reinforcement learning with adversarial corruption in both transition and reward. For finite-horizon tabular MDPs, without prior knowledge on the total amount of corruption, our algorithm achieves a regret bound of $\widetilde{\mathcal{O}}(\min\{\frac{1}Δ, \sqrt{T}\}+C)$ where $T$ is the number of episodes, $C$ is the total amount of corruption, and $Δ$ is the reward gap between the best and the second-best policy. This is the first worst-case optimal bound achieved without knowledge of $C$, improving previous results of Lykouris et al. (2021); Chen et al. (2021); Wu et al. (2021). For finite-horizon linear MDPs, we develop a computationally efficient algorithm with a regret bound of $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$, and another computationally inefficient one with $\widetilde{\mathcal{O}}(\sqrt{T}+C)$, improving the result of Lykouris et al. (2021) and answering an open question by Zhang et al. (2021b). Finally, our model selection framework can be easily applied to other settings including linear bandits, linear contextual bandits, and MDPs with general function approximation, leading to several improved or new results.
研究の動機と目的
- 遷移と報酬が敵対的に汚染されている状況で、総汚染量Cの事前知識なしに最適なレグレットを達成するという未解決問題に取り組むこと。
- 異なる仮定される汚染度に合わせて設計された基本アルゴリズムの間で、適応的に最適なものを選択するモデル選択フレームワークを構築すること。
- T(エピソード数)とC(汚染度)の両方に最適にスケーリングする最悪ケース最適レグレットバウンドを達成すること。情報理論的下界と一致する。
- フレームワークを線形MDPや線形バンディット、文脈付きバンディットなどの他の設定に拡張し、改善または新たな理論的保証をもたらすこと。
提案手法
- 本手法は、複数の基本アルゴリズムのインスタンスを維持するメタアルゴリズムCOBE(Corruption-robustness through Balancing and Elimination)を用いる。各インスタンスは、異なる推定汚染度に合わせてチューニングされている。
- 重要度重み$\alpha_i$を適切に選ぶことで、各基本アルゴリズムの性能が同等になるように、レグレットバランスを実現する。これにより、特定のアルゴリズムが過剰にペナルティを受けるのを防ぐ。
- 各基本アルゴリズムのインスタンスが早期終了した後、推定汚染度$k$を動的に増加させることで、現在の推定が低すぎたことを示す。
- フレームワークは、累積レグレットと信頼区間に基づく停止条件を用いるサブルーチンBASICを依存している。BASICは汚染仮説の階層上でのモデル選択を実行する。
- パrameterizedレグレットバウンド$\mathcal{R}(t,\theta) = \sqrt{\beta_1 t} + \beta_2 \theta + \beta_3$を用いて、異なる汚染仮定下での基本アルゴリズムの性能をモデル化する。
- 真の汚染度が未知であっても、全体のレグレットが、後悔の観点で最良の基本アルゴリズムのレグレットの多対数因子内に収まるように保証する。
実験結果
リサーチクエスチョン
- RQ1表形式MDPにおいて、総汚染量Cが未知である場合に、TとCの両方において最適なレグレットバウンドを達成できるか?
- RQ2汚染度の事前知識なしに、正しい汚染度を適応的に同定しつつ、近似的に最適なレグレットを維持できるモデル選択フレームワークを設計できるか?
- RQ3提案手法を線形MDPに拡張し、$\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$形式の最適レグレットバウンドを達成できるか?
- RQ4線形バンディットや文脈付きバンディットといった関連設定において、モデル選択フレームワークが改善または新たな結果をもたらすか?
- RQ5Cの事前知識なしに、$\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$形式のインスタンス依存レグレットバウンドを達成できるか?
主な発見
- 有限ホライズンの表形式MDPにおいて、提案アルゴリズムは$\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$のレグレットバウンドを達成する。これは、Cの事前知識なしに最適な最悪ケースバウンドとして初めて達成されたものである。
- このバウンドは、Wuら(2021)が確立した情報理論的下界と一致し、汚染耐性RL分野における長年の未解決問題を解決する。
- 有限ホライズンの線形MDPにおいて、計算的に効率的なバージョンを用いて$\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$のレグレットバウンドを達成し、先行研究を改善する。
- Zhangら(2021)が提起した線形MDPにおけるCに依存する最適な依存関係を達成するという未解決問題に答えを提示する。
- 本手法は、線形バンディット、線形文脈付きバンディット、一般関数近似を用いたMDPなどに一般化可能であり、これらの設定において改善または新たなレグレットバウンドをもたらす。
- モデル選択アプローチにより、真の汚染度が未知であっても、後悔の観点で最良の基本アルゴリズムのレグレットの多対数因子内に全体のレグレットが収まることが保証される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。