[論文レビュー] Improved Corruption Robust Algorithms for Episodic Reinforcement Learning
本稿では、報酬と遷移の破損の詳細な大きさ(破損の程度)に依存する新しい破損耐性アルゴリズムを提案し、破損したエピソードの数だけでなく、破損の程度に依存するより厳密なレジーレットバウンドを達成する。報酬フリー探索サブルーチンと2つのメタアルゴリズムを導入し、破損レベルに対して加法的依存性を達成することで、表形式強化学習における、正当性を保証する初めての結果をもたらす。
We study episodic reinforcement learning under unknown adversarial corruptions in both the rewards and the transition probabilities of the underlying system. We propose new algorithms which, compared to the existing results in (Lykouris et al., 2020), achieve strictly better regret bounds in terms of total corruptions for the tabular setting. To be specific, firstly, our regret bounds depend on more precise numerical values of total rewards corruptions and transition corruptions, instead of only on the total number of corrupted episodes. Secondly, our regret bounds are the first of their kind in the reinforcement learning setting to have the number of corruptions show up additively with respect to $\min\{\sqrt{T}, ext{PolicyGapComplexity}\}$ rather than multiplicatively. Our results follow from a general algorithmic framework that combines corruption-robust policy elimination meta-algorithms, and plug-in reward-free exploration sub-algorithms. Replacing the meta-algorithm or sub-algorithm may extend the framework to address other corrupted settings with potentially more structure.
研究の動機と目的
- 敵対的破損に対する耐性の面で先行研究の限界を是正すること。
- 破損したエピソードの数だけでなく、報酬と遷移の破損の正確な大きさに依存するアルゴリズムを開発すること。
- 破損レベルに対するレジーレットバウンドを乗法的依存ではなく加法的依存にすることにより、分野における未解決問題を解決すること。
- 破損耐性ポリシー除去と報酬フリー探索を組み合わせた一般化可能なフレームワークを提供すること。
提案手法
- EstAllを提案。破損耐性のある報酬フリー探索アルゴリズムで、(ε + (C^p + C^r)ε²)-近似のポリシー価値推定を返す。
- BARBAR-RLを導入。EstAllを用いるメタアルゴリズムで、非適応的敵対者に対して Õ(min{√T, PolicyGapComplexity} + (1 + C^p)(C^p + C^r)) のレジーレットを達成。
- BrutePolicyElimination-RLを提案。適応的敵対者(ポリシーを観測した後に破損を行う)に対して Õ(√T + (C^p + C^r)²) のレジーレットを達成。
- 破損耐性メタアルゴリズムとプラグイン可能な報酬フリー探索サブルーチンを組み合わせた一般フレームワークを採用し、より高い耐性を実現。
- 報酬フリー探索フェーズでは、状態-行動訪問頻度とQ値推定誤差をコア推定器として使用。
- 遷移カーネルと報酬関数の全変動距離を用いて、価値関数差の理論的バウンドを適用。
実験結果
リサーチクエスチョン
- RQ1エピソード的強化学習におけるレジーレットバウンドを、乗法的依存ではなく加法的依存にできるか?
- RQ2破損したエピソード数が未知であっても、表形式強化学習でC^pとC^rの合計破損量に対して加法的依存を達成できるか?
- RQ3報酬と遷移の両方の敵対的破損に対して、報酬フリー探索を耐障害的にできるか?
- RQ4ポリシー除去型アルゴリズムが、破損が存在する状況でもインスタンス依存のレジーレットバウンドを達成できるか?
- RQ5追加の構造的仮定のもとで、他の破損あり強化学習設定へこのフレームワークを拡張できるか?
主な発見
- 提案されたBARBAR-RLメタアルゴリズムは、非適応的敵対者に対して Õ(min{√T, PolicyGapComplexity} + (1 + C^p)(C^p + C^r)) のレジーレットを達成し、破損の大きさに加法的依存性を持つ。
- BrutePolicyElimination-RLメタアルゴリズムは、適応的敵対者に対して Õ(√T + (C^p + C^r)²) のレジーレットを達成し、表形式強化学習で破損レベルに対する最初の加法的依存性を実現。
- EstAllは、C^p ≤ Õ(1/ε の場合、サンプル複雑度 Õ(log|Π|/ε²) で (ε + (C^p + C^r)ε²)-近似のポリシー価値推定を保証。そうでない場合は破損レベルを検出。
- 今回のレジーレットバウンドは、破損したエピソード数だけでなく、報酬(C^r)と遷移(C^p)の破損の実際の大きさに依存する初めての結果である。
- フレームワークは、表形式強化学習において加法的破損依存性が達成可能であることを示し、Lykourisら(2020)が提起した未解決問題を解決した。
- EstAllを標準的な報酬フリー探索アルゴリズムに置き換えると、T依存性が悪化するため、EstAllが破損環境において優れた耐性を示していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。