[論文レビュー] Corruption-robust exploration in episodic reinforcement learning
本稿は、報酬と遷移の両方の悪意ある汚染に対して耐性を持つ、エピソード強化学習のための新規な汚染耐性探索フレームワークを提案する。このフレームワークは、不確実性の下での楽観主義とアクション除去の原則を組み合わせており、i.i.d. 環境では近似的最適なレグレットを達成し、悪意ある汚染下でも滑らかに性能が低下する。本手法は、非i.i.d. 遷移を伴うバンディットフィードバックによるエピソード的強化学習において、初めてのサブ線形レグレット保証を達成する。これは、表形式および線形MDPの両方の設定に適用可能である。
We initiate the study of multi-stage episodic reinforcement learning under adversarial corruptions in both the rewards and the transition probabilities of the underlying system extending recent results for the special case of stochastic bandits. We provide a framework which modifies the aggressive exploration enjoyed by existing reinforcement learning approaches based on "optimism in the face of uncertainty", by complementing them with principles from "action elimination". Importantly, our framework circumvents the major challenges posed by naively applying action elimination in the RL setting, as formalized by a lower bound we demonstrate. Our framework yields efficient algorithms which (a) attain near-optimal regret in the absence of corruptions and (b) adapt to unknown levels corruption, enjoying regret guarantees which degrade gracefully in the total corruption encountered. To showcase the generality of our approach, we derive results for both tabular settings (where states and actions are finite) as well as linear-function-approximation settings (where the dynamics and rewards admit a linear underlying representation). Notably, our work provides the first sublinear regret guarantee which accommodates any deviation from purely i.i.d. transitions in the bandit-feedback model for episodic reinforcement learning.
研究の動機と目的
- エピソード的学習の過程で報酬と遷移ダイナミクスに悪意ある汚染が加わる場合に、標準的な強化学習アルゴリズムが脆弱であるという問題に対処すること。
- マルチステージ強化学習における悪意ある汚染下で、不確実性の下での楽観主義と単純なアクション除去の限界を克服すること。
- 汚染が発生しなかった場合に近似的最適なレグレットを維持し、汚染度が上昇するに従い滑らかに性能が低下する、計算的に効率的なアルゴリズムを開発すること。
- 非i.i.d. 遷移ダイナミクスを伴うバンディットフィードバック下でのエピソード的強化学習に対して、初めてのサブ線形レグレット保証を提供すること。
- エピソード的MDPにおける表形式および線形関数近似の両設定に、耐性を拡張すること。
提案手法
- 不確実性の下での楽観主義とアクション除去の原則を統合したハイブリッドフレームワークを提案し、悪意ある汚染に対する耐性を高めること。
- 複数レベルの信頼区間とアクション除去のしきい値を用いた階層的探索戦略を設計し、汚染された軌道をフィルタリングすること。
- 自己正規化マルティングール濃度不等式を用いて、汚染されたフィードバック下での推定誤差を制御し、高確率保証を確保すること。
- 観測された汚染レベルに応じて動的に調整されるマスターポリシーを用いて、複数レベルにわたる探索を調整すること。
- アズマ=ホーディングおよびアズマ=ベルンシュタイン不等式を用いて、報酬および遷移推定誤差におけるマルティングール差分を制御すること。
- 線形関数近似をMDPに適用し、有界ノルムの価値関数と特徴量をモデル化することで、汚染下でもスケーラブルな学習を可能にすること。
実験結果
リサーチクエスチョン
- RQ1報酬と遷移の両方で一部のエピソードが汚染されている状況下でも、効果的な探索戦略を設計できるか?
- RQ2不確実性の下での楽観主義の原則とアクション除去をどのように統合すれば、汚染下で指数的レグレットを回避できるか?
- RQ3バンディットフィードバック下でのエピソード的強化学習において、探索効率と汚染耐性の根本的トレードオフは何か?
- RQ4遷移がi.i.d. でない場合に、悪意ある汚染下でエピソード的強化学習においてサブ線形レグレットを達成できるか?(これは以前に未解決であった設定である。)
- RQ5未知の汚染レベルを想定した線形MDPにおける汚染耐性強化学習の、最もタイトなレグレットバウンドは何か?
主な発見
- 提案アルゴリズムは、線形MDPにおいて、Cが汚染エピソード数であるとき、レグレットバウンド Õ(√(d³ + dA)K · CH⁴ · ln³(TAd/δ) + √(dK) · C²H⁵ · ln²(T/δ)) を達成する。
- Cが増加するに従い、レグレットが滑らかに低下する。C = 0の場合は近似的最適な性能を維持し、Tに対してサブ線形にスケーリングする。
- 本フレームワークは、非i.i.d. 遷移を伴うバンディットフィードバック下でのエピソード的強化学習に対して、初めてのサブ線形レグレット保証を提供する。これは、先行研究に対する顕著な前進である。
- アルゴリズムは計算的に効率的であり、Cの事前知識を必要とせず、適応的信頼区間により未知の汚染レベルに適応する。
- 解析により、単純なアクション除去はHに指数的レグレットを引き起こすことが示され、本手法のハイブリッドフレームワークの必要性が裏付けられた。
- 汚染が発生しない場合には近似的最適なレグレットを達成し、報酬および遷移の両方における任意の悪意ある汚染に対しても耐性を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。