[論文レビュー] Robust Policy Gradient against Strong Data Corruption
本論文は、報酬と遷移の両方で強力なデータ改ざんが行われる状況下でも $O(\varepsilon^{1/4})$-最適な方策を達成する、頑健な強化学習アルゴリズムであるフィルタドポリシーグラデント(FPG)を提案する。ここで、最大 $\varepsilon$-部のエピソードが敵対的に改ざんされている。FPGは自然ポリシーグラデントフレームワーク内にフィルタリング機構を導入し、無限大に発散する報酬改ざんの影響を軽減する。これにより、線形の改ざん予算下で失敗する従来手法に比べ、優れた性能を発揮する。
We study the problem of robust reinforcement learning under adversarial corruption on both rewards and transitions. Our attack model assumes an extit{adaptive} adversary who can arbitrarily corrupt the reward and transition at every step within an episode, for at most $ε$-fraction of the learning episodes. Our attack model is strictly stronger than those considered in prior works. Our first result shows that no algorithm can find a better than $O(ε)$-optimal policy under our attack model. Next, we show that surprisingly the natural policy gradient (NPG) method retains a natural robustness property if the reward corruption is bounded, and can find an $O(\sqrtε)$-optimal policy. Consequently, we develop a Filtered Policy Gradient (FPG) algorithm that can tolerate even unbounded reward corruption and can find an $O(ε^{1/4})$-optimal policy. We emphasize that FPG is the first that can achieve a meaningful learning guarantee when a constant fraction of episodes are corrupted. Complimentary to the theoretical results, we show that a neural implementation of FPG achieves strong robust learning performance on the MuJoCo continuous control benchmarks.
研究の動機と目的
- 報酬と遷移の両方で強い適応的データ改ざんが行われる状況下でも、ポリシーグラデント手法の頑健性の欠如を解消すること。
- 一定割合のエピソードが改ざんされている状況でも効果を発揮するアルゴリズムの開発。この状況下では従来手法は失敗する。
- 改ざんレベル $\varepsilon$ の事前知識が不要な状態で、有界および無限大の報酬改ざん下での頑健性に関する理論的保証を提供すること。
- MuJoCoベンチマークにおけるニューラルネットワーク実装を通じて、実用的応用の有効性を実証すること。
提案手法
- ポリシーグラデント更新中に改ざんデータを除外するフィルタリング機構を適用するフィルタドポリシーグラデント(FPG)アルゴリズムを提案する。
- 敵対的乗っ取りに対しても、方策 $\pi$ 下での状態行動ペアとリターン推定値を収集できる $d_{\nu}^{\pi}$-サンプラーと $Q^{\pi}$-推定器を用いる。
- 重みベクトル $w$ に有界な $\ell_2$-ノルム制約を課した線形回帰を用いて、価値関数の勾配を推定する。
- 回帰段階で改ざん済みエピソードを特定・除外するフィルタリングステップを導入し、無限大の報酬改ざんに対する頑健性を向上させる。
- 学習率 $\eta$ を用いた自然ポリシーグラデント更新を適用し、$\theta^{(t+1)} = \theta^{(t)} + \eta w^{(t)}$ と更新する。
- 改ざんレベル $\varepsilon$ に適応可能であり、$\varepsilon$ の事前知識が不要であることを保証する。
実験結果
リサーチクエスチョン
- RQ1強い適応的改ざんが報酬と遷移の両方で行われる状況下で、$O(\varepsilon)$ よりも優れた $O(\varepsilon)$-最適な方策を達成できるアルゴリズムは存在するか?
- RQ2自然ポリシーグラデント(NPG)法は、有界な報酬改ざん下でも頑健性を保つのか? もしそうなら、どの程度まで?
- RQ3改変されたポリシーグラデント法は、無限大の報酬改ざんに耐えながらも、意味のある性能保証を達成できるか?
- RQ4連続制御環境における高い改ざん率下でも、頑健性を維持できる実用的でニューラルネットワーク互換のアルゴリズムを設計することは可能か?
主な発見
- 提案された強い改ざんモデル下では、どのアルゴリズムでも $\Omega(\varepsilon)$-最適な方策を保証することはできず、理論的下界が確立される。
- 自然ポリシーグラデント(NPG)は、有界な報酬改ざん下で $O(\sqrt{\varepsilon})$-最適性を達成し、内在的な頑健性を示す。
- 提案されたフィルタドポリシーグラデント(FPG)アルゴリズムは、無限大の報酬改ざん下でも $O(\varepsilon^{1/4})$-最適性を達成し、定数割合の改ざん下での初めてのこのような保証である。
- FPGは改ざんレベルに適応可能であり、$\varepsilon$ の事前知識が不要であるため、実世界への展開に実用的である。
- FPGのニューラルネットワーク実装は、MuJoCoの連続制御ベンチマークで強力な頑健な学習性能を発揮し、実用性を裏付けた。
- 理論的分析により、有界な改ざん下でもQ値回帰の推定誤差が有界に保たれ、近似的に最適な方策への収束が可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。