Skip to main content
QUICK REVIEW

[論文レビュー] Defense Against Reward Poisoning Attacks in Reinforcement Learning

Kiarash Banihashem, Adish Singla|arXiv (Cornell University)|Feb 10, 2021
Adversarial Robustness in Machine Learning参考文献 44被引用数 9
ひとこと要約

本稿では、攻撃者が改ざんした報酬関数から導かれる妥当な真の報酬関数の下で、最も悪い状況下の性能を最大化することにより、強化学習における報酬改ざん攻撃に対する防御のための最適化フレームワークを提案する。この防御は、期待報酬の下限および攻撃者の目標方策との相対的非最適性の上限を含む、証明可能な性能保証を達成しており、シミュレーション環境における実証的検証も行われている。

ABSTRACT

We study defense strategies against reward poisoning attacks in reinforcement learning. As a threat model, we consider attacks that minimally alter rewards to make the attacker's target policy uniquely optimal under the poisoned rewards, with the optimality gap specified by an attack parameter. Our goal is to design agents that are robust against such attacks in terms of the worst-case utility w.r.t. the true, unpoisoned, rewards while computing their policies under the poisoned rewards. We propose an optimization framework for deriving optimal defense policies, both when the attack parameter is known and unknown. Moreover, we show that defense policies that are solutions to the proposed optimization problems have provable performance guarantees. In particular, we provide the following bounds with respect to the true, unpoisoned, rewards: a) lower bounds on the expected return of the defense policies, and b) upper bounds on how suboptimal these defense policies are compared to the attacker's target policy. We conclude the paper by illustrating the intuitions behind our formal results, and showing that the derived bounds are non-trivial.

研究の動機と目的

  • 訓練中に報酬改ざん攻撃を受けたとしても、真の報酬関数の下で高い有用性を維持する防御戦略の設計。
  • エージェントが改ざんされた報酬しか観測できないという課題に対処すること。
  • 報酬改ざん攻撃に内在する構造的制約(特に最小限の変更コスト)を活用し、妥当な真の報酬関数を推定すること。
  • 攻撃者の目標方策との比較において、期待報酬の下限および非最適性の上限が保証される、証明可能な頑健性を持つ防御方策の開発。

提案手法

  • 改ざんされた報酬と攻撃制約を満たす妥当な真の報酬関数の集合に対して最適化問題を定式化する。
  • 状態行動確保度測度を用いて、報酬摂動が方策の最適性に与える影響を特徴づけ、妥当な真の報酬関数の推定を可能にする。
  • すべての妥当な真の報酬関数の下で最悪ケースの期待報酬を最大化することで、防御方策を構築し、悪意ある報酬操作に対して頑健であることを保証する。
  • 既知および未知の攻撃パラメータを同時に考慮するデュアル最適化フレームワークを採用し、適応的防御戦略の実現を可能にする。
  • 攻撃者の最適性ギャップと報酬改ざんメカニズムの構造を用いて、防御性能の理論的境界を導出する。
  • チェーンMDP環境におけるシミュレーションを通じて、本手法の有効性を検証し、攻撃者の目標方策およびベースライン防御戦略を上回る性能を示した。

実験結果

リサーチクエスチョン

  • RQ1改ざんされた報酬しか観測できない状況下でも、真の報酬関数の下で高い期待報酬を維持できる防御方策を設計できるか?
  • RQ2報酬改ざん攻撃の構造的制約(例:最小コスト)を活用して、妥当な真の報酬関数を推定する方法は何か?
  • RQ3妥当な真の報酬関数の集合に対して最悪ケースの効用を最大化する防御方策に対して、どのような理論的性能保証を提供できるか?
  • RQ4真の報酬関数の下で、防御方策は攻撃者の目標方策と比較してどの程度の性能を示すか?
  • RQ5攻撃パラメータ(例:最適性ギャップ)が未知である場合でも、防御方策は効果的に最適化可能か?

主な発見

  • 防御方策は真の報酬関数の下で期待報酬の下限を達成しており、これは下限の基準に達する性能を保証する。
  • 防御方策は真の報酬関数の下で最適方策からの非最適性が有界であることが証明されており、非最適性の上限は攻撃パラメータの関数として与えられる。
  • シミュレーションでは、真の報酬関数の下で防御方策が0.03のスコアを達成したのに対し、攻撃者の目標方策は同様の指標で-0.42のスコアにとどまり、顕著な性能優位性を示した。
  • 真の報酬関数の下での防御方策の性能は、常に改ざん報酬の下での性能以上であったことから、理論的予測が正当化された。
  • 攻撃の影響力が、攻撃者の方策の影響力の少なくとも1/(2+δ)倍に加え定数Cを加えたもの以上であることが示され、攻撃の深刻度が増大しても防御の頑健性が保証された。
  • 攻撃パラメータが未知である場合でも、妥当な攻撃シナリオの集合を最適化することで、本フレームワークは依然として有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。