Skip to main content
QUICK REVIEW

[論文レビュー] Provable Defense against Backdoor Policies in Reinforcement Learning

Shubham Bharti, Xuezhou Zhang|arXiv (Cornell University)|Nov 18, 2022
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿では、部分空間トリガー仮定の下で、強化学習におけるバックドアポリシーに対する証明可能で洗練された防御手法を提案する。SVDを用いてクリーンな環境との相互作用から推定された安全部分空間に状態を射影することで、再訓練を必要とせずにバックドアポリシーの耐性を高め、$\epsilon$-近似最適性を$O\left(\frac{D}{(1-\gamma)^4\epsilon^2}\right)$のクリーンなサンプル数で達成する。アタリゲーム上で実証的に検証された。

ABSTRACT

We propose a provable defense mechanism against backdoor policies in reinforcement learning under subspace trigger assumption. A backdoor policy is a security threat where an adversary publishes a seemingly well-behaved policy which in fact allows hidden triggers. During deployment, the adversary can modify observed states in a particular way to trigger unexpected actions and harm the agent. We assume the agent does not have the resources to re-train a good policy. Instead, our defense mechanism sanitizes the backdoor policy by projecting observed states to a 'safe subspace', estimated from a small number of interactions with a clean (non-triggered) environment. Our sanitized policy achieves $ε$ approximate optimality in the presence of triggers, provided the number of clean interactions is $O\left(\frac{D}{(1-γ)^4 ε^2} ight)$ where $γ$ is the discounting factor and $D$ is the dimension of state space. Empirically, we show that our sanitization defense performs well on two Atari game environments.

研究の動機と目的

  • 部分空間トリガー仮定の下で、強化学習におけるバックドアポリシーを形式的に定義すること。
  • ポリシーの再訓練を必要としない、証明可能な防御機構を開発すること。
  • 洗練されたポリシーがクリーン環境およびトリガーが発動した環境の両方でほぼ最適な性能を維持することを保証すること。
  • 現実の攻撃条件下で、アタリゲーム環境における防御の実証的検証を行うこと。

提案手法

  • 防御は、クリーンな環境との相互作用から得た状態特徴のSVDを用いて推定された安全部分空間に、観測された状態を射影する。
  • 安全部分空間は、クリーン状態の経験的共分散行列の上位固有ベクトルの張る空間として定義される。
  • この手法は、トリガーが低次元の直交部分空間$E^\perp$に存在すると仮定しており、これによりトリガーの影響を射影によって除去可能となる。
  • 洗練されたポリシーは、状態を安全部分空間に射影した後、元のバックドアポリシーを適用することで構築される。
  • 安全部分空間の次元$d$は、経験的共分散行列のスペクトルギャップを用いて推定される。
  • この防御はラッピング手法であり、元のポリシーの再訓練は一切不要である。

実験結果

リサーチクエスチョン

  • RQ1トリガーが低次元部分空間に限定される強化学習におけるバックドアポリシーに対して、証明可能な防御を構築できるか?
  • RQ2保証された性能境界を得るために、安全部分空間を推定するのに必要なサンプル複雑度は何か?
  • RQ3洗練されたポリシーの性能は、クリーン環境との相互作用回数にどのように依存するか?
  • RQ4再訓練を伴わずに、クリーン環境およびトリガーが発動した環境の両方で、ほぼ最適な性能を維持できるか?
  • RQ5安全部分空間の次元$d$の誤推定に、防御の性能はどれほど敏感か?

主な発見

  • 洗練されたポリシーは、トリガーが存在する状況でも$\epsilon$-近似最適性を達成し、サンプル複雑度は$O\left(\frac{D}{(1-\gamma)^4\epsilon^2}\right)$のクリーンな相互作用が必要である。
  • 実証的結果から、クリーンなサンプル数$n$が増加するにつれて洗練されたポリシーの性能が向上し、最終的にはトリガーが存在しても元のクリーンな性能に回復することが確認された。
  • Boxing-Ram環境では、$n=40$のクリーンサンプルと$d \approx 24$で性能回復が観察されたが、Breakoutでは$n=32768$と$d \approx 20000$が必要だった。
  • $d$の過大評価または過小評価の両方が性能を劣化させることから、スペクトルギャップ検出による正確な$d$推定の重要性が浮き彫りになった。
  • 再訓練を伴わず、2つのアタリ環境でバックドア攻撃を効果的に緩和した。これにより、ラッピングベースの洗練手法の実用的妥当性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。