[論文レビュー] Policy Teaching via Environment Poisoning: Training-time Adversarial Attacks against Reinforcement Learning
本論文は、強化学習におけるトレーニング時データ汚染の枠組みを構築し、報酬と遷移ダイナミクスの汚染の下で、エージェントに特定のポリシーを採用させることを目的とする。オフラインの計画とオンライン学習の脅威を評価する。
We study a security threat to reinforcement learning where an attacker poisons the learning environment to force the agent into executing a target policy chosen by the attacker. As a victim, we consider RL agents whose objective is to find a policy that maximizes average reward in undiscounted infinite-horizon problem settings. The attacker can manipulate the rewards or the transition dynamics in the learning environment at training-time and is interested in doing so in a stealthy manner. We propose an optimization framework for finding an \\emph{optimal stealthy attack} for different measures of attack cost. We provide sufficient technical conditions under which the attack is feasible and provide lower/upper bounds on the attack cost. We instantiate our attacks in two settings: (i) an \\emph{offline} setting where the agent is doing planning in the poisoned environment, and (ii) an \\emph{online} setting where the agent is learning a policy using a regret-minimization framework with poisoned feedback. Our results show that the attacker can easily succeed in teaching any target policy to the victim under mild conditions and highlight a significant security threat to reinforcement learning agents in practice.
研究の動機と目的
- 平均報酬の下で動作する未割り引き無限ホライズンMDPにおけるRLエージェントに対するトレーニング時汚染脅威を動機づけ、形式化する。
- ターゲットポリシーをε-頑健最適にするような隠密な汚染戦略を構築するための最適化ベースの方法を開発する。
- オフライン計画とオンライン学習、報酬と遷移ダイナミクスの汚染の攻撃モデルを区別する。
- 攻撃の実現可能性とコストに関する理論的境界を提供し、構成的アプローチとシミュレーションを提示する。
提案手法
- RLを平均報酬MDPとしてモデル化し、ターゲットポリシーのε-頑健最適性を定義する。
- オフラインでターゲットポリシーを最適にするように報酬や遷移ダイナミクスを変更する汚染問題を定式化する、またはオンライン学習者をターゲットポリシーへ誘導する汚染問題を定式化する。
- 制約の指数的な複雑さをSとAに対して線形に低減する近傍ポリシーベースの検証(π{s;a})を導入する。
- 汎関数的/構造化最適化問題(P1, P3)と非凸な定式化(P2, P4)を導出し、報酬または遷移の汚染についての実行可能性を分析する。
- Hajnal測度(α)とχ̄項を用いた攻撃コストの十分条件と境界を提供し、オフラインの結果をオンラインのサンプリングベース攻撃と関連付ける。
実験結果
リサーチクエスチョン
- RQ1攻撃者は環境を汚染してオフライン計画で選択されたターゲットポリシーをε-頑健最適にすることができるか。
- RQ2報酬または遷移ダイナミクスを汚染して、オンラインのRL学習者をターゲットポリシーへ慎重に誘導しつつ攻撃コストを最小化するにはどうするべきか。
- RQ3この種の汚染攻撃のコストに関する理論的境界と実現可能性を保証する条件は何か。
- RQ4オフラインの汚染結果がサンプリングMDPを用いた実用的なオンライン攻撃テンプレートへどう翻訳されるか。
- RQ5報酬の汚染とダイナミクスの汚染の設計の違いは何か。
主な発見
- 攻撃者は穏当な条件の下でターゲットポリシーを実現可能かつ隠密に教示でき、コスト境界を定量化できる。
- 報酬汚染を介したオフライン計画攻撃は凸最適化(P1)を生み、実行可能な解とχ̄およびαにリンクしたコスト境界を提供する。
- オフラインのダイナミクス汚染攻撃は(一般に非凸)問題(P2)につながるが、攻撃コストの十分条件と上限/下限を提供する。
- オンライン攻撃はサンプリングMDPアプローチを活用し、平均ミスマッチと平均コストを学習者の後悔とχ̄εに結びつけ、攻撃設計を導く。
- オンライン攻撃の場合、サンプリングMDPが遍在性をもち、ターゲットポリシーがε-頑健最適であるなら、平均ミスマッチをo(1)達成可能であることを示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。