[論文レビュー] Vulnerability-Aware Poisoning Mechanism for Online RL with Unknown Dynamics
本稿では、環境のダイナミクスに関する事前知識がなくても動作するオンラインディープ強化学習の脆弱性に配慮したポイズニング攻撃VA2C-Pを提案する。アルゴリズムの脆弱性を定量化するための新しい安定性半径という指標を導入し、リアルタイムでトラジェクトリをねずみにすることで、最適方策の学習を妨げたり、制限された攻撃予算のもとでもターゲット方策へ誘導したりすることに成功した。
Poisoning attacks on Reinforcement Learning (RL) systems could take advantage of RL algorithm's vulnerabilities and cause failure of the learning. However, prior works on poisoning RL usually either unrealistically assume the attacker knows the underlying Markov Decision Process (MDP), or directly apply the poisoning methods in supervised learning to RL. In this work, we build a generic poisoning framework for online RL via a comprehensive investigation of heterogeneous poisoning models in RL. Without any prior knowledge of the MDP, we propose a strategic poisoning algorithm called Vulnerability-Aware Adversarial Critic Poison (VA2C-P), which works for most policy-based deep RL agents, closing the gap that no poisoning method exists for policy-based RL agents. VA2C-P uses a novel metric, stability radius in RL, that measures the vulnerability of RL algorithms. Experiments on multiple deep RL agents and multiple environments show that our poisoning algorithm successfully prevents agents from learning a good policy or teaches the agents to converge to a target policy, with a limited attacking budget.
研究の動機と目的
- 攻撃者が環境のダイナミクスを事前に知らない状況下でも、オンポリシー深層強化学習エージェントに対するポイズニング攻撃の重要なギャップを埋めること。
- 将来のデータが入手不可であること、非 i.i.d. データであること、環境のダイナミクスが未知であることといったオンラインRLポイズニングの挑戦に立ち向かうこと。
- A2C、PPO、VPGなどのポリシーグラデントベースの深層強化学習エージェントに適用可能な実用的でリアルタイムのポイズニングフレームワークを開発すること。
- 異なるRLアルゴリズムのポイズニング攻撃に対する脆弱性を定量化・比較可能な新しい指標「安定性半径」を導入すること。
- 制限された攻撃予算のもとで、多様な環境および最先端のRLアルゴリズムにおいて、提案手法の有効性を実証すること。
提案手法
- 状態空間における小さな摂動が方策にどれほど簡単に誤導されるかを定量化することで、RLアルゴリズムの脆弱性を測定する新しい指標「安定性半径」を提案する。
- VA2C-Pを設計し、安定性半径を用いてオンライン学習中にリアルタイムで最適な摂動位置を選択する戦略的ポイズニングアルゴリズムを実現する。
- 白ボックス設定下で、攻撃者がエージェントの現在の方策を観測でき、各相互作用後に次の状態に摂動を注入できるものとする。
- Fast Gradient Sign Method (FGSM) を用いて次の状態に adversarial 摂動を生成し、その大きさと方向を安定性半径によって制御することで、方策の混乱を最大化する。
- リプレイバッファやサンプリングされたミニバッチを操作することで、SACなどのオフポリシー学習者に対してもフレームワークを拡張し、広範な適用可能性を示す。
- 環境のモデル推定に、エージェント自身の経験トラジェクトリを唯一の情報源として用い、直接的な環境との相互作用や事前の MDP 知識を必要としない。
実験結果
リサーチクエスチョン
- RQ1攻撃者が環境のダイナミクスを事前に知らない状況下でも、オンポリシー深層強化学習エージェントに対して有効なポイズニング攻撃を設計できるか?
- RQ2異なるRLアルゴリズムの脆弱性を、ポイズニングへの感受性を反映する形で定量的に測定・比較する方法は何か?
- RQ3非 i.i.d. データおよび将来のデータの入手不可性は、効果的なオンラインRLポイズニング攻撃の設計にどのような影響を及えるか?
- RQ4将来のトラジェクトリにアクセスできない状況でも、エージェントの現在の経験のみを用いてリアルタイムで動作するポイズニング戦略を開発できるか?
- RQ5多様なRL環境およびアルゴリズムにおいて、ターゲットあり・なしの両設定で、ポイズニングが学習に与える影響はどの程度か?
主な発見
- CartPole環境におけるA2CおよびPPOエージェントに対して、VA2C-PはC/K=1.0の予算のもとで、平均1エピソードあたりの報酬を約180から50未満にまで低下させ、安定した方策の学習を妨害した。
- Hopper環境では、同じ予算のもとでA2Cエージェントの平均1エピソードあたりの報酬を約300から100未満にまで低下させ、連続制御タスクにおいても有効性を示した。
- ターゲット付きポイズニングでは、ϵ=0.05のもとで500エピソード以内にCartPoleで80%以上の割合でターゲット行動を達成し、FGSMベースのベースラインを著しく上回った。
- HalfCheetah環境では、1000エピソード経過後にA2Cエージェントの累積報酬を約500から100未満にまで低下させ、複雑な走行タスクにおいても強靭性を示した。
- ブラックボックス設定でも効果を発揮し、攻撃者が方策の完全なアクセスを持たない状況でも、VA2C-Pは強力な性能を維持した。
- SACによるオフポリシーRLへの拡張により、リプレイバッファを操作することで学習性能を著しく劣化させることに成功し、オンポリシー以外のエージェントに対しても広範な適用可能性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。