[論文レビュー] Provably Efficient Black-Box Action Poisoning Attacks Against Reinforcement Learning
本稿は強化学習におけるアクション汚染攻撃を導入し、攻撃者がエージェントの行動を操作することでターゲット方策を強制する。LCB-Hブラックボックス攻撃戦略を提案し、攻撃者が環境やエージェントアルゴリズムの事前知識がなくても、任意の効率的RLエージェントをサブラインアクストコストと損失で攻撃者の方策に従わせられることを証明した。
Due to the broad range of applications of reinforcement learning (RL), understanding the effects of adversarial attacks against RL model is essential for the safe applications of this model. Prior theoretical works on adversarial attacks against RL mainly focus on either observation poisoning attacks or environment poisoning attacks. In this paper, we introduce a new class of attacks named action poisoning attacks, where an adversary can change the action signal selected by the agent. Compared with existing attack models, the attacker's ability in the proposed action poisoning attack model is more restricted, which brings some design challenges. We study the action poisoning attack in both white-box and black-box settings. We introduce an adaptive attack scheme called LCB-H, which works for most RL agents in the black-box setting. We prove that the LCB-H attack can force any efficient RL agent, whose dynamic regret scales sublinearly with the total number of steps taken, to choose actions according to a policy selected by the attacker very frequently, with only sublinear cost. In addition, we apply LCB-H attack against a popular model-free RL algorithm: UCB-H. We show that, even in the black-box setting, by spending only logarithm cost, the proposed LCB-H attack scheme can force the UCB-H agent to choose actions according to the policy selected by the attacker very frequently.
研究の動機と目的
- 攻撃者が観測値や環境ダイナミクスではなく、エージェントの行動を操作するアクション汚染攻撃の実現可能性と影響を調査すること。
- 特にエージェントの内部モデルや環境構造へのアクセスが制限されたブラックボックス設定において、効果的な攻撃を設計する課題に取り組むこと。
- コスト(行動変更の回数)と損失(ターゲット方策からの逸脱回数)の両方を最小化する、証明可能な効率性を持つブラックボックス攻撃戦略を開発すること。
- 限定的な情報のもとでも、攻撃者がサブラインコストと損失でRLエージェントに望ましい方策を採用させられることを示し、実用的妥当性を保証すること。
提案手法
- 攻撃者がリアルタイムでエージェントが選択した行動を操作する、新たな攻撃モデル「アクション汚染」を提案。目的はエージェントを事前に定義されたターゲット方策へ誘導すること。
- 上位信頼区間(UCB)の原則を用いて行動の質を推定し、最小限のコストで選択的に行動を操作するブラックボックス手法「LCB-H戦略」を導入。
- コストと損失のトレードオフフレームワークを採用。コストは行動変更回数、損失はエージェントがターゲット方策から逸脱した回数を指す。
- 動的リグレットとサブラインスケーリングに基づく理論的分析により、LCB-Hが、動的リグレットがサブラインスケーリングである任意の効率的RLエージェントに対してサブラインコストと損失を達成することを証明。
- LCB-H戦略をUCB-Hアルゴリズムに適用し、ターゲット方策に従わせるために対数的コストで十分であることを示した。
- 確率的集中不等式とリグレット分解技術を用いて、損失とコストの上界を導出し、不確実性下でも理論的保証を確保した。
実験結果
リサーチクエスチョン
- RQ1攻撃者が環境やエージェントの事前知識がなくても、ブラックボックス設定でRLエージェントの行動を効果的に操作し、ターゲット方策を強制できるか?
- RQ2アクション汚染攻撃における理論的コストと損失のトレードオフは何か? 両方の指標でサブラインスケーリングを達成できるか?
- RQ3LCB-H戦略は、白ボックス攻撃手法と比較して、性能と効率性においてどのように差異を示すか?
- RQ4LCB-H攻撃は、UCB-Hのような特定のモデルフリーRLアルゴリズムに対して、保証付きの理論的有効性を示せるか?
- RQ5行動空間が離散的かつ有限である場合、アクション汚染攻撃の根本的限界は何か?
主な発見
- LCB-Hブラックボックス攻撃戦略は、ステップ数に対してサブラインスケーリングで動的リグレットを示す任意の効率的RLエージェントに対して、サブラインコストとサブライン損失を達成する。
- UCB-Hアルゴリズムに対しては、LCB-H攻撃がターゲット方策に従わせるために対数的コストしか要せず、極めて高い効率性を示した。
- 理論的分析により、LCB-H攻撃の損失とコストが O(H^5 log(2H/p) + 1/Δ_min SAH^4 + 1/Δ_min^2 H^10 SAι) のオーダーで成長することが確認され、サブラインスケーリングが裏付けられた。
- エージェントの方策、環境ダイナミクス、内部モデルへのアクセスがなくても攻撃が証明可能に有効であるため、現実のブラックボックスシナリオに適用可能である。
- LCB-H戦略は、白ボックス攻撃のα-パーツン攻撃とほぼ同等の性能を示し、限られた情報のもとでも有効性が裏付けられた。
- 本研究により、制限された攻撃者能力のもとでも、アクション汚染攻撃がRLにおける実現可能で強力な脅威ベクトルであることが立証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。