Skip to main content
QUICK REVIEW

[論文レビュー] Data Poisoning Attacks in Contextual Bandits

Yuzhe Ma, Kwang-Sung Jun|arXiv (Cornell University)|Aug 17, 2018
Advanced Bandit Algorithms Research参考文献 16被引用数 4
ひとこと要約

本稿では、文脈的バンディットにおける最適化ベースのデータ汚染攻撃フレームワークを提案し、特定の文脈下でターゲットアームが選択されるように、履歴報酬を操作する。凸最適化問題を解くことで、特に高次元空間においても最小限の副作用で高い成功確率を達成する。これは、推薦や医療応用で用いられる強化学習システムにおける深刻なセキュリティ脆弱性を示している。

ABSTRACT

We study offline data poisoning attacks in contextual bandits, a class of reinforcement learning problems with important applications in online recommendation and adaptive medical treatment, among others. We provide a general attack framework based on convex optimization and show that by slightly manipulating rewards in the data, an attacker can force the bandit algorithm to pull a target arm for a target contextual vector. The target arm and target contextual vector are both chosen by the attacker. That is, the attacker can hijack the behavior of a contextual bandit. We also investigate the feasibility and the side effects of such attacks, and identify future directions for defense. Experiments on both synthetic and real-world data demonstrate the efficiency of the attack algorithm.

研究の動機と目的

  • オンライン推薦や適応医療治療に広く用いられる文脈的バンディットシステムにおける、オフラインデータ汚染攻撃の可能性を調査すること。
  • 特定の文脈下でターゲットアームが選択されるように履歴報酬を操作する一般化された攻撃フレームワークを開発すること。
  • 特に高次元空間および実世界の設定において、このような攻撃の副作用と検出可能性を分析すること。
  • 文脈的バンディットシステムにおける攻撃および防御メカニズムの今後の研究方向性を同定すること。

提案手法

  • 攻撃フレームワークは、汚染問題を凸最適化タスクとして定式化し、攻撃者が履歴報酬を変更することで、ターゲット文脈におけるターゲットアームの選択を促進する推定パラメーターベクトルをシフトさせる。
  • 検出可能性を最小限に抑えるために、摂動を加えた報酬が元の値から小さな範囲内に収まるように制約付き最適化手法を用いる。
  • 攻撃者はターゲット文脈 $x^*$ とターゲットアーム $a^*$ を指定し、バンディットアルゴリズムのポリシーが $x^*$ を観測した際に $a^*$ を選択するよう報酬摂動を求める。
  • 線形文脈的バンディットで用いられる正則化およびノイズモデルを最適化に組み込み、標準的な学習アルゴリズム下でも攻撃の有効性を保証する。
  • 副作用は、テスト用の文脈セットを用いて、攻撃によってポリシーが元のものから逸脱する文脈の割合を測定することで定量化する。
  • 攻撃の成功率と副作用を、次元数、アーム数、ユーザー頻度の変動を想定して、合成データおよび実世界データの両方で実験する。

実験結果

リサーチクエスチョン

  • RQ1攻撃者が文脈や行動を変更せずに、履歴報酬のみを汚染することで、文脈的バンディットポリシーを成功裏に乗っ取ることができるか?
  • RQ2アーム数や問題の次元数が増加する際、ポリシーが元のものから逸脱する文脈の割合(副作用)はどのように変化するか?
  • RQ3高次元設定における攻撃の検出可能性はどの程度で、低次元または実世界のユーザー頻度シナリオと比較してどう異なるか?
  • RQ4攻撃を同時に複数の文脈に拡張することは可能か?その際の課題は何か?
  • RQ5防御側は副作用をどのように活用してこのようなデータ汚染攻撃を検出できるか?攻撃者は検出を最小限に抑えるためにどのような戦略を取れるか?

主な発見

  • 攻撃は、現実的なノイズと正則化設定下でも、ターゲット文脈におけるターゲットアームの選択を高い正確性で強制する。
  • 高次元空間(例:$d=200$)では、副作用の割合が 0.035 まで低下し、次元数が増加するにつれて攻撃が著しく検出しにくくなることが示された。
  • 実世界データでは、ユーザー頻度に応じて副作用が変動:高頻度ユーザーでは 53.91% および 50.40%、中頻度ユーザーでは 7.50% にとどまり、検出可能性にばらつきがあることが明らかになった。
  • アーム数($K=2, 20, 200$)の異なる条件下での副作用中央値は 0.2–0.3 の範囲で安定しており、$K$ の増加に伴い著しい増加は見られなかった。
  • ターゲットアームがターゲット文脈下で最も成績が悪い場合でも、攻撃は依然として有効であり、学習プロセスに対する強い制御能力を示した。
  • 結果は、推薦や医療など、長期的影響を及ぼす可能性のある応用分野で文脈的バンディットに依存する現実世界のAIシステムにおける深刻なセキュリティ脅威を露呈している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。