[論文レビュー] Adversarial Attacks on Adversarial Bandits
本稿では、$T-o(T)$ラウンドのうちに、累積攻撃コストが$o(T)$にとどまるように、損失信号を摂動することで、no-regret adversarial banditアルゴリズムに対する敵対的攻撃を提案する。攻撃は被害者に依存せず、レジレットレートの知識のみを要し、攻撃コストの下界が一致することから、漸近的に最適であることが証明されている。
We study a security threat to adversarial multi-armed bandits, in which an attacker perturbs the loss or reward signal to control the behavior of the victim bandit player. We show that the attacker is able to mislead any no-regret adversarial bandit algorithm into selecting a suboptimal target arm in every but sublinear (T-o(T)) number of rounds, while incurring only sublinear (o(T)) cumulative attack cost. This result implies critical security concern in real-world bandit-based systems, e.g., in online recommendation, an attacker might be able to hijack the recommender system and promote a desired product. Our proposed attack algorithms require knowledge of only the regret rate, thus are agnostic to the concrete bandit algorithm employed by the victim player. We also derived a theoretical lower bound on the cumulative attack cost that any victim-agnostic attack algorithm must incur. The lower bound matches the upper bound achieved by our attack, which shows that our attack is asymptotically optimal.
研究の動機と目的
- 攻撃者が報酬(損失)信号を汚染することで、敵対的バンドイットアルゴリズムの脆弱性を調査すること。
- 特定の非最適なアームを選択させるために、被害者に依存しない攻撃を設計すること。
- そのような操作に必要な最小累積攻撃コストの理論的境界を確立すること。
- 標準的およびロバストなバンドイットアルゴリズム(例:Exp3 や ExpRb)に対する攻撃の有効性を評価すること。
提案手法
- 攻撃者は各ラウンドで損失信号を摂動し、内部アルゴリズムの知識がなくても、バンドイットプレーヤーが特定のアームを好むように誘導する。
- 攻撃戦略は、被害者のレジレットを部分線形に保ちつつ、$T-o(T)$ラウンドでターゲットアームが選択されるように設計されている。
- 既知のレジレットレート$O(T^\alpha)$に基づいて、摂動の大きさとタイミングを慎重に制御することで、攻撃コストを$o(T)$に抑える。
- 累積攻撃コストの理論的下界を導出し、いかなる被害者に依存しない攻撃でも、$T-o(T)$ラウンドでターゲットアームを選択するにはそれ以上のコストがかからないことを示した。
- 攻撃者の予算が変化する条件下で、Exp3およびロバストなExpRbアルゴリズムに対して、実験的に攻撃の有効性を評価した。

実験結果
リサーチクエスチョン
- RQ1攻撃者が、任意のno-regret敵対的バンドイットアルゴリズムを、大多数のラウンドで特定の非最適なアームを選択させるように操作できるか?
- RQ2すべての被害者に依存しない攻撃において、$T-o(T)$ラウンドでターゲットアームを選択するために必要な最小累積攻撃コストは何か?
- RQ3ExpRbのように報酬の改ざんに耐性を持つロバストなバンドイットアルゴリズムに対しても、攻撃はどの程度有効か?
- RQ4提案された攻撃は、攻撃コストの観点から漸近的に最適か?
主な発見
- 攻撃は、累積攻撃コストを$o(T)$に抑えながら、任意のno-regret敵対的バンドイットアルゴリズムが$T-o(T)$ラウンドでターゲットアームを選択するのを成功裏に強制した。
- 導出された攻撃コストの下界と、提案手法が達成する上界が一致するため、攻撃は漸近的に最適である。
- 実験結果から、攻撃は標準的なExp3およびロバストなExpRbアルゴリズムに対しても有効であり、攻撃者予算$Φ = T^{0.5}, T^{0.7}, T^{0.9}$の下で、攻撃コストがそれぞれ$1.40\times10^5$、$3.62\times10^5$、$5.15\times10^5$であった。
- 1ラウンドあたりの攻撃コストはそれぞれ$0.14$、$0.36$、$0.51$であり、攻撃者予算が大きくなるに従い増加しており、ExpRbの高い耐性が示された。
- 攻撃は、固定された攻撃者予算を仮定するロバストなアルゴリズム(例:ExpRb)に対しても有効であり、既存の防御は、適応的かつ被害者に依存しない攻撃に対して十分でない可能性を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。