Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Linear Bandits Robust to Adversarial Attacks

Ilija Bogunovic, Arpan Losalka|arXiv (Cornell University)|Jul 7, 2020
Advanced Bandit Algorithms Research参考文献 26被引用数 7
ひとこと要約

本稿では、敵対的汚染下における確率的線形バンディットに対して、2つのロバストな段階的除外アルゴリズムを提案する。1つのバージョンは汚染予算 $C$ の知識を必要とし、もう1つのバージョンはそれを必要としない。両方のアルゴリズムは、汚染が存在しない場合には近似的に最適なリグレットを達成し、それぞれ $C$ に対して線形および2次関数的依存性を示す加法的リグレット項を被る。これらは、アルゴリズムに依存しない下界を用いて、近似的に最適であることが示されている。

ABSTRACT

We consider a stochastic linear bandit problem in which the rewards are not only subject to random noise, but also adversarial attacks subject to a suitable budget $C$ (i.e., an upper bound on the sum of corruption magnitudes across the time horizon). We provide two variants of a Robust Phased Elimination algorithm, one that knows $C$ and one that does not. Both variants are shown to attain near-optimal regret in the non-corrupted case $C = 0$, while incurring additional additive terms respectively having a linear and quadratic dependency on $C$ in general. We present algorithm independent lower bounds showing that these additive terms are near-optimal. In addition, in a contextual setting, we revisit a setup of diverse contexts, and show that a simple greedy algorithm is provably robust with a near-optimal additive regret term, despite performing no explicit exploration and not knowing $C$.

研究の動機と目的

  • 特に事前保証が限られている状況における、敵対的汚染下での確率的線形バンディットの理解のギャップを埋めること。
  • 汚染がない場合($C=0$)に近似的に最適なリグレットを維持するとともに、敵対的攻撃下でも滑らかに劣化するアルゴリズムの開発。
  • 汚染予算 $C$ に対する明示的な依存関係を有するタイトなリグレット境界の確立。$C$ が既知か未知かの区別を明確にする。
  • 文脈の多様性を伴う文脈付き線形バンディットを再考し、明示的な探索や $C$ の知識なしに、単純なグリーディアルゴリズムが解析的にロバストであることを示す。

提案手法

  • 敵対的汚染の可能性を考慮するために拡大された信頼区間を用いるロバストな段階的除外アルゴリズムを提案する。
  • 2つのバリエーションを導入:1つは $C$ を知っている場合に信頼区間を調整するもの、もう1つは事前の知識なしに $C$ を段階的に推定するもの。
  • 汚染を考慮した信頼区間に基づいて、非最適な腕を段階的に排除する戦略を採用する。
  • 敵対的汚染下でも高確率でパラメータ推定値の集中を保証する、パラメータ推定ベクトルの集中限界を導出する。
  • リグレットを確率的および敵対的成分に分解する新しい分析フレームワークを用い、汚染に起因する加法的項を明確に分離する。
  • 文脈の多様性を伴う文脈付き線形バンディット設定を再検討し、明示的な探索や $C$ 依存性なしに、グリーディアルゴリズムが近似的に最適なリグレットを達成することを証明する。

実験結果

リサーチクエスチョン

  • RQ1敵対的攻撃による合計汚染予算 $C$ が制限された場合に、近似的に最適なリグレットを維持する確率的線形バンディットアルゴリズムを設計可能か?
  • RQ2$C$ が既知または未知の場合に、リグレットの $C$ に対する最適な依存関係は加法的か乗法的か?
  • RQ3文脈の多様性がある条件下で、明示的な探索や $C$ の知識なしに、文脈付き線形バンディットでロバスト性を達成することは可能か?
  • RQ4敵対的汚染下でのリグレット境界において、提案されたアルゴリズムは既存のものと比べてどのように異なるか?
  • RQ5提案された $C$ に関する加法的リグレット項の近似的最適性を示すために、アルゴリズムに依存しない下界を導出可能か?

主な発見

  • $C$ が既知のバージョンの提案アルゴリズムは、$C$ に対して線形依存性を示すリグレットを達成し、アルゴリズムに依存しない下界により、これは近似的に最適であることが示された。
  • $C$ が未知のバージョンのアルゴリズムは、$C$ に対して2次関数的依存性を示すリグレットを被るが、この依存関係に対しても近似的に最適であることが示された。
  • 汚染がない状況($C=0$)では、両アルゴリズムとも近似的に最適なリグレットスケーリングを達成し、標準的な確率的線形バンディットにおける最良の既知の境界と一致する。
  • 文脈の多様性を伴う文脈付き線形バンディットにおいて、明示的な探索や $C$ の知識なしに、単純なグリーディアルゴリズムが $C$ の加法的項を伴う近似的に最適なリグレットを達成する。
  • 本稿では、$C$ に関する加法的リグレット項が対数的要因を除いて最適であることが示され、加法的 vs. 乗法的依存性に関する未解決の問題が解決された。
  • 結果として、明示的な探索機構がなくても、最小限のアルゴリズム的オーバーヘッドで、線形バンディットにおける敵対的汚染へのロバスト性が達成可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。