Skip to main content
QUICK REVIEW

[論文レビュー] What You See May Not Be What You Get: UCB Bandit Algorithms Robust to ε-Contamination

Laura Niss, Ambuj Tewari|arXiv (Cornell University)|Oct 12, 2019
Advanced Bandit Algorithms Research被引用数 5
ひとこと要約

本稿では、ε-汚染下における確率的マルチアームバンディットに対して、最大εの報酬が適応的敵対的攻撃によって恣意的に破損する状況を想定し、crUCBと呼ばれる頑健な上界信頼区間(Upper Confidence Bound)アルゴリズムを提案する。α-トリムド平均およびα-ショート平均推定器のための濃縮不等式を用いることで、εが小さい場合に真の確率的報酬に対してO(√(KT log T))のリグレットを達成し、UCB1、EXP3、EXP3++、TsallisInfを凌駕する。

ABSTRACT

Motivated by applications of bandit algorithms in education, we consider a stochastic multi-armed bandit problem with $\varepsilon$-contaminated rewards. We allow an adversary to give arbitrary unbounded contaminated rewards with full knowledge of the past and future. We impose the constraint that for each time $t$ the proportion of contaminated rewards for any action is less than or equal to $\varepsilon$. We derive concentration inequalities for two robust mean estimators for sub-Gaussian distributions in the $\varepsilon$-contamination context. We define the $\varepsilon$-contaminated stochastic bandit problem and use our robust mean estimators to give two variants of a robust Upper Confidence Bound (UCB) algorithm, crUCB. Using regret derived from only the underlying stochastic rewards, both variants of crUCB achieve $\mathcal{O} (\sqrt{KT\log T})$ regret for small enough contamination proportions. Our simulations assume small horizons, reflecting the newly explored setting of bandits in education. We show that in certain adversarial regimes crUCB not only outperforms algorithms designed for stochastic (UCB1) and adversarial (EXP3) bandits but also those that have "best of both worlds" guarantees (EXP3++ and TsallisInf) even when our constraint on the proportion of contaminated rewards is broken.

研究の動機と目的

  • 教育や人間のフィードバック応用において低品質な応答が一般的に見られる状況において、敵対的汚染が生じる確率的バンディット設定の課題に取り組むこと。
  • 各アームの報酬の最大ε割が破損している状況でも、強いリグレット保証を維持できるバンディットアルゴリズムを開発すること。
  • 正規分布に近い分布を想定したε-汚染下における頑健な平均推定器のための理論的濃縮不等式を提供すること。
  • 実験的に、crUCBが、敵対的汚染下の小スケールの時間枠(T=1000)において、UCB1、EXP3、EXP3++、TsallisInfを上回ることを示すこと。
  • 敵対的攻撃者が過去および未来の行動を完全に把握している場合でも、アルゴリズムが効果を発揮し続けることの可能性を示すこと。

提案手法

  • サブガウス型報酬分布におけるε-汚染に耐性を持つように設計された、α-トリムド平均およびα-ショート平均の2つの頑健な平均推定器を提案する。
  • ε-汚染下におけるこれらの推定器のための新しい濃縮不等式を導出することで、敵対的破損がある状況でも信頼性の高い信頼区間を構築可能にする。
  • 頑健な平均推定器を用いて信頼区間を計算する2つのバージョン、crUCB-sとcrUCB-tを含む、頑健なUCBアルゴリズムの2つのバージョンを構築する。
  • 任意の時刻ステップにおいて、各アームの報酬の最大ε割が汚染されることを制約条件として導入し、人間の注意散逸やボット行動の現実的モデルを再現する。
  • トリミングまたはショートホールディング処理を制御する調整パラメータαを採用するが、事前に既知でなければならないが、過小評価に対しては頑健である。
  • 小スケールのシミュレーション(T=1000)とベルヌーイ型敵対的攻撃を用いて、クリーンな状況と汚染状況の両方で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1サブガウス型バンディット設定におけるε-汚染下でも、α-トリムド平均やα-ショート平均といった頑健な平均推定器が濃縮性を維持できるか?
  • RQ2これらの推定器に基づく頑健なUCBアルゴリズムが、εが十分に小さい場合に真の報酬分布に対してO(√(KT log T))のリグレットを達成できるか?
  • RQ3ε制約を超えて汚染が生じた場合、crUCBはUCB1、EXP3、EXP3++、TsallisInfと比べてどのようにリグレット性能を発揮するか?
  • RQ4crUCBは調整パラメータαの選択にどれほど敏感か?また、αが過小評価されたり過大評価されたりした場合の性能は?
  • RQ5敵対的攻撃者が過去および未来の行動を完全に把握している場合でも、汚染に頑健なアルゴリズムは強力な性能を維持できるか?

主な発見

  • εが十分に小さい場合、crUCBは真の確率的報酬に対してO(√(KT log T))のリグレットを達成し、汚染なし状況における標準的UCBと同等のリグレットバウンドを達成する。
  • T=1000、ベルヌーイ型敵対的攻撃のシミュレーションにおいて、ε-汚染制約が破られた場合でさえ、crUCBはUCB1、EXP3、EXP3++、TsallisInfを上回る性能を示す。
  • crUCBの性能はαの過大評価に対しては相対的に感受性が低く、逆にαの過小評価は性能向上をもたらすことがあることから、調整誤差に対して頑健であることが示された。
  • 標準偏差σを過大評価すると性能が低下するが、過小評価すると性能が向上する傾向があり、これはUCBアルゴリズムにおける経験的チューニング実践と整合的である。
  • ε=0(汚染なし)の場合、crUCBは標準的UCBとほぼ同等の性能を示し、クリーンな環境でも頑健な手法を用いることによるコストが最小限であることが示された。
  • フロントクラスタ攻撃(最初のε報酬がすべて汚染される)は、大多数のアルゴリズムの性能を著しく劣化させるが、crUCBは特に初期段階においても耐性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。