[論文レビュー] Robust Stochastic Linear Contextual Bandits Under Adversarial Attacks
本論文は、攻撃予算や攻撃形式の事前知識が不要であり、報酬と文脈の両方に対して完全に適応的かつ全知的な敵対的攻撃に対しても非線形なレグレットを達成する、最初のロバストな確率的線形文脈的バンディットアルゴリズムを提案する。この手法は、動的探索調整を伴う二層構造のバンディットアーキテクチャを採用し、シミュレーションおよびMovielensやNetflixなどの実世界のデータセットにおけるGarcelonおよびOracle攻撃の下で、LinUCB、LinTS、Greedyベースラインと比較して顕著なロバスト性の向上を示している。
Stochastic linear contextual bandit algorithms have substantial applications in practice, such as recommender systems, online advertising, clinical trials, etc. Recent works show that optimal bandit algorithms are vulnerable to adversarial attacks and can fail completely in the presence of attacks. Existing robust bandit algorithms only work for the non-contextual setting under the attack of rewards and cannot improve the robustness in the general and popular contextual bandit environment. In addition, none of the existing methods can defend against attacked context. In this work, we provide the first robust bandit algorithm for stochastic linear contextual bandit setting under a fully adaptive and omniscient attack with sub-linear regret. Our algorithm not only works under the attack of rewards, but also under attacked context. Moreover, it does not need any information about the attack budget or the particular form of the attack. We provide theoretical guarantees for our proposed algorithm and show by experiments that our proposed algorithm improves the robustness against various kinds of popular attacks.
研究の動機と目的
- 報酬と文脈の両方が操作される状況下で、確率的線形文脈的バンディットアルゴリズムのロバスト性の欠如に取り組むこと。
- プレイヤーの意思決定をリアルタイムで観測する完全に適応的かつ全知的な攻撃者に対しても、非線形レグレットを維持できる手法を開発すること。
- 攻撃予算や攻撃パターンの知識が不要であるアルゴリズムを設計し、一般の文脈的バンディット設定に適用可能なものとすること。
- 報酬の破損にとどまらず、これまで未解決であった文脈の操作に対してもロバスト性を拡張すること。
- 実世界の推薦データにおける多様な攻撃タイプの下で、LinUCB、LinTS、Greedy手法との比較によるアルゴリズムの優位性を実証的に検証すること。
提案手法
- 上位層にEXP3を、下位層にLinUCBを用いた二層バンディットアーキテクチャを提案。上位のEXP3層が下位のLinUCB層の探索パラメータC'を動的に選択する。
- EXP3層は各ラウンドごとに直前のラウンドからの即時のフィードバックに基づいてC'を決定し、履歴情報を保持するためのエポックベースの再起動を回避する。
- C'に依存する拡大された探索パラメータを備えた変更版LinUCBアルゴリズムを導入し、敵対的攻撃に対してロバストな性能を実現する。
- 理論的分析により、レグレットバウンドが Õ(d^{1/2}(C+1)T^{3/4}) + Õ(d^{3/2}CT^{1/4}) であることが示され、有限な攻撃予算Cのもとで非線形となる。
- BOB-No-Restartという再起動なしのバージョンを用いて実験的に評価。理論的保証が欠如しているものの、実際の応用ではより優れた性能を示す。
- 行列分解から得られる特徴ベクトルを用いて、現実的な文脈的バンディット環境を模擬する実世界のデータセット(Movielens、Netflix)を用いる。
実験結果
リサーチクエスチョン
- RQ1報酬と文脈の両方に対して完全に適応的かつ全知的な攻撃が行われる状況下でも、確率的線形文脈的バンディットアルゴリズムが非線形レグレットを達成できるか。
- RQ2攻撃予算や攻撃パターンの事前知識が不要なロバストなアルゴリズムを設計することは可能か。
- RQ3本手法の性能は、報酬と文脈の両方の攻撃下でLinUCB、LinTS、Greedyと比較してどの程度優れているか。
- RQ4再起動なしのバージョン(BOB-No-Restart)は、理論的保証が欠如しているにもかかわらず、実験的に優れたロバスト性を達成できるか。
- RQ5レグレットバウンドにおける攻撃予算Cと時間枠Tの間の理論的トレードオフは何か。
主な発見
- 提案されたRobustBanditアルゴリズムは、報酬と文脈の両方に対する敵対的攻撃下でも、レグレット Õ(d^{1/2}(C+1)T^{3/4}) + Õ(d^{3/2}CT^{1/4}) を非線形に達成する。
- GarcelonおよびOracle攻撃の下で、シミュレーションおよびMovielens、Netflixデータセットにおいて、LinUCB、LinTS、Greedyベースラインと比較して累積レグレットの観点で優れた性能を示す。
- 再起動なしのバージョンであるBOB-No-Restartは、理論的に保証されたRobustBanditを含むすべてのベースラインと比較して、実験的に顕著に優れたロバスト性を達成する。
- 従来のLinUCBは攻撃予算Cが Ω(log T) に達する際、線形レグレットを示すことが判明し、攻撃下での標準的手法の脆弱性を示している。
- 本手法は、攻撃予算や攻撃形式の情報が不要であるにもかかわらず、一般の文脈的バンディット設定において報酬と文脈の両方の攻撃に対抗する最初の手法である。
- 実験により、攻撃者が上位半分のアームを標的とする場合でも、アルゴリズムがロバストな性能を維持することが確認され、戦略的かつ適応的な攻撃に対しても強い耐性を示していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。