Skip to main content
QUICK REVIEW

[論文レビュー] Corruption-Tolerant Gaussian Process Bandit Optimization

Ilija Bogunovic, Andreas Krause|arXiv (Cornell University)|Mar 4, 2020
Advanced Bandit Algorithms Research参考文献 33被引用数 8
ひとこと要約

本稿では、関数評価における敵対的汚染が生じる状況下でのガウス過程バンディット最適化のための耐汚染性を持つアルゴリズム、Fast-Slow GP-UCB を提案する。高速で非耐性の GP-UCB モジュールと遅くも耐性のあるモジュール(拡大された信頼区間を備える)をランダムに切り替えることで、累積的リグレットが $\tilde{O}(C\sqrt{T})$ に抑えられ、汚染レベル $C$ に対して線形に、時間枠 $T$ に対しては非線形に依存する。理論的保証により、$C$ への依存は最悪ケースにおいて避けられず、かつ最適であることが示された。

ABSTRACT

We consider the problem of optimizing an unknown (typically non-convex) function with a bounded norm in some Reproducing Kernel Hilbert Space (RKHS), based on noisy bandit feedback. We consider a novel variant of this problem in which the point evaluations are not only corrupted by random noise, but also adversarial corruptions. We introduce an algorithm Fast-Slow GP-UCB based on Gaussian process methods, randomized selection between two instances labeled "fast" (but non-robust) and "slow" (but robust), enlarged confidence bounds, and the principle of optimism under uncertainty. We present a novel theoretical analysis upper bounding the cumulative regret in terms of the corruption level, the time horizon, and the underlying kernel, and we argue that certain dependencies cannot be improved. We observe that distinct algorithmic ideas are required depending on whether one is required to perform well in both the corrupted and non-corrupted settings, and whether the corruption level is known or not.

研究の動機と目的

  • 関数評価における敵対的汚染下で標準的な GP-UCB に見られる耐性の欠如に対処すること。
  • 汚染レベルが未知であっても、汚染済みおよび非汚染済みの両設定で性能を維持できるアルゴリズムの開発。
  • 敵対的汚染レベル $C$、時間枠 $T$、および元のカーネルに明示的に依存する理論的リグレット境界の提供。
  • リグレット境界における $C$ への線形依存が避けられず、このクラスの問題における根本的な限界を確立すること。
  • 有限腕バンディットから無限行動・カーネル化されたバンディット設定(関数値間に相関がある)への fast-slow アルゴリズムパラダイムの拡張。

提案手法

  • 高速で非耐性の GP-UCB と遅くも耐性のある GP-UCB の2つのインスタンスの間でランダムに切り替える選択メカニズムを採用し、探索と汚染耐性のバランスを図る。
  • 潜在的な敵対的摂動を考慮し、耐性のある「遅い」インスタンスで信頼区間を拡大する。
  • 不確実性の楽観主義原理を UCB ルールにより適用し、汚染された観測値に対応するため動的信頼幅調整を実施。
  • 理論的分析では、RKHSノルム制約とカーネル依存の情報ゲイン $\gamma_T$ を用いて累積的リグレットを束縛する。
  • 2つのインスタンス間での探索のバランスをとることで、汚染されたデータに過剰に依存することを避ける。
  • 新規のリグレット解析により、累積的リグレットが $\tilde{O}(C\sqrt{T})$ に比例することが示され、$\tilde{O}$ は $T$ の対数要因を隠している。

実験結果

リサーチクエスチョン

  • RQ1関数評価における敵対的汚染下でも、GPに基づくバンディットアルゴリズムが非線形リグレットを維持できるか?
  • RQ2カーネル化されたバンディット最適化において、リグレット境界における汚染レベル $C$ への線形依存は避けられないか?
  • RQ3有限腕バンディットから得られる fast-slow パラダイムを、無限行動・相関関係のある関数空間にどのように適応できるか?
  • RQ4汚染レベルが未知である状況下で、耐性と効率性の最適なトレードオフは何か?
  • RQ5インスタンス固有のギャップに依存しないリグレット境界を、一般のカーネルに対しても非自明に保てるか?

主な発見

  • Fast-Slow GP-UCB の累積的リグレットは $\tilde{O}(C\sqrt{T})$ で抑えられ、$C$ が定数のとき既知の非汚染済みの境界と一致する。
  • 最悪ケースにおいて $C$ への線形依存が避けられないことが証明され、この問題に対する根本的な下界が確立された。
  • 汚染レベルが未知であっても、汚染済みおよび非汚染済み環境の両方で性能を維持する。
  • 線形カーネルの場合、ギャップが定数のとき [Li ら, 2019] のインスタンス依存の対数的リグレットと一致するが、最悪ギャップの場合でも非線形のままである。
  • 任意の関数評価のサブセットに影響を与える敵対的汚染に対しても、アルゴリズムは耐性を示す。特に、RKHS内で高相関を持つ点を標的にする敵対的攻撃に対しても有効。
  • 分析により、非汚染状況では有益な関数値の相関が、敵対的汚染下では被害を拡大する可能性があることが確認され、これに適した別個のアルゴリズム設計が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。