Skip to main content
QUICK REVIEW

[論文レビュー] On Information Gain and Regret Bounds in Gaussian Process Bandits

Sattar Vakili, Kia Khezeli|arXiv (Cornell University)|Sep 15, 2020
Advanced Bandit Algorithms Research参考文献 44被引用数 7
ひとこと要約

本稿は、カーネル関数の固有値の減衰を分析することにより、ガウス過程バンディットにおける情報利得($\gamma_T$)の一般枠組みを導入する。Matérnおよび二乗指数カーネルのような一般的なカーネルに対して$\gamma_T$のより鋭い上限を導出することで、従来の上界と下界の間の大きなギャップを顕著に縮小した。これにより、頻度主義的設定下でMatérnカーネルに対して、対数要因を除いてタイトなレグレットバウンドを達成した。これは、かつて主要な未解決問題であった。

ABSTRACT

Consider the sequential optimization of an expensive to evaluate and possibly non-convex objective function $f$ from noisy feedback, that can be considered as a continuum-armed bandit problem. Upper bounds on the regret performance of several learning algorithms (GP-UCB, GP-TS, and their variants) are known under both a Bayesian (when $f$ is a sample from a Gaussian process (GP)) and a frequentist (when $f$ lives in a reproducing kernel Hilbert space) setting. The regret bounds often rely on the maximal information gain $γ_T$ between $T$ observations and the underlying GP (surrogate) model. We provide general bounds on $γ_T$ based on the decay rate of the eigenvalues of the GP kernel, whose specialisation for commonly used kernels, improves the existing bounds on $γ_T$, and subsequently the regret bounds relying on $γ_T$ under numerous settings. For the Matérn family of kernels, where the lower bounds on $γ_T$, and regret under the frequentist setting, are known, our results close a huge polynomial in $T$ gap between the upper and lower bounds (up to logarithmic in $T$ factors).

研究の動機と目的

  • ガウス過程バンディットにおけるレグレットの既存上界と下界の大きなギャップを、特に頻度主義的設定下でのMatérnカーネルに対して解消すること。
  • カーネルの固有値の減衰率に基づいた、カーネルに依存しない情報利得($\gamma_T$)の一般上限を提供すること。
  • より鋭い$\gamma_T$推定値を活用して、GP-UCB、GP-TS、SupKernelUCBのレグレットバウンドを改善すること。
  • 頻度主義的設定下で、新しい$\gamma_T$バウンドがMatérnカーネルに対して対数要因を除いてタイトであることを確立すること。
  • 固有値に基づく原理的な解析を導入することで、ベイジアン最適化における情報利得とレグレットの先行研究を統合的かつ拡張すること。

提案手法

  • カーネルの固有値の多項式的および指数的減衰率に基づいて、情報利得$\gamma_T$の一般上界を導出する。
  • 固有値減衰の条件(多項式的:$\lambda_m \sim m^{-\beta_p}$、指数的:$\lambda_m \sim \exp(-m^{\beta_e})$)を導入し、$\gamma_T$を$T$の関数としてバウンドする。
  • 具体的なカーネルに適用:Matérn($\gamma_T = \mathcal{O}(T^{d/(2\nu + d)} \log^{2\nu/(2\nu + d)}(T))$)および二乗指数($\gamma_T = \mathcal{O}(\log^{d+1}(T))$)。
  • 改善された$\gamma_T$バウンドを活用して、ベイジアンおよび頻度主義的設定下でのGP-UCB、GP-TS、SupKernelUCBのレグレット保証を精緻化する。
  • Scarlettら(2017)の既知の下界と比較することで、新しい$\gamma_T$バウンドが対数要因を除いてタイトであることを立証する。
  • 上界と下界の間のギャップを、特に重要なケースで桁違いに縮小する、先行研究を上回る統一的理論枠組みを提供する。

実験結果

リサーチクエスチョン

  • RQ1ガウス過程カーネルの固有値減衰特性から、情報利得$\gamma_T$のより鋭いバウンドを導出可能か?
  • RQ2これらの改善された$\gamma_T$バウンドは、頻度主義的設定下でのGP-UCBおよびGP-TSのレグレット性能にどのように影響するか?
  • RQ3新しいバウンドは、Matérnカーネルの既存の上界と下界のギャップをどの程度縮小するか?
  • RQ4提案された固有値ベースの解析は、二乗指数カーネルのような他の一般的に使用されるカーネルにも適用可能か?
  • RQ5GP-UCBおよびGP-TSのレグレットバウンドは、頻度主義的設定下で今や対数要因を除いてタイトか?

主な発見

  • 本稿は、Matérn-$\nu$カーネルに対して$\gamma_T = \mathcal{O}(T^{d/(2\nu + d)} \log^{2\nu/(2\nu + d)}(T))$を確立し、先行のバウンドを改善し、既知の$\Omega(T^{d/(2\nu + d)})$下界と対数要因を除いてギャップを埋めた。
  • 二乗指数カーネルに対しては、$\gamma_T = \mathcal{O}(\log^{d+1}(T))$が対数要因を除いてタイトであることが示され、既知の下界と一致した。
  • 頻度主義的設定下で、Matérnカーネルを用いたSupKernelUCBのレグレットバウンドは、$\mathcal{O}(T^{(\nu + d)/(2\nu + d)} \log^{5/2 - d/(4\nu + 2d)}(T))$に改善され、下界とのギャップが$\log^{5/2}(T)$要因にまで縮小された。
  • $\gamma_T$のバウンドは、GP-UCBおよびGP-TSのレグレット保証を向上させ、Matérnカーネルに対して$\mathcal{O}(T^{(\nu + d)/(2\nu + d)} \log^{(4\nu + d)/(4\nu + 2d)}(T))$を達成した。これは、対数要因を除いてタイトである。
  • 解析により、頻度主義的設定下でMatérnカーネルに対して新しい$\gamma_T$バウンドが対数要因を除いて最適であることが確認され、長年の未解決問題が解決された。
  • この枠組みは、多項式的または指数的固有値減衰を示す任意のカーネルに一般化可能であり、GPバンディットにおける情報利得とレグレット解析の統一的アプローチを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。