Skip to main content
QUICK REVIEW

[論文レビュー] On Kernelized Multi-Armed Bandits with Constraints

Xingyu Zhou, Bo Ji|arXiv (Cornell University)|Mar 29, 2022
Advanced Bandit Algorithms Research被引用数 11
ひとこと要約

本稿は、ソフト制約を用いたカーネル化されたマルチアームバンディットに対するプライマル・デュアルフレームワークを提案し、UCB やトムソンサンプリングなどの一般化された探索戦略のもとで、サブラインアクレジットとサブラインまたはゼロの制約違反を達成する。主な貢献は、報酬レジットと制約違反の両方の分析を統一するための新しい十分条件であり、RKHSに基づく関数モデルを用いることで、非線形かつ非凸な設定において、より洗練された複雑さ-レジット-制約のトレードオフを実現する。

ABSTRACT

We study a stochastic bandit problem with a general unknown reward function and a general unknown constraint function. Both functions can be non-linear (even non-convex) and are assumed to lie in a reproducing kernel Hilbert space (RKHS) with a bounded norm. This kernelized bandit setup strictly generalizes standard multi-armed bandits and linear bandits. In contrast to safety-type hard constraints studied in prior works, we consider soft constraints that may be violated in any round as long as the cumulative violations are small, which is motivated by various practical applications. Our ultimate goal is to study how to utilize the nature of soft constraints to attain a finer complexity-regret-constraint trade-off in the kernelized bandit setting. To this end, leveraging primal-dual optimization, we propose a general framework for both algorithm design and performance analysis. This framework builds upon a novel sufficient condition, which not only is satisfied under general exploration strategies, including \emph{upper confidence bound} (UCB), \emph{Thompson sampling} (TS), and new ones based on \emph{random exploration}, but also enables a unified analysis for showing both sublinear regret and sublinear or even zero constraint violation. We demonstrate the superior performance of our proposed algorithms via numerical experiments based on both synthetic and real-world datasets. Along the way, we also make the first detailed comparison between two popular methods for analyzing constrained bandits and Markov decision processes (MDPs) by discussing the key difference and some subtleties in the analysis, which could be of independent interest to the communities.

研究の動機と目的

  • 硬い安全性制約ではなく、制御可能な累積違反を許容するソフト制約を導入することで、制約付きカーネル化バンドイットにおけるギャップを埋めること。
  • 未知の非線形な報酬関数および制約関数を伴うカーネル化バンドイット問題において、UCB やトムソンサンプリングを含む一般化された探索戦略をサポートする統一されたアルゴリズム的・分析的フレームワークを開発すること。
  • ソフト制約の性質を活用することで、非線形かつ非凸な設定において、制約を満たしたまま非制約バンドイットに近い性能を達成する、より洗練された複雑さ-レジット-制約のトレードオフを実現すること。
  • 制約付きバンドイットおよび制約付きMDPにおける2つの主要な分析手法の間で、最初の詳細な比較を提供すること。理論的取り扱いにおける主な違いや微妙な点を明らかにする。

提案手法

  • フレームワークはプライマル・デュアル最適化に基づき、一般化された探索戦略のもとでサブラインレジットと制約違反を保証する、新しい十分条件を用いる。
  • 報酬関数および制約関数を有界ノルムを持つ再生核ヒルバート空間(RKHS)でモデル化することで、非線形かつ非凸な関数近似を可能にする。
  • アルゴリズムは、事後分散に基づく信頼区間(例:$\sigma_{t-1}(x_t)$)を用い、デュアル変数によるスラック項を導入して制約違反を管理する。
  • 累積的制約違反をバウンドするために、増分が有界である条件下でアズマ=ホイーディング不等式を用いたスーパーマルティンゲールの議論を採用する。
  • 推定誤差を制御するためのしきい値ベースのインジケータ $\mathcal{I}\{E^{est}\}$ を導入し、確率的に高い境界をレジットと違反の両方に対して保証する。
  • 探索戦略の十分条件を満たすことで、UCB およびトムソンサンプリングの両方をサポートし、統一された性能解析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ソフト制約のもとで、ハード制約と比較して、カーネル化バンドイットにおけるより洗練された複雑さ-レジット-制約のトレードオフを達成できるか?
  • RQ2UCB を超える一般化された探索戦略を用いて、制約付きカーネル化バンドイットのための、証明可能な効率性を持つアルゴリズムを設計できるか?
  • RQ3ソフト制約は、非線形かつ非凸な設定において、どのようにサブラインレジットを達成しつつ、サブラインまたはゼロの制約違反を実現するのか?
  • RQ4制約付きバンドイットと制約付きMDPの分析における主な違いや微妙な点は何か。それらは理論的保証にどのように影響するか?
  • RQ5提案されたプライマル・デュアルフレームワークは、制約付きカーネル化バンドイットにおけるUCBやトムソンサンプリングといった多様な探索戦略の分析を統一できるか?

主な発見

  • 提案されたフレームワークは、ソフト制約を伴うカーネル化バンドイットにおいて、UCB およびトムソンサンプリングの両方の探索戦略に対して、サブラインレジットとサブライン制約違反を達成する。
  • デュアル変数の更新におけるスラック項の導入により、制約違反をゼロまたは有界に保ちつつ、サブラインレジットを維持できる。
  • 理論的解析により、累積的制約違反が $O\left(\frac{1}{p_4} c_f(T)\sqrt{T\gamma_T} + \frac{1}{p_4} \rho c_g(T)\sqrt{T\widetilde{\gamma}_T} + \frac{(c_f(T) + \rho c_g(T))\kappa}{p_4}\sqrt{2T\ln(1/\delta)}\right)$ で有界であることが示され、ここで $\kappa = 4B + 4\rho G$ である。
  • 本フレームワークは、探索戦略の十分条件を満たすことで、制約付きカーネル化バンドイットにおけるUCBおよびトムソンサンプリングの両方の統一的解析を初めて実現する。
  • 合成データおよび実世界データを用いた数値実験により、既存手法と比較して優れた経験的性能が確認された。
  • 本稿は、制約付きバンドイットおよびMDPにおける2つの主要な分析手法の間で、最初の詳細な比較を提供し、推定誤差の取り扱いや制約の伝播に関する、繊細だが極めて重要な違いを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。