Skip to main content
QUICK REVIEW

[論文レビュー] Bandit Algorithms for Prophet Inequality and Pandora's Box

Khashayar Gatmiry, Thomas Keßelheim|arXiv (Cornell University)|Nov 16, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿は、選択された行動の報酬のみが観測可能な限られたフィードバック下で、Prophet不等式およびPandoraのボックス問題に対するバンディットアルゴリズムを導入する。最適方策のインデックスに関する信頼区間を維持し、新たな探索と活用のトレードオフメカニズムを設計することで、$ otimes ilde{O}( mathsf{poly}(n) sqrt{T})$ の近似的最適なリグレットバウンドを達成する。

ABSTRACT

The Prophet Inequality and Pandora's Box problems are fundamental stochastic problem with applications in Mechanism Design, Online Algorithms, Stochastic Optimization, Optimal Stopping, and Operations Research. A usual assumption in these works is that the probability distributions of the $n$ underlying random variables are given as input to the algorithm. Since in practice these distributions need to be learned, we initiate the study of such stochastic problems in the Multi-Armed Bandits model. In the Multi-Armed Bandits model we interact with $n$ unknown distributions over $T$ rounds: in round $t$ we play a policy $x^{(t)}$ and receive a partial (bandit) feedback on the performance of $x^{(t)}$. The goal is to minimize the regret, which is the difference over $T$ rounds in the total value of the optimal algorithm that knows the distributions vs. the total value of our algorithm that learns the distributions from the partial feedback. Our main results give near-optimal $ ilde{O}(\mathsf{poly}(n)\sqrt{T})$ total regret algorithms for both Prophet Inequality and Pandora's Box. Our proofs proceed by maintaining confidence intervals on the unknown indices of the optimal policy. The exploration-exploitation tradeoff prevents us from directly refining these confidence intervals, so the main technique is to design a regret upper bound that is learnable while playing low-regret Bandit policies.

研究の動機と目的

  • 基礎的な分布が未知であり、限られたフィードバックから学習する必要があるオンライン確率的最適化分野におけるギャップを埋めること。
  • マルチアームバンディットフレームワークにおいて、報酬フィードバックのみが利用可能な状況下で、Prophet不等式およびPandoraのボックス問題を考察すること。
  • 限られたフィードバック下でも、学習された方策と分布が既知の最適方策との差を最小化するように、近似的最適なリグレットを達成するアルゴリズムを設計すること。
  • 敵対的入力に対して、サブ線形リグレットが達成できないことを示す理論的下界を確立すること。
  • 最小限のフィードバックで低リグレット性能を達成可能なように、フィードバックモデルに跨るオンライン学習を統合すること。

提案手法

  • 最適方策の未知のインデックスに対する信頼区間を維持し、探索をガイドする。
  • 低リグレットバンディット方策を実行しながら学習可能なリグレット上界関数を設計する。
  • Prophet不等式およびPandoraのボックス設定の両方で、最適しきい値の推定値を改善するために、区間縮小アルゴリズムを用いる。
  • 適応的探索を伴うラウンド全体にわたり低リグレット性能を保証するため、ダブリングフレームワークを適用する。
  • 固定または動的順序のPandoraのボックスにおいて、方策の逸脱を制限するために、移動差分およびスワップ差分の分析を導入する。
  • 反復的な制約と信頼区間の精錬を通じて、学習された方策を多項式時間で最適方策に変換する。

実験結果

リサーチクエスチョン

  • RQ1報酬のみのバンディットフィードバックが利用可能な状況下で、Prophet不等式問題において近似的最適なリグレットを達成できるか?
  • RQ2分布が未知の状況下で、バンディットフィードバック下のPandoraのボックス問題に対しても、同様のリグレットバウンドを拡張可能か?
  • RQ3限られたフィードバック下で、敵対的入力系列において、これらの問題におけるリグレットの根本的限界は何か?
  • RQ4バンディットフィードバック下で、探索と活用のトレードオフを考慮した状況下で、最適方策インデックスの信頼区間をどのように維持・精錬できるか?
  • RQ5フィードバック要件を最小限に抑えることで、異なるフィードバックモデルに跨る一貫した近的最適性能を達成できる単一のアルゴリズムを設計可能か?

主な発見

  • 本稿は、バンディットフィードバック下で、Prophet不等式およびPandoraのボックス問題の両方において、総リグレット$ otimes ilde{O}( mathsf{poly}(n) sqrt{T})$ を達成する。
  • $n=2$ のProphet不等式において、区間縮小アプローチを用いて最適しきい値の信頼性を維持し、$ otimes ilde{O}( sqrt{T})$ のリグレットを達成する。
  • Pandoraのボックスでは、動的制約更新を通じて移動差分およびスワップ差分を制限し、効率的な方策変換を可能にする。
  • 確率的入力に対して$ Omega(\nsqrt{T})$ の下界が確立され、リグレットバウンドが対数的要因を除きタイトであることが示される。
  • 敵対的入力に対しては、完全なフィードバック下でも$ Omega(T)$ のリグレットが避けられないことが証明され、サブ線形リグレットは不可能であることが示される。
  • これらの結果により、敵対的入力下でPandoraのボックスにおけるサブ線形リグレットのオープンな問題が解決される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。