Skip to main content
QUICK REVIEW

[論文レビュー] Budget-Constrained Bandits over General Cost and Reward Distributions

Semih Çaycı, Atilla Eryılmaz|arXiv (Cornell University)|Feb 29, 2020
Advanced Bandit Algorithms Research参考文献 30被引用数 5
ひとこと要約

本稿では、一般の相関関係があり、重い尾を持つコスト報酬ペアを伴う予算制約付き意思決定のための新しいバンディットアルゴリズムを提案する。コスト報酬の相関関係を活用するため、線形最小平均二乗誤差(LMMSE)推定を用いることで、$(2+\gamma)$-モーメント条件のもとで$O(\log B)$のレグレットを達成し、共分散正規分布の場合には定数因子を除いて最適な問題依存の境界が得られる。

ABSTRACT

We consider a budget-constrained bandit problem where each arm pull incurs a random cost, and yields a random reward in return. The objective is to maximize the total expected reward under a budget constraint on the total cost. The model is general in the sense that it allows correlated and potentially heavy-tailed cost-reward pairs that can take on negative values as required by many applications. We show that if moments of order $(2+γ)$ for some $γ> 0$ exist for all cost-reward pairs, $O(\log B)$ regret is achievable for a budget $B>0$. In order to achieve tight regret bounds, we propose algorithms that exploit the correlation between the cost and reward of each arm by extracting the common information via linear minimum mean-square error estimation. We prove a regret lower bound for this problem, and show that the proposed algorithms achieve tight problem-dependent regret bounds, which are optimal up to a universal constant factor in the case of jointly Gaussian cost and reward pairs.

研究の動機と目的

  • 各アームの選択が確率的で、相関関係があるコストを伴い、確率的報酬をもたらす予算制約付きマルチアームバンディットの課題に対処すること。
  • 非有界で相関関係があり、重い尾を持つコスト報酬分布を伴う状況において、タイトなレグレット境界を達成する学習アルゴリズムの開発。
  • コストと報酬の相関関係をLMMSE推定を用いて活用することで、学習効率とレグレット性能を向上させること。
  • レグレットの下界を確立し、提案アルゴリズムが問題依存設定において最適またはほぼ最適な性能を達成することを証明すること。
  • 古典的バンディット理論を、決定的または有界サポートにとどまらない一般のコスト報酬分布へと拡張すること。

提案手法

  • 各アームについて、コストと報酬の相関関係を抽出・活用するために線形最小平均二乗誤差(LMMSE)推定を用いる。
  • 真のコスト報酬分散の代わりにLMMSE推定器を補助的に用いる学習アルゴリズムを設計し、相関関係下での推定精度を向上させる。
  • 共分散および分散の経験的推定器に対する集中不等式を適用し、推定誤差を高確率で有界化する。
  • 推定誤差とサンプリング非効率性を分離する分解を用いて、コスト報酬ペアのモーメント条件を活用してレグレット境界を導出する。
  • LMMSE係数および残差分散の信頼性ある推定を保証するため、標本サイズに対する安定性条件を導入する。
  • 予算制約下での探索と活用のバランスを取るために、推定されたコスト報酬相関および分散を組み込んだ修正型UCBスタイルのアルゴリズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1一般の相関的・重い尾を持つコスト報酬ペアを伴う予算制約付きバンディット設定において、$O(\log B)$のレグレットを達成できるか。
  • RQ2コストと報酬の相関関係をどのように活用することで、このような設定でのレグレットを低減できるか。
  • RQ3この問題における根本的な限界(下界)は何か。また、アルゴリズムはその限界にどの程度近づけるか。
  • RQ4共分散正規分布の場合に、提案アルゴリズムがユニバーサル定数因子を除いて最適なレグレット境界を達成できるか。
  • RQ5実際の応用において、LMMSE係数および残差分散の信頼性ある推定を保証するための標本サイズ条件は何か。

主な発見

  • コスト報酬ペアが$2+\gamma$次のモーメントを有する(ある$\gamma > 0$に対して)という仮定の下で、提案アルゴリズムは$O(\log B)$のレグレットを達成する。
  • LMMSE推定を用いてコスト報酬の相関関係を活用することで、共分散正規分布の場合に、ユニバーサル定数因子を除いて最適な問題依存のレグレット境界が達成される。
  • 予算制約付きバンディット問題に対して、レグレットの下界が確立され、正規分布の場合には上界と定数因子を除いて一致する。
  • 集中解析の結果、コストの分散に依存する安定性条件を満たす標本サイズであれば、LMMSE推定器およびその分散推定値が高確率で収束することが示される。
  • $(2+\gamma)$-次のモーメントが存在する限り、重い尾を持つ分布に対してもロバストであり、有界または軽い尾の仮定にとどまらない応用範囲を拡張する。
  • コストと報酬の間に強い依存関係がある状況では、コスト報酬相関を活用しない従来の手法に比べ、提案アルゴリズムが優れた性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。