Skip to main content
QUICK REVIEW

[論文レビュー] Logarithmic regret bounds for Bandits with Knapsacks

Arthur Flajolet, Patrick Jaillet|arXiv (Cornell University)|Oct 7, 2015
Advanced Bandit Algorithms Research参考文献 38被引用数 8
ひとこと要約

本稿では、動的価格設定、オンライン広告、入札最適化を含む4つの重要なケースにおいて、初期リソース供給量に関して対数的レジーットバウンドを達成する汎用アルゴリズムを提示する。主な貢献は、Bが初期リソース供給量を表すとき、分布依存のレジーットバウンドがΘ(ln(B))のオーダーで達成されることを確立したことである。これはBwK理論における重要なギャップを埋めるものである。

ABSTRACT

Optimal regret bounds for Multi-Armed Bandit problems are now well documented. They can be classified into two categories based on the growth rate with respect to the time horizon $T$: (i) small, distribution-dependent, bounds of order of magnitude $\ln(T)$ and (ii) robust, distribution-free, bounds of order of magnitude $\sqrt{T}$. The Bandits with Knapsacks model, an extension to the framework allowing to model resource consumption, lacks this clear-cut distinction. While several algorithms have been shown to achieve asymptotically optimal distribution-free bounds on regret, there has been little progress toward the development of small distribution-dependent regret bounds. We partially bridge the gap by designing a general-purpose algorithm with distribution-dependent regret bounds that are logarithmic in the initial endowments of resources in several important cases that cover many practical applications, including dynamic pricing with limited supply, bid optimization in online advertisement auctions, and dynamic procurement.

研究の動機と目的

  • 従来、Bandits with Knapsacks (BwK) では分布フリーなバウンド(√T のオーダー)しか得られていなかったが、分布依存のバウンドの欠如に対処する。
  • 標準的なMAB問題で見られる最適な振る舞いと一致する、初期リソース供給量に関して対数的レジーットを達成する汎用アルゴリズムを開発する。
  • 単一の確率的リソース、複数の決定的リソース、1つが確率的である2つのリソース、非退化性を満たす複数のリソースという4つの実用的に関連のあるケースをカバーする。
  • リソース供給量が大きい状況における対数的レジーットの理論的裏付けを提供する。これはオンライン広告など高速な応用分野で一般的である。
  • 分布依存と分布フリーなレジーットの理論的ギャップを、弱い仮定のもとで対数的バウンドが達成可能であることを示すことによって埋める。

提案手法

  • リソース制約を満たしながら、探索と活用のバランスを適応的に制御するテンプレートアルゴリズムを設計する。
  • 最適方策の線形計画(LP)緩和を用いて、実行可能基底を定義し、アーム選択をガイドする。
  • 集中不等式と martingale 論法を用いて、非最適アームが引かれる回数をバウンドする。
  • 小さなリソース供給量の変化が最適解を著しく変えるのを防ぐために、非退化性条件を導入する。
  • 双対変数の構造と実行可能領域の幾何学的性質を活用し、Bに関して対数的にスケーリングするレジーットバウンドを導出する。
  • レジーットバウンドが逆ギャップΔx と総リソース供給量に依存することを証明し、定数は問題の非退化性とリソース比に依存する。

実験結果

リサーチクエスチョン

  • RQ1Bandits with Knapsacks において、初期リソース供給量Bを用いて、分布依存のレジーットバウンドがΘ(ln(B))のオーダーで達成可能か?
  • RQ2動的価格設定やオンライン広告といった実用的BwK設定では、このような対数的レジーットバウンドを確立できるか?
  • RQ3構造的仮定(例:確率的 vs 決定的リソース消費、非退化性)は、対数的レジーットの達成可能性にどのように影響するか?
  • RQ4LP緩和の最適解と有限時限BwK問題における実際のアルゴリズムのレジーットの間にはどのような関係があるか?
  • RQ5漸近的ギャップΔ∞x と相対的リソース供給量b(i) を用いて、より緊密で解釈可能なバウンドとしてレジーットバウンドを表現できるか?

主な発見

  • 提案されたアルゴリズムは、ケース1(単一の確率的リソース)において、初期供給量Bに関してO(ln(B))のオーダーのレジーットバウンドを達成し、最適なMAB性能と一致する。
  • ケース3(非退化性を満たす2つのリソース、1つが確率的)において、レジーットはO(ln(B)) × (∑_{x∈B∞|Δ∞x>0} 1/Δ∞x) でバウンドされ、Bに関して対数的である。
  • ケース4(より強い非退化性を満たす複数のリソース)において、レジーットバウンドはO(ln(B)) × (∑_{x∈B∞∩O∞^c} 1/Δ∞x) でスケーリングされ、再びBに関して対数的依存性を達成する。
  • リソース供給量の小さな摂動に対しても、レジーットバウンドはロバストである。これは、最適基底比からのずれにO(ln(B)/B)という項が現れることで示される。
  • 解析により、Bが増加するに従い、バウンドが漸近的に成り立つことが確認され、定数因子は問題の非退化性とリソース比に依存する。
  • 結果として、弱い構造的仮定のもとでBwKにおいて対数的レジーットが達成可能であることが示され、従来の分布フリーなアルゴリズムの√Tバウンドに比べて著しく改善される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。