Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning of Assignments that Maximize Submodular Functions

Daniel Golovin, Andreas Krause|ArXiv.org|Aug 5, 2009
Advanced Bandit Algorithms Research参考文献 19被引用数 6
ひとこと要約

本稿では、広告クリック収益やランク付けにおける情報多様性など、単調なサブモジュラリティを示す利得関数を最大化するためのオンライン学習アルゴリズムTGBANDITを提案する。TGBANDITは、最適な1−1/eへの近似比に収束するノーリグレット性能保証を達成し、実世界の広告配分およびブログランク付けタスクにおいて、先行手法を上回る性能を発揮する。

ABSTRACT

Which ads should we display in sponsored search in order to maximize our revenue? How should we dynamically rank information sources to maximize value of information? These applications exhibit strong diminishing returns: Selection of redundant ads and information sources decreases their marginal utility. We show that these and other problems can be formalized as repeatedly selecting an assignment of items to positions to maximize a sequence of monotone submodular functions that arrive one by one. We present an efficient algorithm for this general problem and analyze it in the no-regret model. Our algorithm possesses strong theoretical guarantees, such as a performance ratio that converges to the optimal constant of 1-1/e. We empirically evaluate our algorithm on two real-world online optimization problems on the web: ad allocation with submodular utilities, and dynamically ranking blogs to detect information cascades.

研究の動機と目的

  • 報酬の逓減性を示す利得関数を伴うオンライン割り当て問題、例えばスポンサードサーチや情報ランク付けを扱うため。
  • 分割マトロイド制約下で単調なサブモジュラリティ関数を最大化するための定数倍近似(1−1/e)を達成する効率的なアルゴリズムを開発するため。
  • 利得関数が逐次的に到着し、フィードバックがバンドイット形式の報酬に限定される動的環境において、ノーリグレットのオンライン学習アルゴリズムを設計するため。
  • 実世界のウェブアプリケーション、特にサブモジュラリティクリックスルーモデルを用いた広告配分および情報カスケードのための動的ブログランク付けにおいて、手法の実証的妥当性を検証するため。

提案手法

  • TGBANDITを提案する。これは、マルチアームドバンディットのサブルーチンを用いて、逐次的割り当て意思決定における探索と活用のバランスを取るオンラインアルゴリズムである。
  • 各ラウンドの利得関数に対して近似的に最適な割り当てを計算するため、テーブルベースのグリーディーヒューリスティック(TABULARGREEDY)をサブルーチンとして採用する。
  • 関数評価を有効(妥当)な割り当てに限定することで、離散的かつ実行可能な空間に連続的グリーディー法を適応し、不適切な集合の照会を回避する。
  • オンライン設定ではバンドイットフィードバックを用い、選択された割り当ての報酬のみが観測され、完全な利得関数は得られない。
  • 理論的ノーリグレット解析を適用し、TGBANDITの累積リグレットが非線形に増加することを示し、性能比が1−1/eに収束することを示す。
  • ユーザー行動を模擬するための新しいフィードバックモデルを導入し、検索における放棄確率とクリック確率をモデル化することで、現実的でサブモジュラリティを持つ報酬関数を再現する。

実験結果

リサーチクエスチョン

  • RQ1報酬の逓減性を示す利得関数を伴う割り当て問題において、限られたフィードバックのもとでサブモジュラリティ利得関数を最大化するオンラインアルゴリズムを設計できるか?
  • RQ2このようなアルゴリズムの理論的性能保証(リグレットと近似比)はどのように定式化できるか?
  • RQ3広告配分やブログランク付けといった実世界の応用において、先行手法と比較してアルゴリズムの性能はいかがなっているか?
  • RQ4異なるクリック確率および放棄確率を持つ多様なユーザー行動を扱えるか、かつ強力な保証を維持できるか?
  • RQ5利得関数が未知であり、部分的なフィードバックしか得られない状況でも、実際には近似的に最適な性能(1−1/e)を達成できるか?

主な発見

  • C=4のTGBANDITは、広告配分実験において約10^6ラウンド後に先行する最良手法(C=1に相当)と同等の性能を達成し、以降はそれを上回る。
  • アルゴリズムはノーリグレット性能保証を達成し、漸近的近似比が1−1/eに収束する。これはサブモジュラリティ最大化の理論的下限に一致する。
  • 実証的結果から、TGBANDITは広告配分および動的ブログランク付けタスクの両方において、既存のオンラインアルゴリズムを顕著に上回ることが示された。
  • バンドイットフィードバック下でも効果的であり、選択された割り当ての報酬のみが観測される部分的情報環境においても、高いロバスト性を示した。
  • オフラインのTABULARGREEDYアルゴリズムは、分割マトロイド制約下でサブモジュラリティ最大化に対して(1−1/e)の近似比を達成し、既知の理論的最適値と一致する。
  • 研究では、複数のユーザー型(異なるクリック確率および放棄確率)を考慮しても、オフライン問題が依然としてNP困難であることが示された。これはオンライン学習手法の必要性を強調する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。