Skip to main content
QUICK REVIEW

[論文レビュー] Linear Contextual Bandits with Global Constraints and Objective

Shipra Agrawal, Nikhil R. Devanur|arXiv (Cornell University)|Jul 24, 2015
Advanced Bandit Algorithms Research参考文献 36被引用数 8
ひとこと要約

本論文は、グローバルな凸制約と凹目的関数を伴う線形文脈的バンディット問題のための新しいフレームワークを導入し、古典的なバンディット問題を一般化する。オンライン凸最適化と双対に基づく学習を活用することで、任意の文脈-結果マッピングを仮定する非構造的アプローチよりも顕著に性能を向上させる、近似的に最適なリグレットバウンドを達成するアルゴリズムを提案する。

ABSTRACT

We consider the linear contextual bandit problem with global convex constraints and a concave objective function. In each round, the outcome of pulling an arm is a vector, that depends linearly on the context of that arm. The global constraints require the average of these vectors to lie in a certain convex set. The objective is a concave function of this average vector. This problem turns out to be a common generalization of classic linear contextual bandits (linContextual) [Auer 2003], bandits with concave rewards and convex knapsacks (BwCR) [Agrawal, Devanur 2014], and the online stochastic convex programming (OSCP) problem [Agrawal, Devanur 2015]. We present algorithms with near-optimal regret bounds for this problem. Our bounds compare favorably to results on the unstructured version of the problem [Agrawal et al. 2015, Badanidiyuru et al. 2014] where the relation between the contexts and the outcomes could be arbitrary, but the algorithm only competes against a fixed set of policies.

研究の動機と目的

  • アームの結果が文脈に対して線形であり、平均結果にグローバルな凸制約が課された文脈的バンディット問題に直面する課題に対処すること。
  • これらの制約の下で、ラウンド全体にわたる平均結果ベクトル上の凹目的関数を最適化すること。
  • linContextual、BwCR、OSCPといった既存のモデルを統一的なフレームワークに一般化すること。
  • この制約付き、凹目的関数最適化の文脈で、証明可能な近似的に最適なリグレットを達成するアルゴリズムを開発すること。
  • 任意の文脈-結果関係を仮定する非構造的バンディットアプローチよりも優れた性能を発揮すること。

提案手法

  • 線形結果と平均結果における凸制約を伴うオンライン確率的凸計画問題として問題を定式化する。
  • グローバルな凸制約を時間経過とともに維持するため、双対変数を管理する双対に基づく学習を用いる。
  • 探索と活用のバランスを保ちながら制約を尊重するため、オンライン凸最適化技術を適用する。
  • 凹目的関数と制約集合の幾何構造の両方を考慮したリグレット解析を統合する。
  • 線形結果の構造を活用することで、非構造的手法よりもタイトなリグレットバウンドを導出する。
  • 文脈、双対変数、目的関数の勾配に基づいて動的にアーム選択を更新するポリシー更新ルールを設計する。

実験結果

リサーチクエスチョン

  • RQ1平均結果にグローバルな凸制約を課す線形文脈的バンディットをどのように拡張できるか?
  • RQ2凹報酬を最大化するのと凸制約を満たすのとの間で、最適なトレードオフは何か?
  • RQ3文脈-結果マッピングが線形であっても、この制約付き設定で近似的に最適なリグレットを達成できるか?
  • RQ4提案手法は、任意の文脈-結果依存関係を仮定する非構造的バンディットアルゴリズムと比べてどのように異なるか?
  • RQ5この一般化されたフレームワークにおいて、リグレットと制約満たしの理論的保証はどのようなものか?

主な発見

  • 提案されたアルゴリズムは、グローバルな凸制約と凹目的関数を伴う線形文脈的バンディット問題に対して、近似的に最適なリグレットバウンドを達成する。
  • 任意の文脈-結果マッピングを仮定する非構造的バンディット手法と比較して、リグレットバウンドがよりタイトで有利である。
  • フレームワークは、linContextual、BwCR、OSCPといった先行モデルを効果的に一般化・統合する。
  • 双対性とオンライン凸最適化の活用により、強力なリグレット性能を維持しながら効果的な制約処理が可能になる。
  • 与えられた制約と目的関数の下で、最適ポリシーへの収束が証明可能である。
  • リグレットと制約満たしの両面で、従来の非構造的アルゴリズムを上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。