Skip to main content
QUICK REVIEW

[論文レビュー] Censored Semi-Bandits: A Framework for Resource Allocation with Censored Feedback

Arun Kumar Verma, Manjesh K. Hanawal|arXiv (Cornell University)|Sep 4, 2019
Advanced Bandit Algorithms Research被引用数 7
ひとこと要約

本稿では、損失が隠れ閾値に基づいて遮断される、逐次的リソース割り当てのための新しいフレームワークである「遮断付きセミバンディット(Censored Semi-Bandits, CSB)」を提案する。損失は、リソース割り当てが閾値未満の場合にのみ観測される。著者らは、この問題が複数プレイ型マルチアームバンディット(MP-MAB)および組合せセミバンディットと等価であることを確立し、既存のアルゴリズムを適応することで最適なリグレット保証を得られる。実験的評価により、リグレットの成長が非線形的であることが示された。

ABSTRACT

In this paper, we study censored Semi-Bandits, a novel variant of the semi-bandits problem. The learner is assumed to have a fixed amount of resources, which it allocates to the arms at each time step. The loss observed from an arm is random and depends on the amount of resources allocated to it. More specifically, the loss equals zero if the allocation for the arm exceeds a constant (but unknown)threshold that can be dependent on the arm. Our goal is to learn a feasible allocation that minimizes the expected loss. The problem is challenging because the loss distribution and threshold value of each arm are unknown. We study this novel setting by establishing its `equivalence' to Multiple-Play Multi-Armed Bandits(MP-MAB) and Combinatorial Semi-Bandits. Exploiting these equivalences, we derive optimal algorithms for our setting using existing algorithms for MP-MABand Combinatorial Semi-Bandits. Experiments on synthetically generated data validate performance guarantees of the proposed algorithms.

研究の動機と目的

  • 警察パトロールや密猟対策など、実世界の逐次的リソース割り当て問題において、隠れ閾値に基づいてフィードバックが遮断される状況をモデル化すること。
  • 各アーム固有の隠れ閾値に基づく行動モデルを形式化し、リソース割り当てがその閾値未満の場合にのみ損失が観測されることを定式化すること。
  • 未知の閾値および平均損失のもとで期待損失を最小化するアルゴリズムを開発し、保証付きのリグレット性能を達成すること。
  • 静的履歴データ手法とゲーム理論的モデルの間のギャップを埋めるために、扱いやすく非敵対的な学習フレームワークを導入すること。
  • varying resource and threshold conditions under synthetic experiments で提案されたアルゴリズムの性能を検証すること。

提案手法

  • K 個のアーム、Q 個の分割可能なリソース、各アームごとにベルヌーイ分布に従う損失をもつ、逐次的学習タスクとして Censored Semi-Bandit (CSB) 問題を形式化する。
  • 閾値ベースのフィードバックメカニズムを導入:アーム i に対して割り当てられたリソースが隠れ閾値 θ_i 未満の場合にのみ損失が観測される。
  • 同一の閾値をもつ CSB 問題と複数プレイ型マルチアームバンディット(MP-MAB)との等価性を確立し、MP-MAB アルゴリズムの利用が可能になる。
  • アーム依存の閾値をもつ CSB 問題と組合せセミバンディットとの等価性を確立し、組合せバンディットアルゴリズムの適応が可能になる。
  • 閾値と平均損失の推定を分離することで、効率的な学習を可能にし、両方のバリアントに対してUCBおよびトムソンサンプリングベースのアルゴリズムを用いる。
  • 理論的リグレットバウンドを導出:CSB-DTアルゴリズムにおいて、E[R_T] ≤ O(K log T / ∇_min) が成り立ち、ここで ∇_min は最適割り当てと準最適割り当てとの最小ギャップである。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、実世界の行動反応を反映する隠れ閾値に基づくフィードバック遮断が生じるリソース割り当て問題をモデル化できるか?
  • RQ2Censored Semi-Bandit(CSB)フレームワークは、MP-MAB や組合せセミバンディットといった既知のバンディット設定に正式に還元可能か?
  • RQ3未知の閾値および平均損失のもとで、CSB フレームワークにおける学習の最適リグレット保証は何か?
  • RQ4リソース量と閾値の値は、CSB におけるフィードバックの可用性と学習性能にどのように影響するか?
  • RQ5CSB 環境において、トムソンサンプリングベースのアルゴリズムはUCBベースのものよりも、経験的リグレットの観点で優れているか?

主な発見

  • 同一の閾値をもつ CSB フレームワークは、複数プレイ型マルチアームバンディット(MP-MAB)と正式に等価であり、既存の MP-MAB アルゴリズムを最適なリグレット保証とともに利用可能である。
  • アーム依存の閾値をもつ CSB フレームワークは、組合せセミバンディットと等価であり、組合せバンディットアルゴリズムを適応することで最適な性能が達成できる。
  • CSB-DT アルゴリズムの期待リグレットは、E[R_T] ≤ O(K log T / ∇_min) でバウンドされ、時間枠 T に対して非線形的成長を示すことが実証された。
  • 経験的結果から、リソース割り当てが高くなるとフィードバックが減少(セミバンディットからバンディットに移行)するため、リグレットが増加することが示され、理論的予想と整合的である。
  • 合成実験において、トムソンサンプリングベースの CSB-DT は UCB ベースの対応物(CSB-DT-UCB)を上回る経験的性能を示した。
  • このフレームワークは、閾値と平均損失の推定を分離できることを示し、効率的な学習を可能にするとともに、将来的な共同推定の基盤を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。