Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic bandits with arm-dependent delays

Anne Gael Manegueu, Claire Vernade|arXiv (Cornell University)|Jun 18, 2020
Advanced Bandit Algorithms Research被引用数 12
ひとこと要約

本稿では、部分観測されたフィードバックを伴う、アームに依存する無限大で、かつ重たい尾を持つ遅延が生じる確率的バンディット問題に対して、UCBに基づくアルゴリズムであるPatientBanditsを提案する。重たい尾を持つ遅延や非一様な遅延分布下でも、標準的なバンディット問題と比較して問題依存のリグレットバウンドが定数倍の範囲内に収まる。一方で、グローバルな尾のバウンドがない場合、性能損失が避けられないことを示すミニマックスリグレットの下界を証明している。

ABSTRACT

Significant work has been recently dedicated to the stochastic delayed bandit setting because of its relevance in applications. The applicability of existing algorithms is however restricted by the fact that strong assumptions are often made on the delay distributions, such as full observability, restrictive shape constraints, or uniformity over arms. In this work, we weaken them significantly and only assume that there is a bound on the tail of the delay. In particular, we cover the important case where the delay distributions vary across arms, and the case where the delays are heavy-tailed. Addressing these difficulties, we propose a simple but efficient UCB-based algorithm called the PatientBandits. We provide both problems-dependent and problems-independent bounds on the regret as well as performance lower bounds.

研究の動機と目的

  • フィードバックが部分的に観測可能であり、アームに依存する無限大で、かつ重たい尾を持つ遅延が生じる確率的バンディット問題における学習の課題に対処すること。
  • 異なるアーム間で遅延が打ち切られる(censored)ことによるフィードバック欠落が引き起こす同定可能性の問題を克服すること。
  • 遅延の非一様性と重たい尾の影響を受けても、標準的なUCBと同程度の問題依存リグレット性能を達成できるアルゴリズムを設計すること。
  • このような遅延モデル下での学習の根本的限界を特定すること、特にミニマックスリグレットの下界を同定すること。
  • 遅延尾パラメータの不完全な事前知識に対するアルゴリズムのロバストネスを検討すること。

提案手法

  • 遅延尾の重さを調整するパラメータ $\overline{\alpha}$ を組み込んだ、UCB風のアルゴリズムであるPatientBanditsを提案。
  • 遅延と重たい尾を持つフィードバックによる不確実性を考慮した、修正された上側信頼区間を用いる。
  • 観測された遅延分布の推定に基づいて、観測を遅延ありとみなすしきい値処理機構を採用し、完全な遅延観測に依存しない。
  • 各アームの遅延分布の尾が指数 $\alpha_i$ のべき乗則で有界であるものと仮定したもとで、問題依存のリグレット解析を適用。
  • 問題独立(ミニマックス)リグレットバウンドを導出し、グローバルな尾の制御がない場合、性能損失が避けられないことを示す下界を証明。
  • 遅延尾パラメータ $\overline{\alpha}$ の誤指定が与える影響を検討することで、ロバストネスを分析。

実験結果

リサーチクエスチョン

  • RQ1遅延がアームに依存し、かつ重たい尾を持つ場合でも、標準的なバンディットと同程度の問題依存リグレットを達成できるバンディットアルゴリズムは存在するか?
  • RQ2遅延の非一様性と部分観測が、確率的バンディットにおける根本的学習限界にどのように影響するか?
  • RQ3完全な遅延観測が不要な状況でも、変動する遅延分布に適応できるUCBベースのアルゴリズムを設計することは可能か?
  • RQ4遅延の非一様性と重たい尾の分布がある場合、ミニマックスリグレットの観点で、最小限のコスト(性能損失)はどの程度か?
  • RQ5アルゴリズムの性能は、遅延尾パラメータ $\overline{\alpha}$ の選択にどれほど敏感か?

主な発見

  • PatientBanditsは、アームに依存する重たい尾を持つ遅延下でも、標準UCBのリグレットと定数倍以内の問題依存リグレットバウンドを達成する。
  • 漸近的状態においても、遅延に起因するリグレット増加が定数倍で抑えられ、近似的に最適な性能を維持する。
  • ミニマックスリグレットに関しては、下界が示され、与えられた仮定下では、標準バンディットと比較して性能損失が避けられないことが判明した。
  • 特に最良のアームの遅延が重たい尾を持つ非一様な遅延分布下では、D-UCBはバイアスにより失敗するが、PatientBanditsは最適アームを正しく特定し、非線形リグレットを達成する。
  • PatientBanditsは、遅延尾パラメータ $\overline{\alpha}$ の誤指定に対してもロバストであり、遅延分布の正確な知識がなくても実用的に適応可能である。
  • 大規模なしきい値 $m$ に対してD-UCBが長時間にわたる線形リグレットフェーズを示すことは、初期学習段階での非効率性を示しており、これに対してPatientBanditsは固定ステップ数の待機を必要とせず、優れた性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。