Skip to main content
QUICK REVIEW

[論文レビュー] Time-Sensitive Bandit Learning and Satisficing Thompson Sampling

Daniel Russo, David Tse|arXiv (Cornell University)|Apr 28, 2017
Advanced Bandit Algorithms Research参考文献 6被引用数 6
ひとこと要約

本稿では、累積的リグレットではなく割引リグレットを最適化することにより、最適な行動を特定するコストが高い状況でも、近似的に最適な行動への収束を迅速化できる時間に敏感なバンディットアルゴリズムである満足的トマソンサンプリング(STS)を導入する。本稿では、レート歪み理論を用いた情報理論的リグレット境界を新たに確立し、限られたホライズンと優れた非最適行動が存在する状況において、標準的トマソンサンプリングやUCBよりも著しく優れた性能を示す。

ABSTRACT

The literature on bandit learning and regret analysis has focused on contexts where the goal is to converge on an optimal action in a manner that limits exploration costs. One shortcoming imposed by this orientation is that it does not treat time preference in a coherent manner. Time preference plays an important role when the optimal action is costly to learn relative to near-optimal actions. This limitation has not only restricted the relevance of theoretical results but has also influenced the design of algorithms. Indeed, popular approaches such as Thompson sampling and UCB can fare poorly in such situations. In this paper, we consider discounted rather than cumulative regret, where a discount factor encodes time preference. We propose satisficing Thompson sampling -- a variation of Thompson sampling -- and establish a strong discounted regret bound for this new algorithm.

研究の動機と目的

  • 短いホライズンかつ高い不確実性を伴う状況において、標準的バンディットアルゴリズムが時間的優先順位や初期性能を十分に重視できないという限界に対処する。
  • 最適行動の特定が非最適だが高いパフォーマンスを示す行動よりもコストが高くなる状況において、トマソンサンプリングやUCBの非効率性を克服する。
  • 時間的優先順位と部分的情報の両方を考慮した、割引リグレットを分析する理論的枠組みを構築する。
  • 最適な行動ではなく、近似的に最適な行動に焦点を当てることで初期パフォーマンスを向上させる、変更されたトマソンサンプリングアルゴリズムを提案する。
  • 満足的行動の特定における情報の価値を定量化するため、レート歪み理論を用いたリグレット境界を確立する。

提案手法

  • 最適性に近いε-最適の閾値からの距離に基づいて行動をサンプリングする、トマソンサンプリングの変種として満足的トマソンサンプリング(STS)を提案する。
  • 時間的優先順位をモデル化するため、α ∈ (0,1) の割引係数を用い、期待される割引リグレットの最小化という問題に定式化する。
  • 情報比のバインドにレート歪み理論を適用し、十分に良い行動を特定できる能力と情報の価値を結びつける。
  • ベンチマーク行動Âを、最初にサンプリングされたε-最適行動と定義し、そのエントロピーH(Â|ξ)を不確実性と情報量の増加を定量化するために用いる。
  • 情報比Γ(Â, {At})を用いて一般リグレット境界を導出する。この情報比は、情報の獲得とリグレットのトレードオフを測る。
  • 無限腕バンディットの2つの変種(決定的報酬とノイズあり観測)に一般境界を適用し、明示的なリグレット表現を導出する。

実験結果

リサーチクエスチョン

  • RQ1バンディットアルゴリズムは、漸近的最適性ではなく、初期パフォーマンスと時間的優先順位を重視するように再設計可能か?
  • RQ2最適行動の特定が困難または高コストである場合、トマソンサンプリングの理論的パフォーマンスはどのように変化するか?
  • RQ3レート歪み理論を用いることで、近似的に最適な行動の特定における情報の価値を反映したリグレットのバインドが可能か?
  • RQ4限られたホライズン条件下で、満足的トマソンサンプリングは標準的トマソンサンプリングやUCBと比較して、割引リグレットの観点でどのように性能を示すか?
  • RQ5事前知識と観測ノイズの影響は、最適なパフォーマンスではなく満足的パフォーマンスを求めるアルゴリズムのリグレットにどのような影響を与えるか?

主な発見

  • 決定的無限腕バンディットでは、ε = √((1−α)/2) のとき、STSは割引リグレット境界√(2/(1−α)) を達成し、時間割引の下で優れた性能を示す。
  • 行動がε-最適である確率がδである事前確率を持つノイズあり無限腕バンディットでは、STSはリグレット境界を Õ(ε/(1−α) + √(1/(δ(1−α²)))) に抑え、事前知識に応じたスケーラビリティを示す。
  • リグレット境界は、最初に特定されたε-最適行動のエントロピーH(Â|ξ)に比例し、満足的行動の学習における不確実性を捉える。
  • 最適行動の学習コストが高い状況では、STSはシミュレーションにおいて標準的トマソンサンプリングやUCBを著しく上回り、特に初期段階で顕著な性能向上を示す。
  • レート歪み理論を用いた情報理論的枠組みは、時間に敏感な意思決定と誤差ありデータ圧縮の間の原理的で整合性のある関係を提供し、よりタイトなリグレット境界を可能にする。
  • 一般リグレット境界は、決定的およびノイズあり観測モデルの両方で有効であり、それぞれについて明示的な表現が導出された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。