Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Optimize Via Posterior Sampling

Daniel Russo, Benjamin Van Roy|arXiv (Cornell University)|Jan 11, 2013
Advanced Bandit Algorithms Research参考文献 31被引用数 15
ひとこと要約

本稿では、相関する腕を伴うオンライン最適化、特にマルチアームバンディット問題において、探索と活用のバランスを取る手法として事後サンプリング(トムソンサンプリング)を提案する。本稿は、事後サンプリングとUCBアルゴリズムの理論的関連性を確立し、新たな概念であるエルーダー次元を用いて一般化されたベイジアンレグレットバウンドを導出する。このバウンドは、線形モデルおよび一般化線形モデルにおいて、既存のバウンドと同等またはそれを上回る性能を示す。

ABSTRACT

This paper considers the use of a simple posterior sampling algorithm to balance between exploration and exploitation when learning to optimize actions such as in multi-armed bandit problems. The algorithm, also known as Thompson Sampling, offers significant advantages over the popular upper confidence bound (UCB) approach, and can be applied to problems with finite or infinite action spaces and complicated relationships among action rewards. We make two theoretical contributions. The first establishes a connection between posterior sampling and UCB algorithms. This result lets us convert regret bounds developed for UCB algorithms into Bayesian regret bounds for posterior sampling. Our second theoretical contribution is a Bayesian regret bound for posterior sampling that applies broadly and can be specialized to many model classes. This bound depends on a new notion we refer to as the eluder dimension, which measures the degree of dependence among action rewards. Compared to UCB algorithm Bayesian regret bounds for specific model classes, our general bound matches the best available for linear models and is stronger than the best available for generalized linear models. Further, our analysis provides insight into performance advantages of posterior sampling, which are highlighted through simulation results that demonstrate performance surpassing recently proposed UCB algorithms.

研究の動機と目的

  • 相関する報酬を持つ不確実性下でのオンライン最適化のための理論的裏付けが強く、実用的なアルゴリズムの開発。
  • 自信集合の設計が複雑で計算コストが高く、限界があるUCBアルゴリズムの問題点を解消すること。
  • 多様なモデルクラスに適用可能な、一般化されたベイジアンレグレットバウンドの提供。
  • エルーダー次元という概念を導入・形式化し、行動間の報酬依存性の尺度として定式化すること。
  • 理論的考察とシミュレーションを通じて、事後サンプリングが最先端のUCBアルゴリズムを上回る優れた性能を示すこと。

提案手法

  • 本稿は、報酬関数の事後分布からのサンプルを用いて、各行動が最適である確率に基づいて行動を選択する事後サンプリングアルゴリズムを導入する。
  • 任意の信頼区間の系列を用いることで、事後サンプリングのベイジアンレグレットをバウンディングできることを示し、これにより事後サンプリングとUCBの理論的関連性を確立する。
  • 本手法は、関数クラスの複雑さを測る指標としてエルーダー次元を導入し、行動報酬間の依存度を定量化する。
  • 線形モデルや一般化線形モデルなどの特定のモデルに対しては、設計行列および逆共分散行列の成長を分析することで、明示的なレグレットバウンドを導出する。
  • 行列式補題および固有値のバウンディングを用いて情報行列の成長を制御し、有限時間のレグレットバウンドを可能にする。
  • これらの技術を応用して、非最適行動が選択される回数のバウンドを導出し、多くの場合で対数的レグレットが得られることを示す。

実験結果

リサーチクエスチョン

  • RQ1事後サンプリングは、相関する腕を伴うオンライン最適化において、強力な理論的性能保証を達成できるか?
  • RQ2エルーダー次元がベイジアン最適化における関数クラスの複雑さをどのように特徴づけるか?
  • RQ3事後サンプリングとUCBの関連性を形式化することで、既存のUCBレグレットバウンドをベイジアン設定に適用可能か?
  • RQ4特に高次元または複雑なモデルにおいて、実用的に最新のUCBアルゴリズムを上回る性能を事後サンプリングが発揮するか?

主な発見

  • 事後サンプリングのベイジアンレグレットは、任意の信頼区間の系列によってバウンディング可能であり、UCBアルゴリズムとの直接的な理論的関連性を確立する。
  • 一般レグレットバウンドはエルーダー次元に依存し、行動報酬間の依存構造を測る指標として機能する。
  • 線形モデルでは、このバウンドは既存の最良のUCBベースのベイジアンレグレットバウンドと一致し、強力な理論的性能を裏付ける。
  • 一般化線形モデルでは、このバウンドは既存の最良のUCBベースのベイジアンレグレットバウンドを上回り、性能優位性を示す。
  • シミュレーション結果から、累積レグレットの観点で、事後サンプリングが最近提案されたUCBアルゴリズムを一貫して上回ることが示された。
  • 非最適行動が選択される回数は、エルーダー次元および問題パラメータの関数としてバウンディング可能であり、多くの設定で対数的レグレットが得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。