Skip to main content
QUICK REVIEW

[論文レビュー] Thompson Sampling for CVaR Bandits.

Dorian Baudry, Romain Gautron|arXiv (Cornell University)|Dec 10, 2020
Advanced Bandit Algorithms Research参考文献 1被引用数 4
ひとこと要約

本稿は、条件付きリスク価値(CVaR)バンディット問題における、最初のトマソンサンプリングアルゴリズムを紹介する。{α}-NPTSは有界な報酬に対して、{α}-Multinomial-TSは多項分布に対して適用可能である。CVaRレグレットに対する新しい下界を確立し、{α}-Multinomial-TSが漸近的最適性を達成することを証明した。実験的に、既存のUCB手法を上回る性能を示した。

ABSTRACT

Risk awareness is an important feature to formulate a variety of real world problems. In this paper we study a multi-arm bandit problem in which the quality of each arm is measured by the Conditional Value at Risk (CVaR) at some level {\alpha} of the reward distribution. While existing works in this setting mainly focus on Upper Confidence Bound algorithms, we introduce the first Thompson Sampling approaches for CVaR bandits. Building on a recent work by Riou and Honda (2020), we propose {\alpha}-NPTS for bounded rewards and {\alpha}-Multinomial-TS for multinomial distributions. We provide a novel lower bound on the CVaR regret which extends the concept of asymptotic optimality to CVaR bandits and prove that {\alpha}-Multinomial-TS is the first algorithm to achieve this lower bound. Finally, we demonstrate empirically the benefit of Thompson Sampling approaches over their UCB counterparts.

研究の動機と目的

  • リスクに配慮した意思決定が重要なCVaRバンディット問題において、トマソンサンプリングの手法が不足しているという問題に対処すること。
  • 新たなレグレットの下界を導出し、漸近的最適性の概念をCVaRバンディット問題に拡張すること。
  • CVaR最適化に特化した、最初のトマソンサンプリングアルゴリズムとして{α}-NPTSおよび{α}-Multinomial-TSを提案すること。
  • UCBに基づく手法と比較して、CVaRバンディット設定におけるトマソンサンプリングの優位性を実証すること。

提案手法

  • RiouとHonda(2020)の最近の理論的知見を活用し、後方分布のサンプリングを用いて、有界な報酬分布に適した{α}-NPTSを設計した。
  • 結果の確率の後方分布をモデル化することで、多項分布報酬分布に適した{α}-Multinomial-TSを開発した。
  • 漸近的最適性をリスク感受性バンディット問題に拡張するための、CVaRレグレットに対する新たな下界を導出した。
  • ベイズ更新と後方分布サンプリングを用いて、CVaR目的関数下での探索と活用のバランスを図った。
  • レベル{α}におけるCVaRがより高い腕を優先するリスクに配慮した選択ルールを採用した。
  • {α}-Multinomial-TSが導出したCVaRレグレットの下界に達することを証明し、漸近的最適性を確立した。

実験結果

リサーチクエスチョン

  • RQ1トマソンサンプリングは、性能指標としてCVaRを用いるマルチアームバンディット問題に効果的に適応可能か?
  • RQ2CVaRレグレットの理論的下界は何か? そして、その下界に到達可能なアルゴリズムは存在するか?
  • RQ3UCBに基づく手法と比較して、トマソンサンプリングの性能はCVaRバンディット問題においてどうなるか?
  • RQ4{α}-Multinomial-TSは多項分布CVaRバンディット問題において漸近的に最適か?

主な発見

  • 本稿は、CVaRレグレットに対する新たな下界を確立し、漸近的最適性の概念をリスク感受性バンディット問題に拡張した。
  • {α}-Multinomial-TSアルゴリズムは、この下界に到達することが証明され、多項分布報酬を伴うCVaRバンディット問題における、最初の漸近的最適なアルゴリズムとなった。
  • 実験結果から、トマソンサンプリング手法が、既存のUCBベースの手法よりもCVaRレグレットの観点で優れていることが示された。
  • {α}-NPTSアルゴリズムは、有界な報酬を伴うCVaRバンディット問題に対して、実用的かつ効果的な解決策を提供した。
  • 理論的および実験的結果を統合することで、リスクに配慮した逐次的意思決定において、UCB手法に代わる強力な代替手法としてトマソンサンプリングの有効性が確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。