Skip to main content
QUICK REVIEW

[論文レビュー] Safe Linear Thompson Sampling.

Ahmadreza Moradipari, Sanae Amani|arXiv (Cornell University)|Nov 6, 2019
Advanced Bandit Algorithms Research被引用数 8
ひとこと要約

本稿では、各ラウンドで満たされなければならない線形安全制約の下で、確率的線形バンディットに対して安全な線形トムソンサンプリングアルゴリズムを提案する。トムソンサンプリングの内生的探索を活用することで、頻度的レグレットは $\mathcal{O}(d^{3/2}\log^{1/2}d \cdot T^{1/2}\log^{3/2}T)$ に抑えられ、安全制約なしの標準的線形TSと同等の最先端の性能を達成する。

ABSTRACT

The design and performance analysis of bandit algorithms in the presence of stage-wise safety or reliability constraints has recently garnered significant interest. In this work, we consider the linear stochastic bandit problem under additional extit{linear safety constraints} that need to be satisfied at each round. We provide a new safe algorithm based on linear Thompson Sampling (TS) for this problem and show a frequentist regret of order $\mathcal{O} (d^{3/2}\log^{1/2}d \cdot T^{1/2}\log^{3/2}T)$, which remarkably matches the results provided by [Abeille et al., 2017] for the standard linear TS algorithm in the absence of safety constraints. We compare the performance of our algorithm with a UCB-based safe algorithm and highlight how the inherently randomized nature of TS leads to a superior performance in expanding the set of safe actions the algorithm has access to at each round.

研究の動機と目的

  • 安全制約を満たしつつ、線形確率的バンディットにおけるレグレット性能を維持する挑戦に取り組む。
  • 各ラウンドで線形安全制約を満たすトムソンサンプリングに基づくアルゴリズムを設計する。
  • 安全制約のない標準的線形TSと同等のレグレットバウンドを達成する。
  • トムソンサンプリングの確率的探索が、UCBベースの安全アルゴリズムにおける決定的探索を上回ることを示す。

提案手法

  • アルゴリズムは、線形安全制約を事後分布のサンプリングプロセスに組み込むことで、線形トムソンサンプリングを拡張する。
  • 各ラウンドにおいて、観測された報酬と安全制約の両方に条件付けられたパラメータの事後分布から行動がサンプリングされる。
  • 安全制約は、すべての候補行動に対して満たされなければならない線形不等式としてモデル化される。
  • パラメータベクトルの信頼楕円体を維持することで、境界付きの不確実性内での安全な探索が保証される。
  • 制約付きサンプリングに特化した濃度不等式とマルティングルールの議論を用いて、レグレット解析が行われる。
  • 制約に配慮した事後分布サンプリングにより、すべての選択された行動が各ラウンドで保証的に安全であることが保証される。

実験結果

リサーチクエスチョン

  • RQ1トムソンサンプリングは、線形バンディットにおける線形安全制約を維持しつつ、レグレット性能を損なわずに適合可能か?
  • RQ2同じ制約下で、安全なトムソンサンプリングアルゴリズムのレグレットは、安全なUCBベースのアルゴリズムと比べてどうなるか?
  • RQ3トムソンサンプリングの内生的ランダムネスは、決定的探索を採用するUCBベースのアプローチと比べ、より広い範囲の安全行動を可能にするか?
  • RQ4線形安全制約下での線形バンディットアルゴリズムで達成可能な最もタイトなレグレットバウンドは何か?

主な発見

  • 提案された安全な線形トムソンサンプリングアルゴリズムは、頻度的レグレット $\mathcal{O}(d^{3/2}\log^{1/2}d \cdot T^{1/2}\log^{3/2}T)$ を達成し、安全制約なしの標準的線形TSと同等の性能を示す。
  • レグレットバウンドは行動数に依存せず、次元 $d$ とホライズン $T$ のみに依存する。
  • トムソンサンプリングの確率的サンプリングがもたらす広範な探索のおかげで、UCBベースの安全アルゴリズムを上回る性能を発揮する。
  • 時間の経過とともに、アルゴリズムがアクセス可能な安全行動の集合は、UCBベースの対応物よりも速やかに拡大する。
  • 事後分布の制約適合性を条件付けたサンプリングにより、各ラウンドで安全制約が厳密に遵守される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。