[論文レビュー] Thompson Sampling for Combinatorial Semi-bandits with Sleeping Arms and Long-Term Fairness Constraints
本稿では、スリーピングアームと長期的公平性制約を伴う組み合わせ的セミバンディット問題に対して、Thompson Samplingに基づくTSCSF-Bを提案する。ベータ事前分布と仮想キュー技術を組み合わせることで、報酬最大化と公平性のバランスを図り、問題に依存しないレギュレートバウンド $ abla{O} olimits\left(\frac{\sqrt{mNT}}{T}\right)$ を達成する。これは理論的下界と一致しており、実践的に既存のUCBベースの手法を上回る性能を発揮する。
We study the combinatorial sleeping multi-armed semi-bandit problem with long-term fairness constraints~(CSMAB-F). To address the problem, we adopt Thompson Sampling~(TS) to maximize the total rewards and use virtual queue techniques to handle the fairness constraints, and design an algorithm called \emph{TS with beta priors and Bernoulli likelihoods for CSMAB-F~(TSCSF-B)}. Further, we prove TSCSF-B can satisfy the fairness constraints, and the time-averaged regret is upper bounded by $\frac{N}{2η} + O\left(\frac{\sqrt{mNT\ln T}}{T} ight)$, where $N$ is the total number of arms, $m$ is the maximum number of arms that can be pulled simultaneously in each round~(the cardinality constraint) and $η$ is the parameter trading off fairness for rewards. By relaxing the fairness constraints (i.e., let $η ightarrow \infty$), the bound boils down to the first problem-independent bound of TS algorithms for combinatorial sleeping multi-armed semi-bandit problems. Finally, we perform numerical experiments and use a high-rating movie recommendation application to show the effectiveness and efficiency of the proposed algorithm.
研究の動機と目的
- アームが利用不可となる可能性があり、最小のプル回数が要求される長期的公平性制約を伴う組み合わせ的スリーピングマルチアームバンディット問題(CSMAB-F)に対処すること。
- 公平性制約を保証しつつ累積報酬を最大化するThompson Samplingに基づくアルゴリズムを開発すること。
- この設定におけるThompson Samplingの問題に依存しないレギュレートバウンドを導出すること。これは理論的下界と一致する。
- 数値実験と実世界の映画推薦アプリケーションを通じて、アルゴリズムの有効性を検証すること。
- TSベースの手法がUCBベースの手法よりもタイトなレギュレートバウンドを達成できることを示すこと。同時に、優れた実用的性能を維持していること。
提案手法
- アーム報酬の事後分布からのサンプリングに、ベータ事前分布とベルヌーイ尤度を用いたThompson Samplingを採用する。
- 長期的公平性制約を満たすために仮想キュー技術を統合し、キューの進化を修正することで丸め誤差を低減する。
- 公平性と報酬のトレードオフにパラメータ $\eta$ を用い、$\eta \to \infty$ の場合に公平性制約が緩和され、純粋な CSMAB 問題に帰着する。
- 1ラウンドあたりのアームプル数が $m$ で制限される制約付き最適化問題としてアーム選択を定式化する。
- 報酬観測の遅延を扱うために遅延フィードバックフレームワークを適用し、レギュレートに加法的ペナルティを追加する。
- 映画推薦実験において、5つのジャンルに対して $\mathbf{k} = [0.3, 0.3, 0.3, 0.3, 0.3]$ を設定することで、公平性制約の妥当性を保証する。
実験結果
リサーチクエスチョン
- RQ1Thompson Samplingは、スリーピングアームと長期的公平性制約を伴う組み合わせ的セミバンディット問題に効果的に適応可能か?
- RQ2CSMAB-FにおけるThompson Samplingベースのアルゴリズムの理論的レギュレートバウンドは何か? そしてUCBベースの手法と比較してどうなるか?
- RQ3提案されたアルゴリズムは、LFGのような既存の公平性を考慮したバンディットアルゴリズムよりも優れた実験的性能を発揮するか?
- RQ4公平性パラメータ $\eta$ は、報酬最大化と制約満たしのトレードオフにどのように影響を与えるか?
- RQ5レギュレートバウンドを問題に依存しない形にでき、既知のCSMAB問題の下界と一致させられるか?
主な発見
- 提案されたTSCSF-Bアルゴリズムは、時間平均のレギュレート上界として $\frac{N}{2\eta} + O\left(\frac{\sqrt{mNT\ln T}}{T}\right)$ を達成する。これは問題に依存せず、$\eta \to \infty$ の場合に理論的下界と一致する。
- UCBベースのLFGアルゴリズムと比較して、レギュレートバウンドの係数が小さいため、Thompson Samplingの理論的性能保証がよりタイトであることが示唆される。
- MovieLens 20Mデータセットを用いた数値実験では、TSCSF-BはLFGよりも真の平均に近い最終スコアを達成しており、報酬推定の精度が優れていることを示している。
- 映画推薦アプリケーションにおいて、TSCSF-BはLFGよりも収束が速く、時間平均のレギュレートが低いことから明らかである。
- TSCSF-BとLFGの両方が $\eta = \sqrt{\frac{NT}{m\ln T}}$ の下で公平性制約を満たしたが、TSCSF-Bはより高い報酬効率を維持していた。
- 公平性制約を緩和した場合($\eta \to \infty$)、レギュレートバウンドは、組み合わせ的スリーピングバンディットにおけるThompson Samplingの最初の問題に依存しないバウンドに簡略化され、Bubeckら(2012)の下界と一致する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。