[論文レビュー] Double Thompson Sampling for Dueling Bandits
本稿では、二重トムソンサンプリング(D-TS)を提案する。これは、ペアワイズ比較において両方の腕を独立してトムソンサンプリングで選択することで、効率的な探索を可能にし、劣悪な自己比較を回避する、デュエルバンドイットのための新規アルゴリズムである。D-TSは一般のコペランド・デュエルバンドイットで $O(K^2\log T)$ のレグレットを達成し、コンドルセおよび実用的コペランド設定では、このレグレットを $O(K\log T + K^2\log\log T)$ に改善する。さらに、D-TS+ と呼ばれる強化版は、より優れたタイブレーキングにより実験的性能を向上させている。
In this paper, we propose a Double Thompson Sampling (D-TS) algorithm for dueling bandit problems. As indicated by its name, D-TS selects both the first and the second candidates according to Thompson Sampling. Specifically, D-TS maintains a posterior distribution for the preference matrix, and chooses the pair of arms for comparison by sampling twice from the posterior distribution. This simple algorithm applies to general Copeland dueling bandits, including Condorcet dueling bandits as its special case. For general Copeland dueling bandits, we show that D-TS achieves $O(K^2 \log T)$ regret. For Condorcet dueling bandits, we further simplify the D-TS algorithm and show that the simplified D-TS algorithm achieves $O(K \log T + K^2 \log \log T)$ regret. Simulation results based on both synthetic and real-world data demonstrate the efficiency of the proposed D-TS algorithm.
研究の動機と目的
- 自己比較は情報を持たないため、トムソンサンプリングをデュエルバンドイットに適用する際の課題に対処すること。
- 一般のコペランド・デュエルバンドイットにおいて、好みの空間を効果的に探索できるスケーラブルでロバストなアルゴリズムを設計すること。
- 相関する腕の選択と情報のない比較の困難さを克服し、トムソンサンプリングに基づくデュエルバンドイットアルゴリズムの理論的レグレット境界を確立すること。
- D-TSにおけるタイブレーキングの改善により、実験的性能を向上させる。これにより、理論的保証を損なわず、D-TS+が得られる。
提案手法
- D-TSは、好み行列の事後分布から独立して二つのサンプル集合を抽出し、比較のための第一および第二の腕を選択する。
- アルゴリズムはRUCBおよびRLCBの信頼区間を用いて劣悪な腕を除外し、非情報的比較に陥るのを防ぐ。
- 最初の候補を固定し、他のものとの比較を標準的なMAB問題として扱うことで、D-TSは既知のTS解析技術を活用して理論的レグレット境界を導出する。
- コンドルセおよび実用的コペランド・デュエルバンドイット設定において、バック・サブスティチューションの議論を適用し、レグレット境界の対数係数を $\log T$ から $\log\log T$ に削減する。
- D-TS+は、サンプリングプロセスにおけるタイブレーキングを洗練させることでD-TSを強化し、特に複数のコペランド優勝者がある状況で実験的性能を向上させる。
- アルゴリズムは、合成データおよび実世界のデータセット(MSLRおよび巡回的好み行列)を用いて評価され、フィードバック遅延や時間枠が変化する状況下でも検証されている。
実験結果
リサーチクエスチョン
- RQ1自己比較から情報が得られないにもかかわらず、トムソンサンプリングがデュエルバンドイットに効果的に適応可能か?
- RQ2一般のコペランド・デュエルバンドイット設定において、二重サンプリング・トムソンサンプリング手法の理論的レグレット境界はどのように確立できるか?
- RQ3二重サンプリング構造は、UCB型やMED型アルゴリズムと比較して、探索効率をどのように向上させ、レグレットを低減するか?
- RQ4バック・サブスティチューションの議論により、コンドルセおよび実用的コペランド・デュエルバンドイット設定におけるレグレット境界は、標準の $O(K^2\log T)$ よりも改善可能か?
- RQ5D-TSにおける洗練されたタイブレーキング戦略は、実験的レグレットとロバスト性に顕著な改善をもたらすか?
主な発見
- D-TSは一般のコペランド・デュエルバンドイット設定で $O(K^2\log T)$ のレグレットを達成し、腕の数に応じた理論的スケーラビリティを示している。
- コンドルセ・デュエルバンドイットおよび大多数の実用的コペランド設定では、バック・サブスティチューションの議論により、レグレットが $O(K\log T + K^2\log\log T)$ に改善されている。
- D-TS+はタイブレーキングの改善により、D-TSよりも実験的性能が向上しており、特に複数のコペランド優勝者が存在する状況で顕著である。
- 実験では、CCB、ECW-RMED、RUCBといった既存のアルゴリズムと比較して、D-TSおよびD-TS+がレグレットとロバスト性の点で顕著に優れていることが示された。特にフィードバック遅延がある状況で顕著である。
- 非コンドルセ設定では、RUCB/RLCBの排除ステップがサブ線形レグレットを達成するために不可欠である。このステップを削除すると、一部のケースで線形レグレットに陥る。
- D-TSおよびD-TS+は、MSLR(コンドルセ)および巡回的好み行列(非コンドルセ)を含む多様なデータセットで、フィードバック遅延が最大300タイムスロットに達する状況でも、強力な性能を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。