[論文レビュー] Combinatorial Pure Exploration of Dueling Bandit
本稿では、相対的フィードバックによるデュエルから得られる情報を用いて、二部グラフにおける最良の候補-位置マッチングを同定するための新しいフレームワークである、組合せ的純粋探索(Combinatorial Pure Exploration) for デュエルベイジッツ(CPE-DB)を提案する。効率的なアルゴリズムであるCLUCB-Borda-PACおよびCAR-Condを提案し、各ラウンドの実行時間が多項式時間で、サンプル複雑度がほぼ最適となる。これは、この設定におけるコンドルセ勝者同定のための最初の多項式時間アルゴリズムである。
In this paper, we study combinatorial pure exploration for dueling bandits (CPE-DB): we have multiple candidates for multiple positions as modeled by a bipartite graph, and in each round we sample a duel of two candidates on one position and observe who wins in the duel, with the goal of finding the best candidate-position matching with high probability after multiple rounds of samples. CPE-DB is an adaptation of the original combinatorial pure exploration for multi-armed bandit (CPE-MAB) problem to the dueling bandit setting. We consider both the Borda winner and the Condorcet winner cases. For Borda winner, we establish a reduction of the problem to the original CPE-MAB setting and design PAC and exact algorithms that achieve both the sample complexity similar to that in the CPE-MAB setting (which is nearly optimal for a subclass of problems) and polynomial running time per round. For Condorcet winner, we first design a fully polynomial time approximation scheme (FPTAS) for the offline problem of finding the Condorcet winner with known winning probabilities, and then use the FPTAS as an oracle to design a novel pure exploration algorithm ${\sf CAR}$-${\sf Cond}$ with sample complexity analysis. ${\sf CAR}$-${\sf Cond}$ is the first algorithm with polynomial running time per round for identifying the Condorcet winner in CPE-DB.
研究の動機と目的
- 相対的フィードバックを伴うデュエルベイジッツに拡張された組合せ的純粋探索を形式化する新しい問題設定、CPE-DBを定式化すること。
- 最小限のデュエル回数で、Bordaおよびコンドルセ勝者基準に従う最良の候補-位置マッチングを同定する課題に取り組むこと。
- 指数的決定空間と相対的フィードバックの制約に直面しながらも、低サンプル複雑度と各ラウンドの多項式時間実行を両立するアルゴリズムを設計すること。
- 理論的サンプル複雑度の下界を確立し、CPE-DBにおけるコンドルセ勝者同定のための最初の多項式時間アルゴリズムを提供すること。
提案手法
- Borda勝者CPE-DB問題を、元のCPE-MABフレームワークに還元し、既存のアルゴリズム的ツールの利用を可能にする。
- 各ラウンドで多項式時間で計算が可能で、タイトなサンプル複雑度の下限を達成するCLUCB-Borda-PACおよびCLUCB-Borda-Exactアルゴリズムを設計する。
- 既知の確率値を前提としたオフラインコンドルセ勝者問題に対する完全多項式時間近似スキーム(FPTAS)を構築する。
- FPTASをオракルとして用い、新しいオンラインアルゴリズムCAR-Condを構築し、各ラウンドの実行時間が多項式時間で保証されるようにする。
- 分布の摂動を用いた情報理論的下界を適用し、問題依存のサンプル複雑度下界を導出する。
- 検証ギャップ解析を用いて、サンプル複雑度の上界と下界を関連付け、上界がℓ²の要因内での近似的最適性を示す。
実験結果
リサーチクエスチョン
- RQ1CPE-DBにおけるBorda勝者は、CPE-MABとほぼ同等のサンプル複雑度で、効率的に同定可能か?
- RQ2指数的決定空間と相対的フィードバックの制約下で、CPE-DBにおけるコンドルセ勝者を同定する多項式時間アルゴリズムは存在するか?
- RQ3δ-correct保証下で、CPE-DBにおけるコンドルセ勝者の同定のための根本的サンプル複雑度の限界は何か?
- RQ4提案されたCAR-Condアルゴリズムのサンプル複雑度は、情報理論的下界とどのように比較されるか?
- RQ5オフラインコンドルセ問題に対するFPTASを活用して、効率的なオンライン純粋探索アルゴリズムを設計できるか?
主な発見
- CLUCB-Borda-PACおよびCLUCB-Borda-Exactアルゴリズムは、Borda勝者を有するCPE-DB問題のサブクラスにおいて、ほぼ最適なサンプル複雑度を達成する。
- CAR-Condアルゴリズムは、CPE-DBにおけるコンドルセ勝者同定のための、各ラウンドの実行時間が多項式時間である最初のアルゴリズムであり、重要な未解決課題を解決する。
- CAR-Condのサンプル複雑度は、情報理論的下界に対してℓ²の要因内に一致しており、近似的最適性を示している。
- Borda勝者を有するCPE-DBに対して、問題依存の下界が確立され、CLUCB-Borda-Exactがほぼ最適な性能を達成することが示された。
- オフラインコンドルセ問題に対するFPTASは、効率的なオンライン探索を可能にし、近似スキームが純粋探索設定において強力であることを示している。
- 解析により、CAR-Condにおける検証ギャップがサンプル複雑度を制御しており、上界がℓ²の要因内での下界と一致することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。