Skip to main content
QUICK REVIEW

[論文レビュー] A Relative Exponential Weighing Algorithm for Adversarial Utility-based Dueling Bandits

Pratik Gajane, Tanguy Urvoy|arXiv (Cornell University)|Jan 15, 2016
Advanced Bandit Algorithms Research被引用数 10
ひとこと要約

本稿では、相対的フィードバック(例:「アームAはBより良い」)のみを扱える敵対的ユーティリティベースのデュエルバンドイット問題に対して、exp3フレームワークを拡張して相対的フィードバックに対応する新しい指数重み付けアルゴリズム rex3 を提案する。有限時間の期待リグレットバウンドとして $\mathcal{O}(\sqrt{K\ln K\,T})$ を達成し、古典的な exp3 のバウンドと一致する。また、$\Omega(\sqrt{KT})$ の下界を確立し、敵対的設定における最適性を裏付ける。情報検索データを用いた実験により、特に初期段階で優れた性能を示すことが確認された。

ABSTRACT

We study the K-armed dueling bandit problem which is a variation of the classical Multi-Armed Bandit (MAB) problem in which the learner receives only relative feedback about the selected pairs of arms. We propose a new algorithm called Relative Exponential-weight algorithm for Exploration and Exploitation (REX3) to handle the adversarial utility-based formulation of this problem. This algorithm is a non-trivial extension of the Exponential-weight algorithm for Exploration and Exploitation (EXP3) algorithm. We prove a finite time expected regret upper bound of order O(sqrt(K ln(K)T)) for this algorithm and a general lower bound of order omega(sqrt(KT)). At the end, we provide experimental results using real data from information retrieval applications.

研究の動機と目的

  • 相対的フィードバック(例:「アームAはBより良い」)のみが利用可能な敵対的ユーティリティベースのデュエルバンドイット問題における学習の課題に取り組むこと。
  • 確率的報酬分布の仮定をせず、探索と活用のバランスを取れる効率的なアルゴリズムを設計すること。
  • 敵対的デュエルバンドイット問題に対して、上界と下界を含むタイトな理論的リグレットバウンドを確立すること。
  • 実世界の情報検索データセットを用いて、アルゴリズムの性能を実証的に検証すること。特に、探索が重要な初期段階での性能を重視する。

提案手法

  • 相対的フィードバックに特化したデュエルバンドイット問題に適した、exp3アルゴリズムの非自明な拡張として、rex3を提案する。
  • 相対的パフォーマンスに基づいて重みを更新できるように、インスタントリャスリグレット推定子 $\hat{c}_i(t)$ を使用し、負の推定値も許容する。
  • 探索と活用のバランスをとるために、パrameter $\gamma$ を用いた指数重み付けを採用。アームイズバージョンでは $\gamma$ を適応的に変更する。
  • 対数的合計とテイルバウンドを用いるexp3と類似した証明構造を採用するが、相対的フィードバックとリグレット推定に適応させる。
  • Ailonら(2014)の議論を基に、$\Omega(\sqrt{KT})$ をこの問題の根本的限界として確立する新しい下界の議論を導入する。
  • 時間枠 $T$ の事前知識がなくても動作するように、ダブリングトリックと適応的 $\gamma$ を用いて rex3 を anytime 版に拡張する。

実験結果

リサーチクエスチョン

  • RQ1相対的フィードバックのみが利用可能な敵対的デュエルバンドイット設定において、指数重み付けアルゴリズムを効果的に適応できるか。
  • RQ2敵対的ユーティリティベースのデュエルバンドイット問題において、達成可能な最もタイトな有限時間リグレットバウンドは何か。
  • RQ3rex3 の性能は、敵対的環境およびステーショナリ環境の両方で、最先端のアルゴリズムと比べてどうか。
  • RQ4探索が特に重要な初期学習段階でも、rex3 は高い性能を維持できるか。

主な発見

  • rex3 は有限時間の期待リグレット上界として $\mathcal{O}(\sqrt{K\ln K\,T})$ を達成し、古典的な exp3 のバウンドと一致する。
  • 本稿では、敵対的ユーティリティベースのデュエルバンドイット問題における任意のアルゴリズムに対して、一般の下界 $\Omega(\sqrt{KT})$ を確立し、上界のタイトさを裏付けた。
  • 適応的 $\gamma$ を用いた anytime バージョンの rex3 は、特に小さな時間枠や多くのアームが存在する状況において、初期段階の学習段階で最先端のアルゴリズムを上回る性能を示した。
  • MSLR30k および他の情報検索データセットを用いた実験結果から、rex3 は非常に競争力があり、ステーショナリ環境でもステーショナリ設定のアルゴリズムを凌駕することがわかった。
  • rex3 のリグレットバウンドは、一般の部分監視アルゴリズムの $\tilde{\mathcal{O}}(K\sqrt{T})$ のバウンドを改善しており、$K$ に関する対数因子を除去することで厳密に向上している。
  • 理論的分析により、rex3 が敵対的設定において最適であることが確認され、定数因子の差を除いて、上界と下界が一致している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。