Skip to main content
QUICK REVIEW

[論文レビュー] Multi-dueling Bandits with Dependent Arms

Yanan Sui, Vincent Zhuang|arXiv (Cornell University)|Apr 29, 2017
Advanced Bandit Algorithms Research被引用数 3
ひとこと要約

本稿では、相関するアームを有するマルチ・デュエルバンドイット問題に対して、自己スパリング(SelfSparring)アルゴリズムを提案する。この手法は、トムソンサンプリングのような確率的バンドイット手法を用いて、問題を従来のバンドイット設定に還元する一方で、ガウス過程事前分布を用いてアーム間の依存関係をモデル化する。提案手法は、特にアーム数が増加する際、最先端のデュエルバンドイット手法と比較して顕著に低いレグレットを達成し、理論的ノーレグレット保証と合成および実世界データセットにおける実証的検証を兼ね備えている。

ABSTRACT

The dueling bandits problem is an online learning framework for learning from pairwise preference feedback, and is particularly well-suited for modeling settings that elicit subjective or implicit human feedback. In this paper, we study the problem of multi-dueling bandits with dependent arms, which extends the original dueling bandits setting by simultaneously dueling multiple arms as well as modeling dependencies between arms. These extensions capture key characteristics found in many real-world applications, and allow for the opportunity to develop significantly more efficient algorithms than were possible in the original setting. We propose the \selfsparring algorithm, which reduces the multi-dueling bandits problem to a conventional bandit setting that can be solved using a stochastic bandit algorithm such as Thompson Sampling, and can naturally model dependencies using a Gaussian process prior. We present a no-regret analysis for multi-dueling setting, and demonstrate the effectiveness of our algorithm empirically on a wide range of simulation settings.

研究の動機と目的

  • 従来のデュエルバンドイット手法がペairワイズ比較に限定され、アームを独立に扱うという制限を克服し、複数のアームを同時に比較可能にする。
  • 高次元または無限の行動空間において、アーム間の依存関係を低次元のカーネル構造を用いてモデル化する。
  • マルチ・デュエルバンドイット問題を標準バンドイット問題に還元する、整合的かつ効率的なアルゴリズムを開発し、理論的レグレット保証を維持する。
  • 提案手法が、特に大規模または構造的行動空間において、既存のデュエルバンドイットアルゴリズムよりもレグレットの観点で優れていることを実証的に示す。

提案手法

  • マルチ・デュエルバンドイット問題を、各アームを確率的バンドイットフレームワーク内での選択候補として扱うことで、標準的なマルチアームバンドイット問題に還元するSelfSparringアルゴリズムを提案する。
  • アーム間の依存関係をモデル化するために、カーネル関数を用いたガウス過程事前分布を用いる。これにより、類似した行動間での効率的な一般化が可能になる。
  • 還元された問題に対してトムソンサンプリングまたは類似の確率的バンドイットアルゴリズムを適用し、探索と活用のバランスを取る。
  • アロンら(2014)のSparringにインspiredされた自己スパリングメカニズムを採用するが、元の手法とは異なり理論的ノーレグレット解析を実施する。
  • 行動空間上のPreference関数を直接ガウス過程でモデル化するカーネル化されたバージョン、KernelSelfSparringを導入する。
  • 合成実験では、二乗指数カーネルとロジットリンク関数を用いて、効用関数からPreference確率を生成する。

実験結果

リサーチクエスチョン

  • RQ1複数のアームを同時に比較可能なマルチ・デュエルバンドイットフレームワークは、ペアワイズ比較に限定された従来手法と比較して、より低いレグレットを達成できるか?
  • RQ2デュエルバンドイット設定において、アーム間の依存関係を効果的にモデル化することで、サンプル効率を向上させられるか?
  • RQ3マルチ・デュエル問題をガウス過程事前分布を用いた標準バンドイット問題に還元することで、既存のデュエルバンドイットアルゴリズムよりも優れたレグレット性能が得られるか?
  • RQ4提案手法の性能は、特に高次元または連続的行動空間において、アーム数の増加に伴いどのように変化するか?

主な発見

  • SelfSparringはマルチ・デュエル設定においてノーレグレット性能を達成しており、時間に伴いレグレットが非線形に増加する一方で、多くの先行デュエルバンドイット手法がアーム数に比例して線形に増加するのとは対照的である。
  • MSLR-30Kデータセットから抽出した16アームサブセットを用いたシミュレーションでは、SelfSparringは累積レグレットの観点でMDBアルゴリズムを顕著に上回った。
  • カーネル化された2アームデュエルおよびマルチデュエル設定において、KernelSelfSparringはBOPPERおよびGP-Sparringと比較して優れた性能を示した。特にForresterおよびSix-Hump Camelの目的関数において顕著な優位性を示した。
  • SelfSparringのレグレットはアーム数の増加に伴い著しく上昇しなかったことから、大規模な行動空間においても強力なスケーラビリティとロバストネスを示している。
  • 実証的結果から、比較対象のアーム数が増えるほど、SelfSparringの従来のデュエルバンドイット手法に対する相対的性能向上が顕著になることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。