Skip to main content
QUICK REVIEW

[論文レビュー] Combinatorial Multi-Objective Multi-Armed Bandit Problem

Doruk Öner, Altuğ Karakurt|arXiv (Cornell University)|Mar 11, 2018
Advanced Bandit Algorithms Research参考文献 14被引用数 3
ひとこと要約

本稿は、行動をアームの集合としてモデル化し、個々のアーム報酬の線形結合として報酬をとることで、組合せ的および多目的オンライン学習を統合する、組合せ的多目的多腕バンディット(COMO-MAB)問題を導入する。COMO-UCBと呼ばれる公平なUCBベースのアルゴリズムを提案し、$O(NL^3\log T)$のパレートレグレットを達成する。これは、多ユーザー通信およびレコメンデーションシステムにおいて、探索、活用、公平性のバランスを取ることで、既存手法を上回る性能を発揮する。

ABSTRACT

In this paper, we introduce the COmbinatorial Multi-Objective Multi-Armed Bandit (COMO-MAB) problem that captures the challenges of combinatorial and multi-objective online learning simultaneously. In this setting, the goal of the learner is to choose an action at each time, whose reward vector is a linear combination of the reward vectors of the arms in the action, to learn the set of super Pareto optimal actions, which includes the Pareto optimal actions and actions that become Pareto optimal after adding an arbitrary small positive number to their expected reward vectors. We define the Pareto regret performance metric and propose a fair learning algorithm whose Pareto regret is $O(N L^3 \log T)$, where $T$ is the time horizon, $N$ is the number of arms and $L$ is the maximum number of arms in an action. We show that COMO-MAB has a wide range of applications, including recommending bundles of items to users and network routing, and focus on a resource-allocation application for multi-user communication in the presence of multidimensional performance metrics, where we show that our algorithm outperforms existing MAB algorithms.

研究の動機と目的

  • マルチアームバンディット設定における組合せ的および多目的オンライン学習の統合フレームワークの欠如に取り組むこと。
  • 多目的な文脈における非最適行動選択による累積損失を捉えるために、パレートレグレットと呼ばれる新しい性能指標を定義すること。
  • すべての目的にわたるパフォーマンスのバランスを図るために、超パレートフロントから一様にランダムに行動を選択する公平な学習アルゴリズムを設計すること。
  • 多ユーザー通信、レコメンデーションシステム、ネットワークルーティングなどの実世界の応用において、提案されたアルゴリズムの有効性を示すこと。
  • COMO-UCBが、多目的な文脈における最先端のMABアルゴリズムと比較して、顕著に低いレグレットと高い公平性を達成することを示すこと。

提案手法

  • 行動がアームの集合であり、複数の目的にわたる個々のアーム報酬の線形結合として報酬が与えられるCOMO-MAB問題を導入する。
  • 標準的なパレートフロントに零の劣化ギャップを持つ行動が含まれない問題を解決するため、無限小の報酬増加に対してパレート最適となる行動を含む「超パレートフロント(SPF)」を定義する。
  • 各アームの報酬ベクトルの上側信頼区間を維持し、推定されたSPFから一様にランダムに行動を選択するUCBベースのアルゴリズムであるCOMO-UCBを提案する。
  • 報酬推定の乖離を制限するために多次元のホフディングの不等式を用い、レグレット解析のための多次元的劣化の概念を定義する。
  • 累積損失の tighter 界を得るために、選択された行動を最も強く支配するSPFの部分集合を用いてレグレットを評価する。
  • 新規な信頼区間と報酬ベクトル間の支配関係比較を含む、多目的レグレット解析における技術的革新を適用する。

実験結果

リサーチクエスチョン

  • RQ1複数の矛盾する性能指標を有する実世界の応用を扱うにあたり、マルチアームバンディット枠組みにおいて、組合せ的および多目的学習をどのように統合的にモデル化できるか。
  • RQ2パレートフロントに属さないが、劣化ギャップがゼロである行動を扱える、多目的組合せバンディットに適した性能指標は何か。
  • RQ3すべての目的にわたるパフォーマンスのバランスを図るために、超パレートフロントから一様にランダムにサンプリングする公平な学習アルゴリズムを設計できるか。
  • RQ4この新しいCOMO-MAB設定において、UCBベースのアルゴリズムのレグレット境界はどのようなものであり、アーム数および行動サイズとどのようにスケーリングするか。
  • RQ5実用的な多目的シナリオにおいて、提案されたCOMO-UCBアルゴリズムは、既存のMABアルゴリズムと比較して、性能および公平性の点でどのように差をつけるか。

主な発見

  • COMO-UCBは$O(NL^3\log T)$のパレートレグレットを達成する。ここで$N$はアーム数、$L$は1行動あたりの最大アーム数である。これは、多目的組合せ学習における理論的効率性を示している。
  • T = 10^5ステップの多ユーザー通信設定において、COMO-UCBは79\%の確率でパレートフロントの行動を選択し、SO-UCB1(37\%)およびPareto UCB1(48\%)を著しく上回った。
  • COMO-UCBは優れた公平性を示した。SPF内の9つの行動すべてをほぼ均等な頻度で選択したが、SO-UCB1やLLRは片方の行動を著しく好む傾向にあった。
  • シミュレーションでは、COMO-UCBのレグレットは競合他手法と比較して著しくゆっくりと増加しており、最適行動への収束が速いことが確認された。
  • ネットワークルーティングの文脈では、COMO-UCBの期待レグレットは$\mathbb{E}[\mathrm{Reg}(T)] \leq \Delta_{\max}\left(\frac{4NL^2(L+1)\log(T\sqrt[4]{2})}{\Delta_{\min}^2} + N + \frac{\pi^2}{3}NL\right)$で有界であることが示され、パス長およびネットワークサイズに応じたスケーラビリティを示している。
  • LLRが最も近いレグレット性能を示すが、COMO-UCBはレグレットおよび公平性の両面でLLRおよびPareto UCB1を上回った。これは、多目的バンディットにおいて公平性の重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。