Skip to main content
QUICK REVIEW

[論文レビュー] Multi-objective Contextual Multi-armed Bandit Problem with a Dominant Objective.

Cem Tekin, Eralp Turğay|arXiv (Cornell University)|Aug 18, 2017
Advanced Bandit Algorithms Research参考文献 21被引用数 3
ひとこと要約

本稿では、優位な目的関数を持つ多目的バンディットフレームワーク、文脈的多腕バンディット(CMAB-DO)を紹介する。提案されたMOC-MABアルゴリズムは、優位な目的関数を最適化する腕の中で非優位な目的関数を最大化するもので、2次元およびパレート最適性の下限レギュラリティを達成し、合成および実世界のデータセットを用いた実証的検証が行われた。

ABSTRACT

In this paper, we propose a new multi-objective contextual multi-armed bandit problem with two objectives, where one of the objectives dominates the other objective. Unlike single-objective bandit problems in which the learner obtains a random scalar reward for each arm it selects, in the proposed problem, the learner obtains a random reward vector, where each component of the reward vector corresponds to one of the objectives and the distribution of the reward depends on the context that is provided to the learner at the beginning of each round. We call this problem contextual multi-armed bandit with a dominant objective (CMAB-DO). In CMAB-DO, the goal of the learner is to maximize its total reward in the non-dominant objective while ensuring that it maximizes its total reward in the dominant objective. In this case, the optimal arm given a context is the one that maximizes the expected reward in the non-dominant objective among all arms that maximize the expected reward in the dominant objective. First, we show that the optimal arm lies in the Pareto front. Then, we propose the multi-objective contextual multi-armed bandit algorithm (MOC-MAB), and define two performance measures: the 2-dimensional (2D) regret and the Pareto regret. We show that both the 2D regret and the Pareto regret of MOC-MAB are sublinear in the number of rounds. We also compare the performance of the proposed algorithm with other state-of-the-art methods in synthetic and real-world datasets. The proposed model and the algorithm have a wide range of real-world applications that involve multiple and possibly conflicting objectives ranging from wireless communication to medical diagnosis and recommender systems.

研究の動機と目的

  • 優位な目的関数を持つ文脈的バンディットにおける多目的意思決定を扱う。これは、優先順位の階層を持つ現実世界の状況を反映している。
  • 学習者が文脈に基づいて腕を選択し、2つの成分(1つは優位、もう1つは非優位)を持つベクトル報酬を受信する、新たな問題設定であるCMAB-DOを定義する。
  • 最適な腕を、与えられた文脈下で優位な目的関数を最大にするすべての腕の中で、非優位な目的関数の期待報酬を最大にするものとして形式化する。
  • 主目的関数での優位性を保証するとともに、副目的関数の最適化を達成するように、探索と活用のバランスを取るアルゴリズムを設計する。
  • 2つの新しいレギュラリティ指標、2次元レギュラリティとパレートレギュラリティを用いて性能を評価する。両指標とも、ラウンド数に対して下限であることが証明された。

提案手法

  • CMAB-DO問題は、各成分が2つの目的のいずれかに対応する報酬ベクトルをモデル化し、優位な目的関数の期待報酬が腕の可能な集合を決定する。
  • 最適な腕は、優位な目的関数の期待報酬を最大にするすべての腕の中で、非優位な目的関数の期待報酬を最大にするものとして定義される。
  • 提案されたMOC-MABアルゴリズムは、文脈依存の腕選択を実行し、両目的の信頼区間を維持して探索を誘導する。
  • 両目的の上界信頼区間を計算し、優位な目的関数で最適な腕を選択するとともに、非優位な目的関数を最大化する腕を採用する。
  • 2つの性能指標が導入される:2次元レギュラリティ(両目的における累積損失を測定)とパレートレギュラリティ(パレートフロントに対する性能を評価)。
  • 理論的分析により、MOC-MABの2次元レギュラリティおよびパレートレギュラリティが、ラウンド数に対して下限であることが証明された。

実験結果

リサーチクエスチョン

  • RQ1優位な目的関数を持つ文脈的バンディット問題を、優先順位の観点からどのように形式化できるか?
  • RQ2このような問題における最適な腕の構造は何か?また、パレートフロントとはどのように関係するか?
  • RQ3優位な目的関数の最大化を保証するとともに、非優位な目的関数の最適化を達成するアルゴリズムを設計できるか?
  • RQ4このような多目的バンディット設定の評価に適した性能指標は何か?
  • RQ5提案されたレギュラリティ指標(2次元およびパレートレギュラリティ)は、時間経過とともに下限のままであるか?

主な発見

  • CMAB-DO問題における最適な腕は、優位な目的関数を最適化する腕の中で非優位な目的関数を最大にするため、パレートフロント上に位置する。
  • MOC-MABアルゴリズムは2次元レギュラリティが下限であることを達成しており、両目的における累積損失がラウンド数に対して線形より遅く増加することを示している。
  • MOC-MABアルゴリズムはパレートレギュラリティについても下限であることを達成しており、時間の経過とともにアルゴリズムのパフォーマンスがパレート最適フロントに収束することを示している。
  • 合成および実世界のデータセットを用いた実証的評価により、MOC-MABは最先端の手法を上回り、優位な目的関数と非優位な目的関数のバランスを効果的に達成していることが示された。
  • 理論的分析により、2次元およびパレートレギュラリティの両方が下限であることが確認され、支配的制約下での多目的意思決定におけるアルゴリズムの長期的有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。