Skip to main content
QUICK REVIEW

[논문 리뷰] Combinatorial Multi-Objective Multi-Armed Bandit Problem

Doruk Öner, Altuğ Karakurt|arXiv (Cornell University)|2018. 03. 11.
Advanced Bandit Algorithms Research참고 문헌 14인용 수 3
한 줄 요약

이 논문은 조합적이고 다목적 온라인 학습을 통합하기 위해 행동을 개별 손실 보상의 선형 조합으로서의 손실 보상으로 모델링하는 조합적 다목적 다손대기 문제(Combinatorial Multi-Objective Multi-Armed Bandit, COMO-MAB)를 소개한다. 이는 탐색, 이용 및 공정성 간의 균형을 맞추어 다중 사용자 통신 및 추천 시스템에서 기존 방법보다 뛰어난 성능을 보이는 공정한 UCB 기반 알고리즘인 COMO-UCB를 제안한다. 이 알고리즘은 $O(NL^3\log T)$의 파레토 리그레트를 달성한다.

ABSTRACT

In this paper, we introduce the COmbinatorial Multi-Objective Multi-Armed Bandit (COMO-MAB) problem that captures the challenges of combinatorial and multi-objective online learning simultaneously. In this setting, the goal of the learner is to choose an action at each time, whose reward vector is a linear combination of the reward vectors of the arms in the action, to learn the set of super Pareto optimal actions, which includes the Pareto optimal actions and actions that become Pareto optimal after adding an arbitrary small positive number to their expected reward vectors. We define the Pareto regret performance metric and propose a fair learning algorithm whose Pareto regret is $O(N L^3 \log T)$, where $T$ is the time horizon, $N$ is the number of arms and $L$ is the maximum number of arms in an action. We show that COMO-MAB has a wide range of applications, including recommending bundles of items to users and network routing, and focus on a resource-allocation application for multi-user communication in the presence of multidimensional performance metrics, where we show that our algorithm outperforms existing MAB algorithms.

연구 동기 및 목표

  • 다손대기 설정에서 조합적이고 다목적 온라인 학습을 위한 통합 프레임워크의 부족을 해결하기 위해.
  • 다목적 맥락에서 비최적 행동 선택으로 인한 누적 손실을 캡처하는 새로운 성능 지표인 파레토 리그레트를 정의하기 위해.
  • 모든 목표에 걸쳐 성능를 균형 잡기 위해 슈퍼 파레토 프론트에서 균일하게 무작위로 행동을 선택하는 공정한 학습 알고리즘을 설계하기 위해.
  • 다중 사용자 통신, 추천 시스템 및 네트워크 라우팅과 같은 실세계 응용 분야에서 제안된 알고리즘의 효과성을 입증하기 위해.
  • COMO-UCB가 다목적 설정에서 최신 기술 대비 유의미하게 낮은 리그레트와 높은 공정성을 달성하는지 보여주기 위해.

제안 방법

  • 행동가 손실 보상이 다수의 목표에 걸쳐 개별 손실 보상의 선형 조합인 조합적 다목적 다손대기(COMO-MAB) 문제를 도입한다.
  • 표준 파레토 프론트에서의 영하위최적 간격 문제를 해결하기 위해, 무한소 보상 증가 시 파레토 최적이 되는 행동을 포함하는 슈퍼 파레토 프론트(SPF)를 정의한다.
  • 각 손실 보상 벡터의 상한 신뢰 구간을 유지하고 추정된 슈퍼 파레토 프론트에서 균일하게 무작위로 행동을 선택하는 UCB 기반 알고리즘인 COMO-UCB를 제안한다.
  • 다차원 허프딩 부등식을 사용하여 보상 추정치의 편차를 제한하고, 리그레트 분석을 위한 다차원 하위최적성 개념을 정의한다.
  • 누적 손실에 대한 더 날카운 감소한 경계를 확보하기 위해, 선택된 행동를 가장 많이 지배하는 SPF의 부분집합을 사용하여 리그레트를 평가한다.
  • 새로운 신뢰 구간과 보다 높은 보상 벡터 간의 지배 비교를 포함한 다목적 리그레트 분석 기술적 혁신을 적용한다.

실험 결과

연구 질문

  • RQ1다양한 상충되는 성능 지표를 가진 실세계 응용 분야를 고려할 때, 다손대기 프레임워크 내에서 조합적이고 다목적 학습을 공동으로 모델링할 수 있는 방법은 무엇인가?
  • RQ2파레토 프론트에 속하지 않지만 하위최적 간격이 0인 행동을 고려할 수 있는 다목적 조합적 밴딧에 적합한 성능 지표는 무엇인가?
  • RQ3모든 목표에 걸쳐 성능를 균형 잡기 위해 슈퍼 파레토 프론트에서 균일하게 샘플링하는 공정한 학습 알고리즘을 설계할 수 있는가?
  • RQ4이 새로운 COMO-MAB 환경에서 UCB 기반 알고리즘의 리그레트 경계는 무엇이며, 손실 보상의 수와 행동 크기와의 스케일링 관계는 어떻게 되는가?
  • RQ5실제 다목적 시나리오에서 제안된 COMO-UCB 알고리즘이 기존 MAB 알고리즘 대비 성능과 공정성 측면에서 어떻게 비교되는가?

주요 결과

  • COMO-UCB는 $O(NL^3\log T)$의 파레토 리그레트를 달성한다. 여기서 $N$은 손실 보상의 수이고 $L$은 각 행동당 최대 손실 보상 수이다. 이는 다목적 조합적 학습의 이론적 효율성을 입증한다.
  • 시간 단위 $T = 10^5$인 다중 사용자 통신 환경에서 COMO-UCB는 파레토 프론트에서 행동을 선택하는 비율이 $79\%$로, SO-UCB1($37\%$)과 Pareto UCB1($48\%$)보다 뚜렷이 뛰어나다.
  • COMO-UCB는 공정성 측면에서 뛰어나다. SPF 내 9개의 행동을 거의 균일한 빈도로 선택하는 반면, SO-UCB1과 LLR는 특정 행동을 지나치게 선호한다.
  • 시뮬레이션 결과에 따르면 COMO-UCB의 리그레트는 경쟁자 대비 유의미하게 느리게 증가하며, 이는 최적 행동으로의 더 빠른 수렴을 확인한다.
  • 네트워크 라우팅에 적용했을 때, COMO-UCB의 기대 리그레트는 $\mathbb{E}[\mathrm{Reg}(T)] \leq \Delta_{\max}\left(\frac{4NL^2(L+1)\log(T\sqrt[4]{2})}{\Delta_{\min}^2} + N + \frac{\pi^2}{3}NL\right)$로 유계이며, 경로 길이와 네트워크 크기에 따라 스케일링 가능하다.
  • LLR와 Pareto UCB1에 비해 COMO-UCB는 리그레트와 공정성 양면에서 뛰어나다. 비록 LLR가 리그레트 측면에서 가장 유사한 경쟁자였지만, 이는 다목적 밴딧에서 공정성의 중요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.