Skip to main content
QUICK REVIEW

[논문 리뷰] Near-Optimal Collaborative Learning in Bandits

Clémence Réda, Sattar Vakili|arXiv (Cornell University)|2022. 05. 31.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 가중치가 부여된 다중 에이전트 밴딧 환경에서 협업적 최적 암 선택을 위한 근사 최적 알고리즘을 제안한다. 여기서 각 에이전트는 모든 에이전트의 로컬 보상에 대한 가중 평균으로 정의된 기대 혼합 보상이 가장 높은 암을 찾고자 한다. 이 방법은 표본 복잡도를 최소화하면서도 낮은 통신 비용을 유지를 하기 위해 데이터에 의존하는 샘플링 전략을 사용하는 단계적 제거 기법을 활용하며, 로그 인자 수준까지 근사 최적 성능를 달성한다.

ABSTRACT

This paper introduces a general multi-agent bandit model in which each agent is facing a finite set of arms and may communicate with other agents through a central controller in order to identify, in pure exploration, or play, in regret minimization, its optimal arm. The twist is that the optimal arm for each agent is the arm with largest expected mixed reward, where the mixed reward of an arm is a weighted sum of the rewards of this arm for all agents. This makes communication between agents often necessary. This general setting allows to recover and extend several recent models for collaborative bandit learning, including the recently proposed federated learning with personalization (Shi et al., 2021). In this paper, we provide new lower bounds on the sample complexity of pure exploration and on the regret. We then propose a near-optimal algorithm for pure exploration. This algorithm is based on phased elimination with two novel ingredients: a data-dependent sampling scheme within each phase, aimed at matching a relaxation of the lower bound.

연구 동기 및 목표

  • 공동 최적 암 선택 문제를 다루며, 에이전트들이 공유된 가중 혼합 보상 함수를 최적화하는 다중 에이전트 밴딧 프레임워크에서의 응용을 다룬다.
  • 순순수 탐색에서 표본 복잡도를 최소화하면서도 에이전트 간의 낮은 통신 비용을 유지하는 것을 목표로 한다.
  • 개인화 및 협업 밴딧 학습을 통합한 최근의 모델들, 예를 들어 연합된 다항 밴딧 모델을 일반화하고 확장한다.
  • 협업 설정에 대한 표본 복잡도와 손실에 대한 새로운 이론적 하한을 유도한다.
  • 이론적 하한과 渐近적으로 일치하는 근사 최적 알고리즘을 설계하고 평가한다.

제안 방법

  • 알려진 가중치 행렬 W에 의해 정의된, 각 에이전트의 보상이 모든 에이전트의 로컬 보상에 대한 볼록 조합인 가중 협업 밴딧 모델을 도입한다.
  • 기대 혼합 보상 간 격차의 추정치에 기반해 표본을 동적으로 할당하는 단계적 제거 알고리즘(W-CPE-BAI)을 제안한다.
  • 표본 복잡도의 탐색 이론 하한의 완화된 형태와 일치하는 단계 내의 데이터 기반 샘플링 전략을 통합한다.
  • 이deal 샘플링 할당을 계산하기 위해 최적화 기반 오라클을 사용하며, 알고리즘 성능의 기준이 되는 기준선을 제공한다.
  • 중앙 제어자를 통해 통신을 조율하여, 에이전트들이 경험적 평균을 공유하고 혼합 보상의 추정을 향상시킬 수 있도록 한다.
  • 오라클 계산에서 기저 최적화 문제를 해결하기 위해 CVXPY와 MOSEK를 사용하며, 수치적 안정성 검사를 수행한다.

실험 결과

연구 질문

  • RQ1가중 혼합 보상 모델 하에서 협업적 최적 암 선택의 기본 표본 복잡도 한계는 무엇인가?
  • RQ2에이전트들은 어떻게 탐색 비용을 최소화하면서도 최적의 암을 고신뢰도로 식별할 수 있는가?
  • RQ3통신 효율적인 알고리즘이 로그 인자 수준까지 표본 복잡도에서 근사 최적성을 달성할 수 있는가?
  • RQ4개인화(가중치 행렬 W를 통한)는 탐색과 통신 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5신뢰 수준 δ가 0에 수렴함에 따라 알고리즘 성능의 스케일링 행동은 어떻게 되는가?

주요 결과

  • 제안된 W-CPE-BAI 알고리즘은 개인화가 증가함에 따라 PF-UCB-BAI 기준선 대비 통신 비용을 크게 감소시킨다 (α → 1).
  • α = 0.7일 때, W-CPE-BAI는 10회의 통신 라운드를 사용하지만 PF-UCB-BAI 역시 10회를 사용하지만, 탐색 비용은 45,765(15% 감소)로 PF-UCB-BAI의 55,812보다 낮다.
  • 실제 탐색 비용과 이론적 하한(c*/T*)의 비율은 δ = 0.1일 때 68.0에서 δ = 0.00001일 때 11.9로 감소하여, 강한 渐近적 스케일링을 나타낸다.
  • 알고리즘이 표본 복잡도에서 근사 최적성을 달성하며, δ → 0일 때 c*/T* 비율이 감소함으로써 이론적 상한과 일치한다.
  • Δ′_min가 너무 작을 경우 오라클 계산에서 수치적 불안정성이 발생하여, 어려운 경우에 대해 강건한 온라인 최적화가 필요함을 시사한다.
  • 모든 알고리즘이 다섯 번째 소수 자리까지 오차율 δ̂ = 0을 달성하여 최적의 암을 식별하는 데 있어 높은 신뢰성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.