Skip to main content
QUICK REVIEW

[논문 리뷰] Cooperative Multi-Agent Bandits with Heavy Tails

Abhimanyu Dubey, Alex Pentland|arXiv (Cornell University)|2020. 08. 14.
Advanced Bandit Algorithms Research참고 문헌 48인용 수 5
한 줄 요약

이 논문은 중앙집중식이 아닌 다중 에이전트 밴딧 알고리즘인 MP-UCB를 제안한다. 이 알고리즘은 커뮤니케이션 지연이 있는 협동 네트워크에서 무거운 尾를 가진 보상 분포를 다루기 위해 절단 평균을 통한 강건한 추정과 메시지 전달 프로토콜을 사용한다. $ (1+\varepsilon) $-무거운 尾 보상 분포 하에서 문제에 의존적인 최적의 리그레트 한계 $ O(\text{poly}(\text{polylog}(T))) $ 를 달성하며, 이는 기존의 공식화 기반 방법들이 이러한 분포에서 실패하는 것과 대비된다.

ABSTRACT

We study the heavy-tailed stochastic bandit problem in the cooperative multi-agent setting, where a group of agents interact with a common bandit problem, while communicating on a network with delays. Existing algorithms for the stochastic bandit in this setting utilize confidence intervals arising from an averaging-based communication protocol known as~ extit{running consensus}, that does not lend itself to robust estimation for heavy-tailed settings. We propose extsc{MP-UCB}, a decentralized multi-agent algorithm for the cooperative stochastic bandit that incorporates robust estimation with a message-passing protocol. We prove optimal regret bounds for extsc{MP-UCB} for several problem settings, and also demonstrate its superiority to existing methods. Furthermore, we establish the first lower bounds for the cooperative bandit problem, in addition to providing efficient algorithms for robust bandit estimation of location.

연구 동기 및 목표

  • 무거운 尾 보상 분포 하에서 협동 다중 에이전트 밴딧에 대한 강건한 알고리즘이 부족한 문제를 해결하기 위해.
  • 보상 분포의 분산이 무한대이거나 무거운 尾를 가질 경우에도 낮은 리그레트를 유지할 수 있는 탈중앙화된 알고리즘을 개발하기 위해.
  • 무거운 尾 설정 하에서 협동 다중 에이전트 밴딧에 대한 첫 번째 문제에 의존적인 하한을 설정하기 위해.
  • 기존의 공식화 기반 방법들이 $ 2 $-무거운 尾 하에서 하위 최적의 리그레트 $ O(T^{2/3}) $ 를 겪는다는 것을 입증하기 위해.
  • 기존의 $ O(\log|V|) $ 의존성에 비해 향상된 $ |V| $-최적의 리그레트 스케일링을 달성하기 위해.

제안 방법

  • MP-UCB는 네트워크의 커뮤니케이션 지연을 고려하여 에이전트 간에 국소 보상 추정치를 교환하기 위한 메시지 전달 프로토콜을 사용한다.
  • 무거운 尾 보상 분포를 다루기 위해 경험 평균 추정을 강건한 절단 평균 추정으로 대체한다.
  • 알고리즘은 $ (1+\varepsilon) $-무거운 尾 가정 하에서 유도된 강건한 추정에 기반한 UCB 스타일의 신뢰 구간을 사용한다: $ v^{1/(1+\varepsilon)} \left( \frac{2c\ln t}{N_k^{m^*}(t)} \right)^{\varepsilon/(1+\varepsilon)} $.
  • 각 에이전트는 관측한 보상의 국소 집합 $ S_k^m $ 을 유지하고, 이웃 정보를 활용하여 이웃 추정치의 최대 집계를 통해 최적의 액션을 추정한다.
  • 오래된 메시지를 제거하는 정제 메커니즘이 커뮤니케이션 효율성을 유지하고 정보 과잉을 방지한다.
  • 알고리즘은 행동 선택에 가장 최근이고 신뢰할 수 있는 추정치만을 사용함으로써 외곽치에 대한 민감도를 감소시킨다.

실험 결과

연구 질문

  • RQ1무거운 尾 보상 분포 하에서 협동 다중 에이전트 밴딧의 그룹 리그레트에 대한 기본 한계(하한)는 무엇인가?
  • RQ2탈중앙화된 알고리즘이 분산이 무한대일 경우에도 $ (1+\varepsilon) $-무거운 尾 보상 분포 하에서 최적의 리그레트 스케일링을 달성할 수 있는가?
  • RQ3공식화 기반 평균화 방법의 성능은 무거운 尾 분포 하에서 강건한 추정에 비해 어떻게 열등해지는가?
  • RQ4메시지 전달 프로토콜을 설계하여 무거운 尾 보상 분포에 강건하면서도 낮은 리그레트를 유지할 수 있는가?
  • RQ5무거운 尾 설정 하에서 협동 밴딧에서 $ |V| $-최적의 리그레트 스케일링은 달성 가능한가?

주요 결과

  • 논문은 $ (1+\varepsilon) $-무거운 尾 보상 분포 하에서 협동 다중 에이전트 밴딧에 대한 첫 번째 문제에 의존적인 하한 $ \Omega(K\Delta^{-1/\varepsilon}\ln T) $ 을 확립한다.
  • MP-UCB는 $ O\left( \alpha(\mathcal{G}_\gamma) v^{1/\varepsilon} \ln T \sum_{k:\Delta_k>0} \Delta_k^{-1/\varepsilon} \right) $ 의 그룹 리그레트 한계를 달성하며, 이는 유도된 하한과 로그 인자 외에는 일치한다.
  • 공식화 기반 방법과는 달리, MP-UCB는 경험 평균 대신 강건한 추정을 사용함으로써 $ 2 $-무거운 尾 하에서 $ O(T^{2/3}) $ 리그레트를 피한다.
  • 알고리즘은 기존의 $ O(\log|V|) $ 의존성에 비해 향상된 $ |V| $-최적의 리그레트 스케일링을 달성한다.
  • 리그레트 한계는 $ v^{1/\varepsilon} $ 에 의존하며, 이는 꼬리의 두께를 반영하고 $ \varepsilon \to 0 $ 일 때 부드럽게 악화되며, 하위 가우시안 극한과 일관된다.
  • 실험 결과는 MP-UCB가 기존의 공식화 기반 알고리즘보다 무거운 尾 환경에서 뛰어난 성능을 보임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.