Skip to main content
QUICK REVIEW

[논문 리뷰] Cooperative and Stochastic Multi-Player Multi-Armed Bandit: Optimal Regret With Neither Communication Nor Collisions

Sébastien Bubeck, Thomas Budzinski|arXiv (Cornell University)|2020. 11. 07.
Advanced Bandit Algorithms Research인용 수 6
한 줄 요약

이 논문은 공유된 난수를 가진 협동적 다중 플레이어 다손문 보상 문제를 위한 새로운 랜덤 전략을 제안하며, 플레이어 간의 충돌 없이 최적의 리그레트 $O(mK^{11/2}\tilde{O}(√{T\log T}))$ 를 달성한다. 이 방법은 계층적 결정 트리와 매개변수 공간의 안정적 분할을 사용하여, 의사소통이 없더라도 플레이어가 항상 같은 손을 선택하지 않도록 보장하며, 조합적 구조와 불확실성 하에서의 강건한 추정을 활용한다.

ABSTRACT

We consider the cooperative multi-player version of the stochastic multi-armed bandit problem. We study the regime where the players cannot communicate but have access to shared randomness. In prior work by the first two authors, a strategy for this regime was constructed for two players and three arms, with regret $\ ilde{O}(\\sqrt{T})$, and with no collisions at all between the players (with very high probability). In this paper we show that these properties (near-optimal regret and no collisions at all) are achievable for any number of players and arms. At a high level, the previous strategy heavily relied on a $2$-dimensional geometric intuition that was difficult to generalize in higher dimensions, while here we take a more combinatorial route to build the new strategy.

연구 동기 및 목표

  • 통신 없이도 충돌이 전혀 없는 상태에서 근사 최적의 리그레트를 달성하는 협동 다중 플레이어 다손문 보상 전략을 설계하는 것.
  • 이전 연구에서 두 플레이어와 세 손에 국한된 결과를 임의의 수의 플레이어와 손으로 일반화하는 것.
  • 통신이나 충돌 페널티가 필요 없도록, 높은 확률로 플레이어가 같은 손을 선택하지 않도록 보장함으로써 이를 제거하는 것.
  • 저차원 기하 구조를 초월하는 확장 가능한 조합적 전략을 개발하는 것.

제안 방법

  • 결정되지 않은 손에 대한 결정 트리 기반으로 시간에 따라 변하는 색상이 부여된 $[0,1]^K$ 매개변수 공간의 분할을 사용한다.
  • 각 분할 요소는 $m$개의 손으로 구성된 추천 조합을 나타내며, 트리의 인접한 노드 간에 충돌이 발생하지 않도록 색상이 할당된다.
  • 안정성 성질은 근접한 경험적 추정치가 인접한 분할 요소로 이어지게 하여 충돌 없는 행동을 유지한다.
  • 알고리즘은 confidence interval과 $\varepsilon_t$-의존적 인터페이스를 통한 임계값 처리를 통해 추정치를 동적으로 정밀화한다.
  • 핵심 기술적 혁신은 분할 결과에 영향을 주지 않으면서 고오차 좌표를 수정하는 수정된 확률 추정치 $\widetilde{q}_t^X$ 의 사용이다.
  • 리그레트 분석은 수정된 추정치를 가진 '도용 전략'을 활용하여 편차를 제한하고 최종 리그레트 bound를 유도한다.

실험 결과

연구 질문

  • RQ1통신 없이도 협동 다중 플레이어 다손문 보상 문제에서 최적의 리그레트를 달성할 수 있는가?
  • RQ2이전 연구에서 두 플레이어와 세 손에 국한된 전략을 임의의 수의 플레이어와 손으로 일반화할 수 있는가?
  • RQ3충돌 없는 행동 선택을 보장하기 위해 기하 구조를 초월하는 조합적 트리 기반 분할 기법을 사용할 수 있는가?
  • RQ4공유된 난수를 활용하여 통신 없이도 리그레트의 비최적성 없이 플레이어를 조율할 수 있는가?

주요 결과

  • 제안된 전략은 기대 리그레트가 $O(mK^{11/2}\tilde{O}(√{T\log T}))$ 이하로 제한되며, 로그 인자 외에는 최적의 단일 플레이어 리그레트와 일치한다.
  • 확률 적으로 $1 - 1/T$ 이상의 확률로, 전체 시간 범위 $T$ 동안 플레이어 간에 충돌이 전혀 발생하지 않는다. 통신 없이도 가능하다.
  • 전략은 계층적 결정 트리와 매개변수 공간의 안정적 분할을 기반으로 하여, 근접한 추정치가 충돌하지 않는 행동으로 이어지도록 보장한다.
  • 수정된 확률 추정치 $\widetilde{q}_t^X$ 의 사용은 분할 결과에 영향을 주지 않으면서 추정 오차를 수정할 수 있도록 한다.
  • 실제 전략이 수정된 추정치를 가진 '도용 전략'과 동일하게 행동함을 보여줌으로써, 깔끔한 분석이 가능해지며, 리그레트 bound 가 도출된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.