Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Multi-Armed Bandits with Limited Communication

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|2021. 02. 10.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 16
한 줄 요약

이 논문은 제한된 통신 환경에서 누적 손실을 최소화하는 다중 에이전트 다수의 손잡이 밴딧 알고리즘인 LCC-UCB와 LCC-UCB-GRAPH를 제안한다. 에이전트들은 배율 시간 간격 동안 협력하며, 오직 최고의 암 인덱스만(크기 O(log K) 비트) 공유한다. 이로 인해 각각 Õ(√((K/N + N)T)) 및 Õ(D√((K/N + K_G)DT))의 손실을 달성하며, 중앙집중식 및 이웃 전용 통신 전략보다 낮은 통신 부하로도 슈퍼어게인트 이론 하한 Õ(√(KT/N))에 근접한 성능을 보인다.

ABSTRACT

We consider the problem where $N$ agents collaboratively interact with an instance of a stochastic $K$ arm bandit problem for $K \gg N$. The agents aim to simultaneously minimize the cumulative regret over all the agents for a total of $T$ time steps, the number of communication rounds, and the number of bits in each communication round. We present Limited Communication Collaboration - Upper Confidence Bound (LCC-UCB), a doubling-epoch based algorithm where each agent communicates only after the end of the epoch and shares the index of the best arm it knows. With our algorithm, LCC-UCB, each agent enjoys a regret of $ ilde{O}\left(\sqrt{({K/N}+ N)T} ight)$, communicates for $O(\log T)$ steps and broadcasts $O(\log K)$ bits in each communication step. We extend the work to sparse graphs with maximum degree $K_G$, and diameter $D$ and propose LCC-UCB-GRAPH which enjoys a regret bound of $ ilde{O}\left(D\sqrt{(K/N+ K_G)DT} ight)$. Finally, we empirically show that the LCC-UCB and the LCC-UCB-GRAPH algorithm perform well and outperform strategies that communicate through a central node

연구 동기 및 목표

  • 제한된 통신 조건에서 다중 에이전트 다수의 손잡이 밴딧 문제의 누적 손실을 최소화하기 위해.
  • 메시지 크기를 O(log K) 비트로 제한하고 통신 라운드 수를 O(log T)로 제한함으로써 통신 비용을 최소화하기 위해.
  • 희박하고 분산된 네트워크 환경에서도 근사 최적의 손실 성능을 유지할 수 있는 확장 가능한 알고리즘 설계를 위해.
  • 완전히 연결된 네트워크와 희박한 그래프 구조에서 모두 중심 노드 통신 및 이웃 기반 메시지 전달 전략보다 뛰어난 성능을 내는 것을 목표로 하였다.

제안 방법

  • LCC-UCB는 에이전트들이 암의 부분집합에서 UCB를 실행하고, 각 시간 간격의 끝에 최고의 암 인덱스만 공유하는 이중 시간 간격을 사용한다.
  • 각 에이전트는 로컬 암 집합을 유지하며, 각 시간 간격 후 다른 에이전트로부터 수신한 암 인덱스를 기반으로 이를 갱신한다.
  • 이 알고리즘은 시간 간격이 진행됨에 따라 최고의 암과 추천된 암 사이의 격차가 점차 줄어들게 하여 손실 성능을 향상시킨다.
  • LCC-UCB-GRAPH는 희박한 그래프로 확장하기 위해 시간 간격을 하위 시간 간격으로 나누어, 각 하위 단계에서 이웃 정보를 기반으로 업데이트할 수 있도록 한다.
  • LCC-UCB-GRAPH에서는 각 하위 시간 간격에서 이웃로부터 갱신된 암 집합을 기반으로 UCB를 다시 시작함으로써, 직경 D와 최대 차수 K_G를 가진 그래프에서 손실을 감소시킨다.
  • 두 알고리즘 모두 상한 신뢰도 기반(UCB) 탐색을 사용하며, 보상 추정치 전체가 아니라 오직 암 인덱스만 공유하면 된다는 점을 활용한다.

실험 결과

연구 질문

  • RQ1제한된 통신 조건에서 다중 에이전트 밴딧에서 이론적 최적의 슈퍼어게인트 경계 Õ(√(KT/N))에 근접한 손실을 달성할 수 있는가?
  • RQ2분산된 다중 에이전트 밴딧 환경에서 낮은 손실을 유지하면서 통신 비용(비트 수 및 통신 횟수)을 최소화할 수 있는가?
  • RQ3특히 직경 D와 최대 차수 K_G가 희박한 통신 그래프에서 손실 성능에 미치는 영향은 어떠한가?
  • RQ4LCC-UCB-GRAPH에서 하위 시간 간격 통신 방식이 전체 시간 간격 또는 라운드별 통신 전략보다 손실과 확장성 측면에서 뛰어나게 되는가?

주요 결과

  • LCC-UCB는 Õ(√((K/N + N)T))의 손실 경계를 달성하며, 협업 밴딧의 이론적 하한 Õ(√(KT/N))에 근접한다.
  • LCC-UCB-GRAPH는 희박한 그래프에서 Õ(D√((K/N + K_G)DT))의 손실을 달성하며, 노드당 통신 복잡도는 O(K_G D log T) 메시지로 제한된다.
  • 실험 결과, LCC-UCB-GRAPH는 통신이 없는 경우와 라운드별 이웃 통신 전략보다 특히 p = 10/N인 희박한 그래프에서 뛰어난 성능을 보였다.
  • K = 250이고 N = 100 또는 150일 경우, K_G가 낮고 에이전트당 암 수가 ≤5인 관계로 LCC-UCB-GRAPH의 성능이 전체 통신 전략과 유사하게 나타났다.
  • LCC-UCB-GRAPH는 릴레이 기반 LCC-UCB보다 훨씬 낮은 손실을 누적하여, 전체 시간 간격 통신 대비 하위 시간 간격 업데이트의 이점이 뚜렷하다는 것을 입증했다.
  • DEMAB 알고리즘은 통신 횟수 O(N log(NK))로 더 낮지만, LCC-UCB-GRAPH는 여전히 DEMAB를 능가하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.