[논문 리뷰] Individual Regret in Cooperative Nonstochastic Multi-Armed Bandits
이 논문은 네트워크를 통해 통신하는 에이전트들이 개별적 회귀를 줄이기 위해 분산 회귀 최소화 알고리즘을 제안한다. 각 에이전트 $v$의 개별 기대 회귀는 $\tilde{O}\big(\big(1 + \frac{K}{|\mathcal{N}(v)|}\big)^{1/2} \sqrt{T}\big)$ 수준을 달성하며, Cesa-Bianchi 등(2019b)에서 제기한 개방 문제를 알려진 및 알려지지 않은 통신 그래프 모두에서 해결한다. 성능 차이는 오직 로그 차수이다.
We study agents communicating over an underlying network by exchanging messages, in order to optimize their individual regret in a common nonstochastic multi-armed bandit problem. We derive regret minimization algorithms that guarantee for each agent $v$ an individual expected regret of $\widetilde{O}\left(\sqrt{\left(1+\frac{K}{\left|\mathcal{N}\left(v ight) ight|} ight)T} ight)$, where $T$ is the number of time steps, $K$ is the number of actions and $\mathcal{N}\left(v ight)$ is the set of neighbors of agent $v$ in the communication graph. We present algorithms both for the case that the communication graph is known to all the agents, and for the case that the graph is unknown. When the graph is unknown, each agent knows only the set of its neighbors and an upper bound on the total number of agents. The individual regret between the models differs only by a logarithmic factor. Our work resolves an open problem from [Cesa-Bianchi et al., 2019b].
연구 동기 및 목표
- 에이전트들이 네트워크를 통해 통신하는 협동적 비확률적 다손대 밴딧 문제에서 개별적 회귀 최소화를 다루는 것.
- 전체 정보가 제한된 상황에서도 각 에이전트가 낮은 개별적 회귀를 달성할 수 있도록 알고리즘을 설계하는 것.
- Cesa-Bianchi 등(2019b)에서 제기한, 알려진 및 알려지지 않은 통신 그래프 설정에서의 회귀 한계에 관한 개방 문제를 해결하는 것.
- 특히 국소적 이웃 수와 같은 네트워크 구조가 개별적 회귀 성능에 미치는 영향을 분석하는 것.
제안 방법
- 에이전트들은 고정된 통신 그래프를 통해 메시지를 교환하여 행동 보상과 결정에 대한 정보를 공유한다.
- 알고리즘은 신뢰구간 기반의 탈중앙화된 탐색-이용 전략을 사용하며, 이웃 간의 보상 평균화를 수행한다.
- 알려지지 않은 그래프의 경우, 에이전트들은 네트워크 구조를 추정하기 위한 분산 추정 절차를 사용하여 일관된 회귀 한계를 유지한다.
- 회귀 분석은 농도 부등식과 네트워크 연결성 성질을 활용하여, 국소적 이웃 수 $|\mathcal{N}(v)|$ 로 표현된 개별적 회귀를 유계로 제한한다.
- 핵심 요소는 이웃 간 보상의 가중 평균을 사용하여 분산을 줄이고 개별 성능을 향상시키는 것이다.
- 알려진 및 알려지지 않은 그래프 설정 모두에 적응할 수 있으며, 성능은 오직 로그 인자 수준에서만 차이가 난다.
실험 결과
연구 질문
- RQ1에이전트들이 네트워크를 통해 국소적으로만 통신할 경우, 협동적 비확률적 다손대 밴딧 문제에서 개별적 회귀를 최소화할 수 있는가?
- RQ2에이전트의 이웃 수 $|\mathcal{N}(v)|$ 는 그의 개별적 회귀 한계에 어떤 영향을 미치는가?
- RQ3통신 그래프를 에이전트가 모른다는 조건에서 최적의 회귀 성능은 무엇인가?
- RQ4중앙집중식 또는 완전한 정보가 있는 설정과 비교해 볼 때, 제안된 알고리즘의 회귀 스케일링은 어떻게 되는가?
- RQ5Cesa-Bianchi 등(2019b)에서 제기한 협동 밴딧 문제에서의 개별적 회귀에 관한 개방 문제는 일반적인 네트워크 구조에서 해결될 수 있는가?
주요 결과
- 제안된 알고리즘은 각 에이전트 $v$에 대해 $\widetilde{O}\big(\big(1 + \frac{K}{|\mathcal{N}(v)|}\big)^{1/2} \sqrt{T}\big)$ 의 개별 기대 회귀를 보장한다. 여기서 $T$ 는 시간 수평이고 $K$ 는 행동 수이다.
- 회귀 한계는 이웃 수의 제곱근에 반비례하여 스케일링되며, 이는 더 많은 이웃을 가진 에이전트일수록 더 낮은 회귀를 달성함을 시사한다.
- 통신 그래프가 알려지지 않은 경우에도 알고리즘이 거의 최적의 성능을 달성하며, 알려진 그래프 경우와 비교해 오직 로그 인자 수준에서만 성능이 떨어진다.
- 이 결과는 Cesa-Bianchi 등(2019b)에서 제기한 협동적 비확률적 밴딧 문제에서의 개별적 회귀에 관한 개방 문제를 해결한다.
- 분석 결과, 국소적 정보와 통신만으로도 최적에 가까운 회귀를 달성할 수 있으며, 네트워크의 전반적 지식이 필요로 하지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.