Skip to main content
QUICK REVIEW

[논문 리뷰] Nonstochastic Multiarmed Bandits with Unrestricted Delays

Tobias Sommer Thune, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|2019. 06. 03.
Advanced Bandit Algorithms Research참고 문헌 22인용 수 3
한 줄 요약

이 논문은 비스스로스틱 다중팔대 밴딧에서 무한대의 지연을 다루기 위해 새로운 스킵 래퍼를 갖춘 지연된-Exp3 알고리즘을 제안한다. 이는 유한한 지연이 필요 없이 $\mathcal{O}(\sqrt{(KT+D)\ln K})$의 추측된 리그레트 경계를 달성한다. 또한 지연이 행동 시간에 알려져 있을 경우, 이전에 알려진 $T$와 $D$에 대한 지식이 필요 없도록 하는 듀블링 스킴을 도입하여, 특정 경우에 문제 매개변수에 대해 다항적으로 더 나은 의존성을 가지는 개선된 오라클 경계를 얻는다.

ABSTRACT

We investigate multiarmed bandits with delayed feedback, where the delays need neither be identical nor bounded. We first prove that "delayed" Exp3 achieves the $O(\sqrt{(KT + D)\ln K} )$ regret bound conjectured by Cesa-Bianchi et al. [2019] in the case of variable, but bounded delays. Here, $K$ is the number of actions and $D$ is the total delay over $T$ rounds. We then introduce a new algorithm that lifts the requirement of bounded delays by using a wrapper that skips rounds with excessively large delays. The new algorithm maintains the same regret bound, but similar to its predecessor requires prior knowledge of $D$ and $T$. For this algorithm we then construct a novel doubling scheme that forgoes the prior knowledge requirement under the assumption that the delays are available at action time (rather than at loss observation time). This assumption is satisfied in a broad range of applications, including interaction with servers and service providers. The resulting oracle regret bound is of order $\min_β(|S_β|+β\ln K + (KT + D_β)/β)$, where $|S_β|$ is the number of observations with delay exceeding $β$, and $D_β$ is the total delay of observations with delay below $β$. The bound relaxes to $O (\sqrt{(KT + D)\ln K} )$, but we also provide examples where $D_β\ll D$ and the oracle bound has a polynomially better dependence on the problem parameters.

연구 동기 및 목표

  • 변동하는 무한대의 지연 하에서 비스스로스틱 다중팔대 밴딧의 추측된 리그레트 경계와 증명된 리그레트 경계 사이의 격차를 메우기 위해.
  • 이전 알고리즘이 유한한 지연 또는 $T$와 $D$에 대한 사전 지식을 요구하는 한계를 해결하기 위해.
  • 임계값 기반의 스킵 메커니즘을 사용하여 알려지지 않은 지연에 적응하는 실용적인 알고리즘을 설계하기 위해.
  • 지연이 행동 시간에 알려져 있을 경우, $T$와 $D$에 대한 사전 지식이 필요 없도록 하는 듀블링 스킴을 개발하기 위해.
  • 지연 분포에 따라 달라지는, 특히 대부분의 지연이 작을 경우에 더 나은 성능을 보이는 개선된 오라클 리그레트 경계를 유도하기 위해.

제안 방법

  • 지연이 변동할 수 있는 상황에서 손실 정보가 도착하는 즉시 업데이트를 수행하는 수정된 '지연된-Exp3' 알고리즘을 도입한다.
  • 지연이 임계값 $\beta$를 초과하는 라운드를 스킵함으로써 기반 알고리즘이 보는 효과적 지연을 제한하는 '스키퍼'라고 불리는 래퍼 알고리즘을 제안한다.
  • 지연된 피드백을 고려한 지수 가중치의 정교한 분석을 수행하며, 확률의 이탈 레미마를 도입하여 지연된 업데이트의 영향을 제한한다.
  • 지연이 행동 시간에 알려져 있을 경우, $T$와 $D$에 대한 사전 지식 없이도 임계값 $\beta$를 적응적으로 조정하는 듀블링 스킴을 활용한다.
  • 새로운 오라클 리그레트 경계를 도출한다: $\min_\beta \left(|S_\beta| + \beta\ln K + \frac{KT + D_\beta}{\beta}\right)$, 여기서 $|S_\beta|$는 지연이 $> \beta$인 관측 수이고 $D_\beta$는 $\beta$ 이하의 총 지연이다.
  • 분석을 적용하여 표준 가정 하에서 이 경계가 $\mathcal{O}(\sqrt{(KT+D)\ln K})$로 줄어들지만, $D_\beta \ll D$일 경우에 매우 더 엄격해질 수 있음을 보여준다.

실험 결과

연구 질문

  • RQ1비스스로스틱 밴딧 설정에서 무한대의 지연이 존재할 경우, $\mathcal{O}(\sqrt{(KT+D)\ln K})$의 추측된 리그레트 경계를 달성할 수 있는가?
  • RQ2지연 피드백 하에서 동일한 리그레트 경계를 유지하면서 $T$와 $D$에 대한 사전 지식이 필요 없도록 할 수 있는가?
  • RQ3지연의 분포에 따라 달라지는 개선된 리그레트 경계를 도출할 수 있는가? 특히 대부분의 지연이 작을 경우에 대해.
  • RQ4지연이 관측 시간이 아닌 행동 시간에 알려져 있을 경우, 행동 시간에만 알려져 있을 때보다 더 나은 리그레트 보장을 얻을 수 있는가?
  • RQ5$T$와 $D$에 대한 사전 지식 없이도 지연 임계값을 적응적으로 조정할 수 있는 듀블링 스킴을 설계할 수 있는가?

주요 결과

  • 지연이 유한하고 $T$, $D$, $d_{\text{max}}$가 알려져 있을 경우, 지연된-Exp3 알고리즘이 추측된 $\mathcal{O}(\sqrt{(KT+D)\ln K})$ 리그레트 경계를 달성한다.
  • 스키퍼 래퍼 알고리즘은 지연이 임계값 $\beta$를 초과하는 관측을 스킵함으로써 무한대의 지연 하에서도 지연된-Exp3를 사용할 수 있도록 하며, 동일한 리그레트 경계를 유지한다.
  • 지연이 행동 시간에 알려져 있을 경우, 듀블링 스킴을 통해 $T$와 $D$에 대한 사전 지식이 필요 없이 개선된 오라클 리그레트 경계를 달성한다.
  • 개선된 오라클 경계 $\min_\beta \left(|S_\beta| + \beta\ln K + \frac{KT + D_\beta}{\beta}\right)$는 $D_\beta \ll D$일 경우 $\mathcal{O}(\sqrt{(KT+D)\ln K})$보다 다항적으로 더 나은 성능을 보일 수 있다.
  • 분석을 통해 리그레트 경계가 최악의 경우에 대해 타이트함을 보였지만, 유리한 지연 분포에서는 상당히 향상될 수 있음을 입증하였다.
  • 논문은 $D_\beta \ll D$인 구체적인 예를 제시하며, 개선된 경계가 상당한 성능 향상 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.