Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic bandits with arm-dependent delays

Anne Gael Manegueu, Claire Vernade|arXiv (Cornell University)|2020. 06. 18.
Advanced Bandit Algorithms Research인용 수 12
한 줄 요약

이 논문은 피드백이 부분적으로 관찰 가능한, 암호화된 지연이 존재하는 스토케스틱 밴딧 문제를 위한 UCB 기반 알고리즘인 PatientBandits를 제안한다. 지연은 암호화된 지연이 존재하며, 지연의 크기는 암호화된 지연에 따라 달라지며, 무한대일 수 있고, 가능하면 무거운 尾를 가질 수 있다. 이 알고리즘은 표준 밴딧의 경우와 비슷한 문제 의존적 리그레트 한계를 상수 인자 범위 내에서 달성한다. 이는 중간 지연과 이질적인 지연 분포 조건에서도 성립하며, 전역적인 尾 조건이 없는 경우 성능 손실이 피할 수 없다는 최소 최대 리그레트 하한을 증명한다.

ABSTRACT

Significant work has been recently dedicated to the stochastic delayed bandit setting because of its relevance in applications. The applicability of existing algorithms is however restricted by the fact that strong assumptions are often made on the delay distributions, such as full observability, restrictive shape constraints, or uniformity over arms. In this work, we weaken them significantly and only assume that there is a bound on the tail of the delay. In particular, we cover the important case where the delay distributions vary across arms, and the case where the delays are heavy-tailed. Addressing these difficulties, we propose a simple but efficient UCB-based algorithm called the PatientBandits. We provide both problems-dependent and problems-independent bounds on the regret as well as performance lower bounds.

연구 동기 및 목표

  • 피드백이 부분적으로 관찰 가능한, 암호화된 지연이 존재하는 스토케스틱 밴딧 문제에서의 학습 문제에 대응하기 위해.
  • 각 암호화된 지연이 존재하는 암호화된 지연으로 인해 발생하는 피드백 누락으로 인한 식별성 문제를 해결하기 위해.
  • 지연의 이질성과 무거운 尾 조건이 존재하더라도, 표준 UCB와 비슷한 문제 의존적 리그레트 성능을 달성할 수 있는 알고리즘을 설계하기 위해.
  • 이러한 지연 모델 하에서 학습의 근본적 한계를 규명하고, 최소 최대 리그레트 하한을 도출하기 위해.
  • 지연 尾 파라미터의 부정확한 사전 지식에 대한 알고리즘의 강건성(로버스트니)을 연구하기 위해.

제안 방법

  • 지연 尾의 무거움 정도를 반영하기 위해 지연 尾 파라미터 $\overline{\alpha}$ 를 포함한 UCB 스타일 알고리즘인 PatientBandits를 제안한다.
  • 지연으로 인한 불확실성과 무거운 尾을 가진 피드백을 고려한 수정된 상한 신뢰 구간을 사용한다.
  • 관측치를 지연된 것으로 간주하기 위해 지연 분포의 추정치를 기반으로 한 임계값 기반 메커니즘을 도입하여 전체 지연 관측이 필요로 하는 것을 피한다.
  • 각 암호화된 지연 분포의 尾가 거듭제곱 법칙에 의해 지수 $\alpha_i$ 로 유계임을 가정한 문제 의존적 리그레트 분석을 적용한다.
  • 문제 독립적(최소 최대) 리그레트 한계를 유도하고, 전역적인 尾 제어가 없는 조건에서 성능 손실이 피할 수 없다는 하한을 증명한다.
  • 지연 尾 파라미터 $\overline{\alpha}$ 를 잘못 지정했을 경우의 영향을 분석하여 강건성(로버스트니)을 평가한다.

실험 결과

연구 질문

  • RQ1지연이 암호화된 지연이 존재하고 가능하면 무거운 尾을 가질 경우, 밴딧 알고리즘이 표준 밴딧의 성능에 가까운 문제 의존적 리그레트를 달성할 수 있는가?
  • RQ2지연의 이질성과 부분 관찰 조건이 스토케스틱 밴딧 문제에서의 근본적 학습 한계에 어떤 영향을 미치는가?
  • RQ3완전한 지연 관측이 필요 없이 다양한 지연 분포에 적응할 수 있는 UCB 기반 알고리즘을 설계할 수 있는가?
  • RQ4지연의 이질성과 무거운 尾 분포로 인해 최소 최대 리그레트 측면에서 지불해야 하는 최소한의 가격은 무엇인가?
  • RQ5알고리즘의 성능은 지연 尾 파라미터 $\overline{\alpha}$ 의 선택에 얼마나 민감한가?

주요 결과

  • PatientBandits는 암호화된 지연이 존재하고 무거운 尾을 가진 경우에도 표준 UCB 리그레트의 상수 인자 범위 내에서 문제 의존적 리그레트 한계를 달성한다.
  • 이상적 상황에서 알고리즘은 근사 최적의 성능 유지를 유지하며, 지연으로 인한 리그레트 증가가 상수 인자로 제한된다.
  • 최소 최대 리그레트의 경우, 전역적인 尾 제어가 없는 조건에서 표준 밴딧과의 성능 손실이 피할 수 없다는 하한이 증명된다.
  • 특히 최적의 암호화된 지연이 더 무거운 尾을 가진 이질적인 지연 분포 조건에서는 D-UCB가 편향으로 인해 실패하지만, PatientBandits는 최적의 암호화된 지연을 성공적으로 식별하고 선형 이하의 리그레트를 달성한다.
  • PatientBandits는 지연 尾 파라미터 $\overline{\alpha}$ 의 잘못된 지정에 대해 강건하며, 지연 분포의 정확한 지식이 없이도 실용적인 적응성을 보인다.
  • 큰 임계값 $m$ 에서 D-UCB가 장기간 선형 리그레트 단계를 보이는 것은 초기 학습 단계에서의 비효율성을 나타내며, 이는 PatientBandits와는 대조적으로 고정된 단계 수를 기다려야만 이용을 시작하는 방식이 아니라는 점에서 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.