Skip to main content
QUICK REVIEW

[논문 리뷰] Nonstochastic Bandits with Composite Anonymous Feedback

Nicolò Cesa‐Bianchi, Tommaso Cesari|arXiv (Cornell University)|2021. 12. 06.
Advanced Bandit Algorithms Research인용 수 21
한 줄 요약

이 논문은 과거 행동의 손실이 미래 라운드로 적대적으로 분포되는 복합 익명 피드백을 갖는 비확률적 밴딧 설정을 제안한다. 이는 표준 밴딧 알고리즘을 이 피드백 구조에 견딜 수 있도록 만드는 일반적인 감소 기법을 제안하며, Tsallis 엔트로피를 사용하는 조정된 FTRL 알고리즘을 통해 $\sqrt{(d+1)KT}$의 리그레트 한계를 달성한다. 이는 로그 인자에 대해 최적이다.

ABSTRACT

We investigate a nonstochastic bandit setting in which the loss of an action is not immediately charged to the player, but rather spread over the subsequent rounds in an adversarial way. The instantaneous loss observed by the player at the end of each round is then a sum of many loss components of previously played actions. This setting encompasses as a special case the easier task of bandits with delayed feedback, a well-studied framework where the player observes the delayed losses individually. Our first contribution is a general reduction transforming a standard bandit algorithm into one that can operate in the harder setting: We bound the regret of the transformed algorithm in terms of the stability and regret of the original algorithm. Then, we show that the transformation of a suitably tuned FTRL with Tsallis entropy has a regret of order $\sqrt{(d+1)KT}$, where $d$ is the maximum delay, $K$ is the number of arms, and $T$ is the time horizon. Finally, we show that our results cannot be improved in general by exhibiting a matching (up to a log factor) lower bound on the regret of any algorithm operating in this setting.

연구 동기 및 목표

  • 손실이 미래 라운드로 적대적으로 분포되는 비확률적 밴딧 설정을 정식화하여 복합 손실을 형성한다.
  • 표준 밴딧 알고리즘을 복합 익명 피드백에 견딜 수 있도록 만드는 일반적인 워핑(wrapper) 기법을 개발한다.
  • 조정된 FTRL에 의한 Tsallis 엔트로피 알고리즘의 리그레트 한계를 $\sqrt{(d+1)KT}$로 설정한다.
  • 로그 인자에 대해 최적임을 보여주는 동치의 하한(lower bound)을 증명한다.

제안 방법

  • 표준 밴딧 알고리즘을 재가중 및 재스케일링된 손실을 통해 복합 익명 피드백에 견딜 수 있도록 만드는 일반적인 감소 기법을 제안한다.
  • 지연 및 복합 손실 구조를 다룰 수 있도록 조정된 FTRL 알고리즘을 사용하며, Tsallis 엔트로피를 기반으로 한다.
  • Dekel 등(2014b)의 영감을 얻어 라운드 분류 체계(그림그리기, 유지, 업데이트)를 도입하여 리그레트 분석을 업데이트 타이밍에서 분리한다.
  • 변수 교체를 적용하고 레미마 2를 활용하여 지연 $d$에 대한 의존성을 과대평가하지 않도록 정확히 제한한다.
  • 적대자가 $T/d$개의 시간 단위에 높은 손실을 집중시키는 하한 인스턴스를 구성하여, $\Omega(\sqrt{(d+1)KT})$의 리그레트가 피할 수 없음을 입증한다.

실험 결과

연구 질문

  • RQ1표준 밴딧 알고리즘이 과거 행동의 손실이 미래 라운드로 분포되는 복합 익명 피드백을 체계적으로 다룰 수 있는가?
  • RQ2지연이 최대 $d$까지 존재하는 비확률적 밴딧 설정에서 달성 가능한 최적 리그레트는 무엇인가?
  • RQ3$\sqrt{(d+1)KT}$ 리그레트 한계가 타당한가, 아니면 향상시킬 수 있는가?
  • RQ4복합 피드백의 구조는 표준 지연 피드백과 비교해 온라인 학습 알고리즘 설계에 어떤 영향을 미치는가?

주요 결과

  • 제안된 워핑 변환은 변환된 알고리즘의 리그레트가 원래 알고리즘의 안정성과 리그레트에 의존하도록 보장하여 복합 피드백으로의 일반화를 가능하게 한다.
  • FTRL에 Tsallis 엔트로피를 적용한 변환된 알고리즘은 $\sqrt{(d+1)KT}$의 리그레트 한계를 달성하며, 이는 로그 인자에 대해 표준 비확률적 밴딧에서 알려진 최고의 한계와 일치한다.
  • 동치의 하한 $\Omega(\sqrt{(d+1)KT})$가 확립되어 유도된 리그레트 한계가 로그 인자에 대해 최적임을 증명한다.
  • 하한은 적대자가 높은 손실을 소수의 시간 단위에 집중시킬 수 있는 능력에 의존하며, 이는 i.i.d. 지연 모델에서는 존재하지 않아 단순한 분석 기법을 무효화한다.
  • 초기 초판에서 두 가지 결함을 수정하였다: $d$라운드 동안 손실 누적에 대한 잘못된 한계와 확률의 부호가 있는 차이에 대한 잘못된 부등식으로, 새로운 분석 프레임워크를 통해 이를 해결하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.