Skip to main content
QUICK REVIEW

[논문 리뷰] Sub-sampling for Efficient Non-Parametric Bandit Exploration

Dorian Baudry, Emilie Kaufmann|arXiv (Cornell University)|2020. 10. 27.
Advanced Bandit Algorithms Research인용 수 5
한 줄 요약

이 논문은 다수의 분포 가족—베르누이, 가우시안, 포아송—에 대해 분포 특화 캘리브레이션 없이 渐近적으로 최적의 리그레트를 달성하는 새로운 다중 손잡이 밴딧 알고리즘인 RB-SDA를 소개한다. 톰슨 샘플링과 달리, RB-SDA는 하위샘플링 대결 알고리즘(SDA) 프레임워크 내에서 재샘플링 전략을 사용하여 탐색과 이용의 균형을 이루며, 로그 리그레트를 증명하고 일 매개변수 지수가족에 대해 Lai-Robbins 하한선을 충족한다.

ABSTRACT

In this paper we propose the first multi-armed bandit algorithm based on re-sampling that achieves asymptotically optimal regret simultaneously for different families of arms (namely Bernoulli, Gaussian and Poisson distributions). Unlike Thompson Sampling which requires to specify a different prior to be optimal in each case, our proposal RB-SDA does not need any distribution-dependent tuning. RB-SDA belongs to the family of Sub-sampling Duelling Algorithms (SDA) which combines the sub-sampling idea first used by the BESA [1] and SSMC [2] algorithms with different sub-sampling schemes. In particular, RB-SDA uses Random Block sampling. We perform an experimental study assessing the flexibility and robustness of this promising novel approach for exploration in bandit models.

연구 동기 및 목표

  • 기본 분포에 대한 사전 지식이 없이도 여러 분포 가족에 걸쳐 渐진적으로 최적의 리그레트를 달성하는 비모수적 밴딧 알고리즘을 개발하는 것.
  • 최적성을 달성하기 위해 분포 특화 사전확률가 필요한 톰슨 샘플링의 한계를 극복하는 것.
  • 재샘플링 기반 알고리즘을 설계하여 로그 리그레트를 유지하면서 분포 가정에 대해 강건한 성능을 보이게 하는 것.
  • 손잡이 분포에 대한 일반 조건 하에서 새로운 알고리즘 클래스인 하위샘플링 대결 알고리즘(SDA)에 대한 이론적 보장을 수립하는 것.
  • 강제 탐색을 $ f_r = \sqrt{\log r} $ 비율로 수행할 경우, 일 매개변수 지수가족에 대해 渐진적으로 최적이 보장되는지 증명하는 것.

제안 방법

  • RB-SDA는 하위샘플링 대결 알고리즘(SDA) 가족의 일원으로, 행동 선택을 위해 색인을 최대화하는 대신 손잡이 간 페어웨이즈 비교(대결)를 사용한다.
  • 알고리즘은 각 손잡이의 보상을 블록으로 나누고 무작위 블록을 선택하는 랜덤 블록(RB) 하위샘플링을 적용한다.
  • 하위샘플링은 뽑기 횟수가 높은 손잡이의 효과적 표본 크기를 줄여, 미흡하게 샘플링된 손잡이의 탐색을 촉진한다.
  • 하위샘플링이 열악한 손잡이 측면으로 쏠리지 않도록 보장하기 위해 일반화된 균형 조건을 도입한다.
  • 강제 탐색은 $ f_r / \log\log r \to \infty $ 를 만족하는 수열 $ f_r $ 을 통해 도입되며, 이는 지수가족에 대해 일반화된 균형 조건이 유지되도록 보장한다.
  • 이론적 분석은 Kullback-Leibler 발산과 i.i.d. 랜덤 변수 합의 尾確率를 제어하기 위해 사용되며, 잘못된 대결의 확률을 제어한다.

실험 결과

연구 질문

  • RQ1재샘플링 기반 밴딧 알고리즘이 분포 특화 캘리브레이션 없이도 여러 분포 가족에 걸쳐 渐진적으로 최적의 리그레트를 달성할 수 있는가?
  • RQ2대결 프레임워크 내에서 랜덤 블록 하위샘플링을 사용할 경우, 로그 리그레트와 渐진적 최적이 유지되는가?
  • RQ3일 매개변수 지수가족에 대해 일반화된 균형 조건이 성립하는 탐색 비율 $ f_r $ 의 조건은 무엇인가?
  • RQ4강제 탐색을 통해 비유계 또는 파rametric 분포에 대해 SDA 알고리즘의 渐진적 최적이 보장될 수 있는가?
  • RQ5RB-SDA는 비모수적 알고리즘인 Non-Parametric TS 또는 GIRO와 비교해 리그레트와 강건성 측면에서 어떻게 다른가?

주요 결과

  • RB-SDA는 손잡이 분포에 대한 일반 조건 하에서 로그 리그레트를 달성하며, 이는 베르누이, 가우시안, 포아송 분포에 대해서도 성립한다.
  • 일 매개변수 지수가족의 경우, 강제 탐색 비율 $ f_r = \sqrt{\log r} $ 를 사용할 경우 RB-SDA는 일반화된 균형 조건을 만족하여 渐진적으로 최적이 보장된다.
  • RB-SDA의 리그레트는 일 매개변수 지수가족에 대해 Lai-Robbins 하한선과 정확히 일치하며, 이는 渐진적으로 최적이 됨을 증명한다.
  • 톰슨 샘플링와 달리, 분포 가족의 사전 지정이 필요 없으며, 이는 분포 특화 캘리브레이션의 필요성을 제거한다.
  • 일반화된 균형 조건은 $ f_r / \log\log r \to \infty $ 를 만족할 경우 성립하며, 이는 $ f_r = \sqrt{\log r} $ 에 의해 충족되어 이론적 보장을 보장한다.
  • 실험 결과는 RB-SDA가 캘리브레이션 없이 다양한 분포 설정에서 강건하고 유연함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.