Skip to main content
QUICK REVIEW

[논문 리뷰] Minimal Exploration in Structured Stochastic Bandits

Richard Combes, Stefan Magureanu|arXiv (Cornell University)|2017. 11. 01.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 80
한 줄 요약

이 논문은 광범위한 구조화된 확률적 밴디트에 대한 인스턴스 특유의 regret 하한을 도출하고, 최소한의 탐색 비율에 맞춰 이 하한을 달성하는 점근적으로 최적의 알고리즘 OSSB를 도입한다; 선형 밴디트에서 OSSB가 Thompson 샘플링 및 관련 방법들을 능가하는 실험 결과를 보인다.

ABSTRACT

This paper introduces and addresses a wide class of stochastic bandit problems where the function mapping the arm to the corresponding reward exhibits some known structural properties. Most existing structures (e.g. linear, Lipschitz, unimodal, combinatorial, dueling, ...) are covered by our framework. We derive an asymptotic instance-specific regret lower bound for these problems, and develop OSSB, an algorithm whose regret matches this fundamental limit. OSSB is not based on the classical principle of "optimism in the face of uncertainty" or on Thompson sampling, and rather aims at matching the minimal exploration rates of sub-optimal arms as characterized in the derivation of the regret lower bound. We illustrate the efficiency of OSSB using numerical experiments in the case of the linear bandit problem and show that OSSB outperforms existing algorithms, including Thompson sampling.

연구 동기 및 목표

  • 도메인 특성에 따라 암 수익 매핑에 알려진 구조가 있는 확률적 밴디트에서의 학습 동기 부여.
  • 구조화된 밴디트에 대한 인스턴스 특이적 점근적 regret 하한 도출.
  • 근본적 학습 한계를 맞추는 OSSB 알고리즘 개발.
  • OSSB의 유한시간 regret 분석 및 효율성에 대한 수치적 증거 제시.

제안 방법

  • 알 수 없는 매개변수 ���e와 구조화된 보상 매핑 (x,)를 갖는 일반적인 구조화된 MAB를 모델링합니다.
  • 부분 무한 LP 기반의 탐색 비율 하한(정리 1)을 도출합니다.
  • OSSB(Optimal Sampling for Structured Bandits)를 활용한 착취, 추정, 탐색 단계 정의합니다.
  • 하한 최적화 문제(2)-(3)를 풀어 탐색 비율을 안내합니다.
  • Bernoulli 또는 Gaussian 보상 하에서 OSSB의 유한시간 및 점근적 regret 경계를 증명합니다.
  • 선형 밴디트에서 TS 및 GLM-UCB 대비 성능 향상을 보여주는 수치 실험을 제공합니다.

실험 결과

연구 질문

  • RQ1각 하위 최적 팔에 대해 문제 구조를 고려할 때 필요한 최소 탐색 비율은 무엇인가?
  • RQ2일반적인 구조화된 밴디트에 대해 인스턴스 특이적 하한을 달성하는 알고리즘을 설계할 수 있는가?
  • RQ3최적의 탐색 비율을 명시적으로 목표로 하는 알고리즘과 낙관성 기반 또는 Thompson 샘플링 방법과의 비교는 어떠한가?
  • RQ4이러한 알고리즘의 유한시간 regret 보장은 무엇이며, 선형 밴디트에서의 실용적 성능으로 어떻게 연결되는가?

주요 결과

  • 세미-무한 LP를 통해 인스턴스 특이적 tight한 regret 하한 C()를 도출하고, 하한은 부최적 팔들 간의 탐색에 제약을 둡니다.
  • OSSB는 서로 다른 시점에서 하한에 근접하게 부최적 팔을 c(x,) log T 비율로 샘플링함으로써 하한에 비슷하게 수렴합니다.
  • OSSB는 최적의 탐색 비율과 일치하도록 학습하는 동안 착취, 추정, 탐색을 교대로 수행합니다.
  • 선형 밴디트에서 OSSB는 시뮬레이션에서 Thompson 샘플링, GLM-UCB, 그리고 최근의 점근적으로 최적 알고리즘을 능가합니다.
  • 이 알고리즘은 낙관성이나 Thompson 샘플링에 기반하지 않으며, 그 해석은 집중 경향과 최적해의 연속성에 의존합니다.
  • 탐색을 제어하는 매개변수가 소거될 때 점근적 하한과 일치하는 유한시간 regret 경계가 확립됩니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.