Skip to main content
QUICK REVIEW

[논문 리뷰] Langevin Monte Carlo for Contextual Bandits

Pan Xu, Hongkai Zheng|arXiv (Cornell University)|2022. 06. 22.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 랭비에르트 몬테카를로 톰슨 샘플링(LMC-TS)을 제안하며, 라플라스 근사 대신 랭비에르트 몬테카를로를 통한 노이즈 있는 기울기 하강을 사용하여 계산적으로 효율적인 후행 샘플링 방법을 제공한다. 이 방법은 선형 연속적 밴디트에서 최신 톰슨 샘플링 알고리즘과 동일한 하위선형의 손실 한계를 달성하면서도 공분산 행렬의 역행렬 계산이나 가우시안 가정 없이도 스케일링 가능하고 고차원적인 후행 샘플링을 가능하게 한다.

ABSTRACT

We study the efficiency of Thompson sampling for contextual bandits. Existing Thompson sampling-based algorithms need to construct a Laplace approximation (i.e., a Gaussian distribution) of the posterior distribution, which is inefficient to sample in high dimensional applications for general covariance matrices. Moreover, the Gaussian approximation may not be a good surrogate for the posterior distribution for general reward generating functions. We propose an efficient posterior sampling algorithm, viz., Langevin Monte Carlo Thompson Sampling (LMC-TS), that uses Markov Chain Monte Carlo (MCMC) methods to directly sample from the posterior distribution in contextual bandits. Our method is computationally efficient since it only needs to perform noisy gradient descent updates without constructing the Laplace approximation of the posterior distribution. We prove that the proposed algorithm achieves the same sublinear regret bound as the best Thompson sampling algorithms for a special case of contextual bandits, viz., linear contextual bandits. We conduct experiments on both synthetic data and real-world datasets on different contextual bandit models, which demonstrates that directly sampling from the posterior is both computationally efficient and competitive in performance.

연구 동기 및 목표

  • 연속적 밴디트에서 톰슨 샘플링의 후행 샘플링에 있어 고차원에서의 라플라스 근사의 계산 비효율성을 해결하기 위해.
  • 특히 일반선형 또는 신경 밴디트와 같은 비선형 보상 모델에서 진정한 후행 분포가 가우시안이 아닐 경우 가우시안 근사의 한계를 극복하기 위해.
  • 공분산 행렬 계산에 비용이 많이 드는 것을 피하고 MCMC를 직접 사용하여 진정한 후행 분포에서 샘플링하는 실용적이고 확장 가능한 알고리즘을 개발하기 위해.
  • 선형 연속적 밴디트에서 최고의 알려진 결과와 동일한 이론적 손실 한계를 제안된 방법에 대해 확립하기 위해.
  • 합성 및 실세계 데이터셋을 통해 방법의 성능과 효율성을 경험적으로 검증하기 위해.

제안 방법

  • 진정한 후행 분포의 근사 샘플링을 위해 랭비에르트 몬테카를로(LMC)를 사용하여 명시적인 라플라스 근사를 피하는 노이즈 있는 기울기 하강 업데이트를 수행한다.
  • 스토케스틱 기울기 업데이트 규칙을 적용: $\theta_{k+1} = \theta_k + \frac{\eta}{2} \nabla \log p(\theta | \mathcal{D}_t) + \sqrt{\eta} \xi_k$, 여기서 $\xi_k \sim \mathcal{N}(0, I)$.
  • 톰슨 샘플링과 LMC를 통합하여 현재 LMC 반복값에서 샘플링하여 행동을 선택함으로써 불확실성 인식 탐색을 가능하게 한다.
  • LMC가 온건한 조건 하에서 진정한 후행 분포에 수렴함을 활용하여 충분한 반복 횟수로 임의의 정확도를 달성할 수 있다.
  • 구조적 변경 없이 선형, 일반선형, 신경 연속적 밴디트 모델에 이 방법을 적용한다.
  • 샘플링 정확도와 계산 비용의 균형을 맞추기 위해 적응형 단계 크기와 수렴 모니터링을 사용한다.

실험 결과

연구 질문

  • RQ1진정한 후행 분포에서의 랭비에르트 몬테카를로 샘플링이 라플라스 근사 기반 톰슨 샘플링보다 손실과 계산 효율성 측면에서 뛰어나게 되는가?
  • RQ2LMC-TS는 가우시안 근사에 의존하지 않고 선형 연속적 밴디트에서 하위선형의 손실을 달성하는가?
  • RQ3라플라스 근사가 계산적으로 금기시킬 정도로 고차원 환경에서 LMC-TS는 어떻게 작동하는가?
  • RQ4LMC-TS는 일반선형 및 신경 밴디트와 같은 비선형 보상 모델에 효과적으로 적용될 수 있는가?
  • RQ5제안된 방법은 다양한 합성 및 실세계 연속적 밴디트 환경에서 확장 가능하고 강건한가?

주요 결과

  • LMC-TS는 선형 연속적 밴디트에서 최고의 톰슨 샘플링 알고리즘과 동일한 하위선형 손실 한계를 달성하여 이론적으로 경쟁력을 입증한다.
  • 일반 공분산 행렬에서의 샘플링의 계산 블로킹을 피하기 위해 행렬 역행렬 계산 대신 노이즈 있는 기울기 업데이트를 사용한다.
  • 합성 및 실세계 데이터셋에 대한 실험 결과, LMC-TS는 계산적으로 효율적이며 최신 기술과 경험적으로 경쟁 가능함을 보여준다.
  • 문제 특화 공분산 조정이 필요 없이 선형, 일반선형, 신경 연속적 밴디트 모델 전반에서 우수한 성능을 유지한다.
  • 이론적 분석을 통해 반복 횟수가 충분히 많아질수록 샘플링 오차가 감소하고 진정한 후행 분포에 수렴함을 확인한다.
  • 표준 가정 하에서 LMC-TS는 $O(\sqrt{d \log T})$의 손실 한계를 달성하며, 선형 밴디트의 알려진 최적 비율과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.