Skip to main content
QUICK REVIEW

[논문 리뷰] Variational inference for the multi-armed contextual bandit

Iñigo Urteaga, Chris H. Wiggins|arXiv (Cornell University)|2017. 09. 10.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 7
한 줄 요약

이 논문은 복잡하고 알려지지 않은 보상 분포를 가우시안 혼합 모델을 통해 근사하기 위해 변분 추론을 사용하는 문맥적 다익음 밴드잇에 대한 변분 톰슨 샘플링(VTS)을 제안한다. 진정한 보상 분포로의 KL 발산을 최소화하는 변분 매개변수를 학습함으로써, VTS는 모형 오특사정이 있을 경우에도 누적 누적 손실을 크게 감소시켜, 제약적인 파rametric 가정을 수반하는 표준 톰슨 샘플링을 능가한다.

ABSTRACT

In many biomedical, science, and engineering problems, one must sequentially decide which action to take next so as to maximize rewards. One general class of algorithms for optimizing interactions with the world, while simultaneously learning how the world operates, is the multi-armed bandit setting and, in particular, the contextual bandit case. In this setting, for each executed action, one observes rewards that are dependent on a given 'context', available at each interaction with the world. The Thompson sampling algorithm has recently been shown to enjoy provable optimality properties for this set of problems, and to perform well in real-world settings. It facilitates generative and interpretable modeling of the problem at hand. Nevertheless, the design and complexity of the model limit its application, since one must both sample from the distributions modeled and calculate their expected rewards. We here show how these limitations can be overcome using variational inference to approximate complex models, applying to the reinforcement learning case advances developed for the inference case in the machine learning community over the past two decades. We consider contextual multi-armed bandit applications where the true reward distribution is unknown and complex, which we approximate with a mixture model whose parameters are inferred via variational inference. We show how the proposed variational Thompson sampling approach is accurate in approximating the true distribution, and attains reduced regrets even with complex reward distributions. The proposed algorithm is valuable for practical scenarios where restrictive modeling assumptions are undesirable.

연구 동기 및 목표

  • 문맥적 밴드잇 설정에서 제약적인 파라미터 모형을 초월한 톰슨 샘플링의 확장.
  • 진정한 분포가 복잡하거나 알려지지 않았을 때 보상 모델링에서의 모형 오특사정 문제 해결.
  • 혼합 모델을 사용하여 정확하고 해석 가능하며 유연한 보상 분포 모델링 가능.
  • 변분 추론을 통해 복잡한 보상 구조를 학습하여 불확실성 하에서 순차적 의사결정에서 누적 손실을 감소.
  • 강한 파라미터 모형 가정 없이도 스케일링 가능하고 원칙적인 방법으로 온라인 학습을 수행하는 것.

제안 방법

  • 문맥적 밴드잇에서 복잡하고 알려지지 않은 보상 분포를 표현하기 위해 계층적 베이지안 혼합 모델을 사용.
  • 가우시안 혼합 모델의 매개변수를 학습하기 위해 평균장 근사와 함께 변분 추론을 적용.
  • 정확한 분포 추정을 보장하기 위해 진정한 사후분포와 변분 근사 간의 클로이비츠-레이블러 발산(KL 발산)을 최소화.
  • 변분 톰슨 샘플링을 활용: 변분 사후분포에서 샘플을 추출하여 탐색과 이용의 균형을 이룸.
  • 증거 하한 경계(ELBO) 최적화를 통해 변분 매개변수에 대한 폐형 업데이트 식 유도.
  • 새로운 문맥-보상 쌍이 도착함에 따라 변분 매개변수를 점진적으로 업데이트함으로써 온라인 학습 통합.

실험 결과

연구 질문

  • RQ1변분 추론은 문맥적 밴드잇에서 복잡하고 가우시안 가족 외의 분포를 효과적으로 근사하는 데 사용될 수 있는가?
  • RQ2모형 오특사정이 있을 경우, 변분 톰슨 샘플링은 표준 톰슨 샘플링보다 누적 손실을 줄일 수 있는가?
  • RQ3복잡한 보상 상황에서 모델의 유연성(예: 혼합 성분 수)은 손실과 추정 정확도에 어떤 영향을 미치는가?
  • RQ4진정한 보상 분포가 비대칭적이거나 겹치는 경우에도 제안된 방법은 정확한 기대 보상 추정치를 학습할 수 있는가?
  • RQ5온라인 순차적 의사결정에서 모델 복잡성과 손실 성능 간의 상충 관계는 어떠한가?

주요 결과

  • 비대칭적이고 겹치는 보상 혼합이 있는 시나리오 B에서, K=3 성분을 사용한 VTS는 t=500일 때 K=1을 사용한 VTS보다 누적 손실을 40% 감소시켰다.
  • K=3을 사용한 VTS는 진정한 모형(K=2)과 비교해 유사한 손실 성능을 달성하여 모형 복잡성에 대한 강건성을 입증했다.
  • 복잡한 상황에서 기대 보상 추정의 MSE는 K=2 및 K=3을 사용한 VTS가 K=1을 사용한 경우보다 유의미하게 낮아, 학습 정확도 향상을 시사한다.
  • 간단한 상황(시나리오 A)에서도 K=1을 사용한 VTS는 잘 작동했지만, 더 높은 K 모델의 유연성 덕분에 복잡성 상황에서 뛰어난 성능을 발휘했다.
  • 변분 근사는 KL 발산을 효과적으로 최소화하여 정확한 사후분포 샘플링과 향상된 의사결정을 가능하게 했다.
  • 이 방법은 다양한 보상 구조에서 낮은 손실을 유지하며, 제약적인 파라미터 모형 가정 없이도 강력한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.