Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Bandits with Stochastic Experts

Rajat Sen, Karthikeyan Shanmugam|arXiv (Cornell University)|2018. 02. 23.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 4
한 줄 요약

이 논문은 확률적 전문가를 갖는 컨텍스트 밴디트에 대해 UCB 기반 알고리즘을 제안하며, 중요도 샘플링 추정기법을 사용해 전문가 간의 정보 泄漏를 활용한다. 이는 $\mathcal{O}(\lambda(\boldsymbol{\mu})\mathcal{M}\log T/\Delta)$의 인스턴스에 의존하는 리그레트 한계를 달성하며, $\lambda(\boldsymbol{\mu})$는 일반적으로 $\mathcal{O}(\log N)$이다. 또한 최신 기법들과 비교해 실제 데이터셋에서 뛰어난 경험적 성능을 보인다.

ABSTRACT

We consider the problem of contextual bandits with stochastic experts, which is a variation of the traditional stochastic contextual bandit with experts problem. In our problem setting, we assume access to a class of stochastic experts, where each expert is a conditional distribution over the arms given a context. We propose upper-confidence bound (UCB) algorithms for this problem, which employ two different importance sampling based estimators for the mean reward for each expert. Both these estimators leverage information leakage among the experts, thus using samples collected under all the experts to estimate the mean reward of any given expert. This leads to instance dependent regret bounds of $\mathcal{O}\left(λ(\pmbμ)\mathcal{M}\log T/Δ ight)$, where $λ(\pmbμ)$ is a term that depends on the mean rewards of the experts, $Δ$ is the smallest gap between the mean reward of the optimal expert and the rest, and $\mathcal{M}$ quantifies the information leakage among the experts. We show that under some assumptions $λ(\pmbμ)$ is typically $\mathcal{O}(\log N)$, where $N$ is the number of experts. We implement our algorithm with stochastic experts generated from cost-sensitive classification oracles and show superior empirical performance on real-world datasets, when compared to other state of the art contextual bandit algorithms.

연구 동기 및 목표

  • 컨텍스트 밴디트에서 결정론적 전문가의 한계를 해결하기 위해 조건부 액션 분포를 갖는 확률적 전문가를 도입한다.
  • 전문가 간의 정보 泄漏를 활용해 리그레트 성능을 향상시키는 UCB 스타일 알고리즘을 개발한다.
  • 전문가 유사성과 보상 갭에 따라 달라지는 인스턴스에 의존하는 리그레트 한계를 유도한다. 이는 단지 액션의 수에 의존하는 것이 아니라.
  • 비용 감도 분류기 오라클을 사용해 실제 데이터셋에서 제안된 알고리즘의 경험적 타당성을 검증한다.
  • 단지 액션의 수가 아니라 전문가 간 분산과 보상 갭에 따라 스케일링되는 이론적 보장을 제공한다.

제안 방법

  • 모든 전문가 하에서 수집된 샘플들로부터 중요도 샘플링 추정기법을 사용해 전문가 평균 보상을 추정하는 두 가지 UCB 기반 알고리즘을 제안한다.
  • 비용 감도 분류기 오라클을 사용해 주기적으로 새로운 확률적 전문가를 추가하는 배치 학습 절차를 도입한다.
  • 보상 추정의 정확도를 높이고 분산을 줄이기 위해 중위수의 모멘트(MOM) 추정기와 표본 평균 추정기를 활용한다.
  • 전문가 간의 분산 측도를 사용해 정보 泄漏를 정량화하며, 이는 $\mathcal{M}$ 항을 통해 리그레트 한계에 영향을 준다.
  • 부트스트래핑과 校정된 분류기(XGBoost, 로지스틱 회귀)를 사용해 다양한 확률적 전문가를 생성한다.
  • 알고리즘을 배치 단위로 구동하며, 탐색과 적응의 균형을 위해 $\mathcal{O}(\sqrt{t})$ 단위 간격으로 전문가와 분산 추정치를 갱신한다.

실험 결과

연구 질문

  • RQ1확률적 전문가 간의 정보 泄漏를 활용해 컨텍스트 밴디트에서 리그레트를 감소시킬 수 있는가?
  • RQ2확률적 전문가 간 중요도 샘플링을 사용할 경우, 어떤 인스턴스에 의존하는 리그레트 한계를 달성할 수 있는가?
  • RQ3실제 데이터에서 확률적 전문가를 갖는 UCB 알고리즘의 성능은 최신 기법들과 비교해 어떻게 되는가?
  • RQ4이론적 리그레트 한계를 액션의 수가 아닌 전문가 간 분산과 보상 갭에 따라 표현할 수 있는가?
  • RQ5교정된, 확률적인 전문가를 사용할 경우, 결정론적 또는 탐욕적 기반선 대비 경험적 성능이 향상되는가?

주요 결과

  • 중위수의 모멘트 추정을 사용한 제안된 D-UCB 알고리즘은 효모 데이터셋에서 평균 손실 0.61을 기록하며, 배깅(0.63) 및 기타 기반선들을 능가한다.
  • 스트림 분석 데이터셋에서는 D-UCB-MOM이 평균 손실 9%로 수렴하며, 배깅(8%)의 성능에 매우 가까이 도달한다. 이는 이론적 보장을 제공한다.
  • 문자 데이터셋에서는 D-UCB-MOM이 모든 다른 알고리즘을 크게 앞서며, 고차원, 다중 클래스 환경에서 뚜렷한 경험적 우수성을 보여준다.
  • 이론적 리그레트 한계는 $\mathcal{O}(\lambda(\boldsymbol{\mu})\mathcal{M}\log T/\Delta)$로 스케일링되며, $\lambda(\boldsymbol{\mu})$는 일반적으로 $\mathcal{O}(\log N)$이므로 전문가 수에 대해 유리한 스케일링을 보인다.
  • 전문가 수가 증가함에 따라 보상 갭에 의존하는 리그레트 항이 UCB-1 기준보다 더 천천히 증가하며, 특히 스트림 분석 데이터셋에서 두드러진다.
  • 모든 데이터셋에서 고정된 상수와 기본 분류기만을 사용해 초모수 조정 없이도 강력한 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.