Skip to main content
QUICK REVIEW

[논문 리뷰] Perturbed-History Exploration in Stochastic Linear Bandits

Branislav Kveton, Csaba Szepesvári|arXiv (Cornell University)|2019. 03. 21.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 7
한 줄 요약

이 논문은 실제 보상과 i.i.d. 가짜 보상(가짜 보상은 실제 보상과 동일한 분포에서 유래됨)을 혼합하여 히스토리에 편향을 주는 방식을 통해 탐색과 이용의 균형을 이루는 새로운 스토하스틱 선형 밴디트 알고리즘인 LinPHE를 제안한다. 이 알고리즘은 가중합에 대한 새로운 농도 및 반농도 불등식을 통해 $d$가 특징 차원일 때 $n$라운드에 대해 $ ilde{O}(dar{d}ar{n})$의 갭-프리 리그레트 한계를 달성한다.

ABSTRACT

We propose a new online algorithm for cumulative regret minimization in a stochastic linear bandit. The algorithm pulls the arm with the highest estimated reward in a linear model trained on its perturbed history. Therefore, we call it perturbed-history exploration in a linear bandit (LinPHE). The perturbed history is a mixture of observed rewards and randomly generated i.i.d. pseudo-rewards. We derive a $ ilde{O}(d \sqrt{n})$ gap-free bound on the $n$-round regret of LinPHE, where $d$ is the number of features. The key steps in our analysis are new concentration and anti-concentration bounds on the weighted sum of Bernoulli random variables. To show the generality of our design, we generalize LinPHE to a logistic model. We evaluate our algorithms empirically and show that they are practical.

연구 동기 및 목표

  • 일반선형 밴디트에서 신뢰집합이 느슨하고 사후 샘플링이 계산적으로 비효율적인 기존 탐색 전략(예: OFU 및 톰슨 샘플링)의 한계를 해결하기 위해.
  • 사후 샘플링이나 느슨한 신뢰집합에 의존하지 않는 간단하고 일반화 가능한 탐색 메커니즘을 개발하기 위해.
  • 편향된 학습 데이터를 기반으로 한 새로운 탐색 전략에 대해 선형 밴디트에서 이론적 보장을 제공하기 위해.
  • 제안된 방법을 로지스틱 밴디트로 확장하여 선형 모델을 초월한 일반성도 입증하기 위해.

제안 방법

  • 실제로 관측된 보상과 동일한 분포에서 유래된 i.i.d. 가짜 보상을 혼합하여 히스토리를 편향시킨다.
  • 편향된 히스토리에서 선형 모델을 학습하여 암호의 보상을 추정하며, 모델 피팅을 위해 오프라인 오라클을 사용한다.
  • 각 라운드에서 편향된 모델 하에 예측 보상이 가장 높은 암호를 선택한다.
  • 정규화를 적용한 가중 최소제곱법을 사용하여 편향된 데이터로부터 매개변수 벡터 $\theta_t$를 추정한다.
  • 가중합에 대한 새로운 농도 및 반농도 불등식을 활용하여 알고리즘의 행동을 분석한다.
  • 동일한 편향된 히스토리에서 학습된 로지스틱 회귀 모델을 사용하여 LinPHE를 로지스틱 밴디트(LogPHE)로 일반화한다.

실험 결과

연구 질문

  • RQ1후행 샘플링이나 신뢰집합에 의존하지 않고도 단순한 편향 기반 탐색 전략이 스토하스틱 선형 밴디트에서 최적의 리그레트 한계를 달성할 수 있는가?
  • RQ2편향된 학습 데이터를 기반으로 한 탐색 전략에 대해 선형 밴디트에서 이론적 보장을 도출할 수 있는가?
  • RQ3가중합에 대한 새로운 농도 및 반농도 불등식이 LinPHE의 분석에 어떻게 기여하는가?
  • RQ4편향된 히스토리 탐색 프레임워크는 로지스틱 회귀와 같은 비선형 모델로 일반화될 수 있는가?
  • RQ5톰슨 샘플링 대비 LinPHE의 리그레트 및 실용적 성능 측면에서의 경험적 성능 비교는 어떻게 이루어지는가?

주요 결과

  • LinPHE는 $n$라운드 스토하스틱 선형 밴디트에서 $d$가 특징 수일 때 $ ilde{O}(d\sqrt{n})$의 갭-프리 리그레트 한계를 달성한다.
  • 분석은 i.i.d. 베르누이 랜덤 변수의 가중합에 대한 새로운 농도 및 반농도 부등식에 기반한다.
  • i.i.d. 가짜 보상을 사용한 편향 메커니즘은 사후 샘플링이나 느슨한 신뢰집합 없이도 충분한 탐색을 유도한다.
  • 알고리즘은 로지스틱 밴디트로 일반화 가능하며, 이로 인해 동일한 리그레트 보장을 갖는 새로운 알고리즘인 LogPHE가 도출된다.
  • 경험적 평가 결과, LinPHE 및 LogPHE는 원칙적으로 다른 점이 있음에도 불구하고 실용적으로 톰슨 샘플링과 경쟁 가능하다.
  • 편향의 분산은 불확실성에 대한 낙관주의를 확보하기 위해 정교하게 조정되어 있어 효과적인 탐색을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.