Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable Linear Bandit Algorithm

Kaige Yang, Laura Toni|arXiv (Cornell University)|2020. 06. 04.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 5
한 줄 요약

이 논문은 경사수렴을 통해 신뢰구간을 학습하는 미분가능한 선형 밴디트 알고리즘인 SoftUCB를 제안한다. 이는 데이터 적응형 탐색-이점 균형을 가능하게 하며, 하드한 argmax를 미분가능한 소프트맥스 기반 선택으로 대체하고 경사 추정기(gradient estimator)를 도입함으로써 UCB와 LinTS보다 낮은 누적손실(regret)을 달성한다. 학습된 신뢰구간($ \hat{\beta}$)은 이론적 구간보다 크게 작다.

ABSTRACT

Upper Confidence Bound (UCB) is arguably the most commonly used method for linear multi-arm bandit problems. While conceptually and computationally simple, this method highly relies on the confidence bounds, failing to strike the optimal exploration-exploitation if these bounds are not properly set. In the literature, confidence bounds are typically derived from concentration inequalities based on assumptions on the reward distribution, e.g., sub-Gaussianity. The validity of these assumptions however is unknown in practice. In this work, we aim at learning the confidence bound in a data-driven fashion, making it adaptive to the actual problem structure. Specifically, noting that existing UCB-typed algorithms are not differentiable with respect to confidence bound, we first propose a novel differentiable linear bandit algorithm. Then, we introduce a gradient estimator, which allows the confidence bound to be learned via gradient ascent. Theoretically, we show that the proposed algorithm achieves a $ ilde{\mathcal{O}}(\hatβ\sqrt{dT})$ upper bound of $T$-round regret, where $d$ is the dimension of arm features and $\hatβ$ is the learned size of confidence bound. Empirical results show that $\hatβ$ is significantly smaller than its theoretical upper bound and proposed algorithms outperforms baseline ones on both simulated and real-world datasets.

연구 동기 및 목표

  • 강한 분포가정에 의존하는 UCB 유형의 선형 밴디트 알고리즘에서 고정된, 보수적인 신뢰구간의 한계를 해결하기 위해.
  • 기대 누적보상이 신뢰구간에 대해 미분 가능하도록 함으로써 데이터 기반의 적응형 신뢰구간 학습을 가능하게 하기 위해.
  • 오프라인 및 온라인 설정 모두에서 반복적 상승(iterative ascent)을 통한 신뢰구간 최적화를 가능하게 하는 경사 추정기(gradient estimator)를 개발하기 위해.
  • 문제의 구조를 반영하는 더 날카운 신뢰구간을 학습함으로써 선형 밴디트 문제에서의 누적손실을 줄이기 위해.
  • 학습된 신뢰구간($\\hat{\\beta}$)이 실제 이론적 최악의 경우 구간보다 크게 작으며, 실용적 성능 향상에 기여함을 입증하기 위해.

제안 방법

  • 예측 보상과 불확실성에 기반해 열 劣 劣한 암과 비열 劣한 암을 구분하는 새로운 미분가능한 UCB 인덱스를 제안한다.
  • 비미분가능한 argmax를 대체하기 위해 소프트맥스 기반 암 선택 정책을 도입함으로써, 신뢰구간에 대해 경사 계산이 가능하도록 한다.
  • 기대 누적보상이 신뢰구간 크기 $\\beta$에 대해 미분 가능하도록 하며, 이는 경사상승 최적화를 가능하게 한다.
  • 두 가지 학습 제도를 개발한다: SoftUCB 오프라인(이력 데이터에 대한 전체 배치 경사상승을 통한 $\\hat{\\beta}$ 최적화)과 SoftUCB 온라인(각 라운드마다 적응적인 $\\hat{\\beta}$ 업데이트).
  • 예측된 신뢰구간 $\\hat{\\beta}$가 이론적 구간인 $|\\hat{\\mu}_{i,t} - \mu_i| \leq \beta \|\\mathbf{x}_i\|_{\\mathbf{V}_t^{-1}}$를 만족하도록 라그랑주 제약 조건을 구현한다.
  • 열 劣한 암의 선택 확률을 줄이는 소프트 제거 메커니즘을 구현함으로써 수렴 속도를 가속화한다.

실험 결과

연구 질문

  • RQ1UCB 유형의 선형 밴디트 알고리즘에서 신뢰구간을 경사 기반 최적화를 통해 종단간(end-to-end)으로 학습할 수 있는가?
  • RQ2UCB 인덱스의 미분가능한 제작이 효과적인 적응형 신뢰구간 학습을 가능하게 하고 누적손실을 줄일 수 있는가?
  • RQ3실제로 학습된 신뢰구간 $\\hat{\\beta}$는 이론적 최악의 경우 구간과 비교해 어떻게 성능을 보이는가?
  • RQ4제안된 방법은 합성 및 실세계 설정 모두에서 기준선인 LinUCB, LinTS, $\\epsilon$-greedy를 능가할 수 있는가?
  • RQ5학습된 $\\hat{\\beta}$는 라그랑주 승수 $\\eta$와 같은 초모수에 얼마나 민감한가? 이는 강건성에 어떤 영향을 미치는가?

주요 결과

  • 모든 실험 설정에서 학습된 신뢰구간 $\\hat{\\beta}$는 이론적 상한 $\\tilde{\\beta}$보다 크게 작으며, 이는 보수성 감소를 시사한다.
  • 오프라인 설정에서 SoftUCB는 $\\tilde{\\mathcal{O}}(\\hat{\\beta}\\sqrt{dT})$의 누적손실 상한을 달성한다. 여기서 $\\hat{\\beta}$는 데이터 적응형 신뢰구간 크기이다.
  • 실증 결과에 따르면, SoftUCB는 합성 및 실세계 데이터셋 양측에서 LinUCB, LinTS, $\\epsilon$-greedy보다 누적손실 측면에서 뛰어난 성능을 보였다.
  • $\\hat{\\beta}$의 수렴은 라그랑주 승수 $\\eta$에 민감하다. 너무 크거나 너무 작은 값은 수렴 실패 또는 최적의 암을 잘못 제거하는 결과를 초래한다.
  • 온라인 설정에서 SoftUCB 온라인은 초기에 균일한 선택으로 인해 높은 누적손실을 경험하지만, 이후에 매우 빠르게 수렴한다.
  • 소프트 제거 메커니즘은 열 劣한 암의 선택 확률을 줄여 수렴 속도를 가속화하고, 이는 낮은 누적손실에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.