Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Bandits with Delay-Dependent Payoffs

Leonardo Cella, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|2019. 10. 07.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 4
한 줄 요약

이 논문은 음악 추천 시스템에서 영감을 얻어, 각 암의 기대 보상이 이전에 뽑힌 지 지난 시간이 길수록 증가하는 비정상적인 스토케스틱 밴딧 모델인 B2DEP를 제안한다. 이 모델은 기준 보상에 따라 상위 암들을 순환하는 랭킹 정책의 클래스를 제안하며, 이는 단지 $\mathcal{O}(k\ln\ln T)$회의 전환만으로도 $\widetilde{\mathcal{O}}(\sqrt{kT})$의 리그레트 한계를 확보하고, 최적 정책에 대해 일정 요인 내에서 근사함을 증명한다.

ABSTRACT

Motivated by recommendation problems in music streaming platforms, we propose a nonstationary stochastic bandit model in which the expected reward of an arm depends on the number of rounds that have passed since the arm was last pulled. After proving that finding an optimal policy is NP-hard even when all model parameters are known, we introduce a class of ranking policies provably approximating, to within a constant factor, the expected reward of the optimal policy. We show an algorithm whose regret with respect to the best ranking policy is bounded by $\widetilde{\mathcal{O}}\big(\!\sqrt{kT}\big)$, where $k$ is the number of arms and $T$ is time. Our algorithm uses only $\mathcal{O}\big(k\ln\ln T\big)$ switches, which helps when switching between policies is costly. As constructing the class of learning policies requires ordering the arms according to their expectations, we also bound the number of pulls required to do so. Finally, we run experiments to compare our algorithm against UCB on different problem instances.

연구 동기 및 목표

  • 사용자 참여가 동일한 콘텐츠에 반복 노출되면서 감소하는 실세계 추천 시스템(예: 음악 스트리밍 플랫폼)에서 비정상적 밴딧 모델의 필요성을 정당화한다.
  • 보상이 이전에 뽑힌 지 지난 시간에 따라 달라지는 비정상 환경에서 최적 정책을 학습하는 데 도전하는 문제를 다루며, 이 문제가 NP-난해임을 보여준다.
  • 기준 보상 순서로 정렬된 상위 $r$개의 암들을 순환하는 제한된 랭킹 정책 클래스를 제안하며, 이 정책의 기대 보상이 최적 정책의 기대 보상에 대해 일정 요인 내에 있음을 증명한다.
  • 정책 전환 비용이 높은 실생활 환경에서, 최적의 랭킹 정책에 대해 리그레트를 최소화하면서도 전환 횟수를 통제하는 학습 알고리즘을 설계한다.
  • 실험을 통해 제안된 알고리즘이 전환 비용이 존재하는 환경에서 표준 UCB보다 우수함을 보이며, 특히 비최적성 갭이 작은 경우에 두드러진다.

제안 방법

  • 각 암 $i$가 기준 보상 $\mu_i$와 지연 파라미터 $d_i$를 가지며, 이에 따라 기대 보상 $\mu_i(\tau)$가 이전에 뽑힌 지 지난 라운드 수 $\tau$에 따라 증가하고, $\tau > d_i$일 경우 $\mu_i$로 안정화되는 B2DEP 모델을 수식적으로 정의한다.
  • 기준 보상 순서로 상위 $r$개의 암을 순환하는 랭킹 정책 클래스 $\Pi_{\mathcal{K}}$를 도입하며, 이 클래스가 최적 정책에 대해 일정 요인 내에서 근사됨을 증명한다.
  • UCB1 기반의 학습 알고리즘을 설계하며, 보상 추정치를 계산할 때 각 정책의 두 번째 시행 결과만을 사용하도록 수정하여 보정을 보장하고 이전 정책 역사에 기인한 편향을 줄인다.
  • 탐색을 제한하고 전환 빈도를 낮추어 전환 비용을 줄이면서도 $\widetilde{\mathcal{O}}(\sqrt{kT})$의 리그레트 한계를 유지하는 $\pi_{\mathrm{low}}$라는 변형을 구현한다.
  • 각 랭킹 정책의 기대 보상을 추정하기 위해 가짜 정책 $\pi_{\mathrm{ghost}}$를 도입하여 실험에서 최적 정책과의 비교를 가능하게 한다.
  • 시간 수평이 사전에 알려져 있지 않은 상황에서 알고리즘이 작동할 수 있도록, 시간 수평에 대한 사전 지식이 없어도 되도록 듀얼링 트릭 또는 유사한 방법을 적용한다.

실험 결과

연구 질문

  • RQ1B2DEP 모델에서 최적의 주기적 정책을 찾는 문제는 모든 모델 파라미터가 알려져 있을지라도 NP-난해인가?
  • RQ2기준 보상 기대치 순서로 상위 $r$개의 암을 순환하는 제한된 랭킹 정책 클래스가 최적 정책의 기대 보상에 대해 일정 요인 내에서 근사할 수 있는가?
  • RQ3최적의 랭킹 정책에 대해 리그레트가 비선형이면서도 정책 전환 횟수를 최소화하는 학습 알고리즘을 설계할 수 있는가?
  • RQ4제안된 알고리즘의 성능은 전환 비용이 존재할 때 표준 UCB와 비교해 리그레트와 전환 비용 측면에서 어떻게 되는가? 특히 비최적성 갭이 작은 경우에 대해 설명한다.
  • RQ5두 개의 양호한 정책 간 전환은 단일 최적 정책을 고수하는 것보다 더 높은 평균 기대 보상을 얻을 수 있는가? 이러한 조건은 리그레트에 어떤 영향을 미치는가?

주요 결과

  • B2DEP 모델에서 최적의 주기적 정책을 찾는 문제는 모든 모델 파rameter가 알려져 있을지라도, 주기적 유지보수 스케줄링 문제로의 환원을 통해 NP-난해임을 입증한다.
  • 기준 보상 기대치 순서로 상위 $r$개의 암을 순환하는 랭킹 정책 클래스는 최적 정책의 기대 보상에 대해 일정 요인 내에서 근사된다.
  • 제안된 학습 알고리즘은 최적의 랭킹 정책에 대해 $\widetilde{\mathcal{O}}(\sqrt{kT})$의 리그레트 한계를 확보한다. 여기서 $k$는 암의 수이고 $T$는 시간 수평이다.
  • 정책 전환 횟수는 $\mathcal{O}(k\ln\ln T)$로 제한되며, 이는 정책 전환이 비용이 많이 드는 상황에서 유리하다.
  • 실험 결과, 전환 횟수를 제한하는 $\pi_{\mathrm{low}}$가 전환 비용이 존재하는 환경에서 UCB보다 우수한 성능을 보이며, 특히 비최적성 갭이 작은 경우에 두드러진다.
  • 사실 1은 두 랭킹 정책이 동일하게 최적일 경우, 이들 사이를 전환하는 것이 단독으로 하나의 정책을 사용하는 것보다 더 높은 평균 기대 보상을 얻을 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.