Skip to main content
QUICK REVIEW

[논문 리뷰] Cost-aware Cascading Bandits

Ruida Zhou, Chao Gan|arXiv (Cornell University)|2018. 05. 22.
Advanced Bandit Algorithms Research참고 문헌 3인용 수 6
한 줄 요약

이 논문은 항목을 검토하는 데에 랜덤하고 이질적인 비용을 고려하는 비용 인식 캐스케ading 밴디트(Cost-aware Cascading Bandits, CCB) 모델을 도입한다. 이는 캐스케ading 밴디트를 확장한 것으로, 온라인 학습을 위한 CC-UCB 알고리즘을 제안하고, $O(\log T)$의 순서 최적의 리그레트 스케일링을 증명하며, 이에 대응하는 하한값도 제시한다. 또한 통계가 알려진 상황에서 최적의 오프라인 정책인 UCR-T1을 규명한다.

ABSTRACT

In this paper, we propose a cost-aware cascading bandits model, a new variant of multi-armed ban- dits with cascading feedback, by considering the random cost of pulling arms. In each step, the learning agent chooses an ordered list of items and examines them sequentially, until certain stopping condition is satisfied. Our objective is then to max- imize the expected net reward in each step, i.e., the reward obtained in each step minus the total cost in- curred in examining the items, by deciding the or- dered list of items, as well as when to stop examina- tion. We study both the offline and online settings, depending on whether the state and cost statistics of the items are known beforehand. For the of- fline setting, we show that the Unit Cost Ranking with Threshold 1 (UCR-T1) policy is optimal. For the online setting, we propose a Cost-aware Cas- cading Upper Confidence Bound (CC-UCB) algo- rithm, and show that the cumulative regret scales in O(log T ). We also provide a lower bound for all α-consistent policies, which scales in Ω(log T ) and matches our upper bound. The performance of the CC-UCB algorithm is evaluated with both synthetic and real-world data.

연구 동기 및 목표

  • 캐스케ading 밴디트에 랜덤하고 이질적인 비용을 갖는 순차적 항목 검토를 모델링하기 위해.
  • 암 부동태 및 비용 통계가 알려진 경우 최적의 오프라인 정책을 규명하기 위해.
  • 사전 통계 없이도 탐색과 비용 인식 순위를 균형 잡는 온라인 알고리즘을 설계하기 위해.
  • 제안된 알고리즘에 대해 순서 최적의 리그레트 한계를 설정하기 위해.
  • Yandex 클릭 로그에서 얻은 합성 및 실세계 데이터를 사용하여 성능을 검증하기 위해.

제안 방법

  • 각 암 풀 시도에 랜덤 비용이 발생하고, 정지하기 전에 상태 1의 항목이 발견되어야만 보상이 발생하는 비용 인식 캐스케ading 밴디트(CCB) 모델을 제안한다.
  • 최적의 오프라인 전략으로서 단위 비용 순위 기반 임계값 1(UCR-T1) 정책을 도입하여, 암을 $\theta_i / c_i$ 기준으로 순위를 매기고 첫 번째 성공 후 정지한다.
  • 비용과 보상 추정을 균형 잡기 위해 UCB 스타일 탐색을 사용하는 비용 인식 캐스케ading 상한 신뢰도(CC-UCB) 알고리즘을 개발한다.
  • 잘못된 암 순위 매기기 및 비최적의 정지 시점이라는 두 가지 오류 사건을 분석하여 상한 및 하한 리그레트 한계를 유도한다.
  • CC-UCB에서 비용을 최소화하면서도 보상 확률을 유지하기 위해 임계값 기반의 정지 규칙을 사용한다.
  • 합성 및 실세계 데이터(Yandex 클릭 로그)를 사용하여 다양한 비용 및 보상 조건 하에서 알고리즘 성능을 평가한다.

실험 결과

연구 질문

  • RQ1암 상태 및 비용 통계가 알려진 경우 비용 인식 캐스케ading 밴디트의 최적 정책은 무엇인가?
  • RQ2사전 통계가 없는 상황에서 온라인 알고리즘이 비용과 보상을 효과적으로 균형 잡는 방법은 무엇인가?
  • RQ3이 설정에서 어떤 $\alpha$-일致 정책에 대해서도 리그레트의 기본 한계는 무엇인가?
  • RQ4CC-UCB 알고리즘의 성능은 암의 수와 비용 분산과 같은 시스템 파라미터에 따라 어떻게 스케일링되는가?
  • RQ5비.i.i.d. 행동을 보이는 실세계 데이터에서 CC-UCB 알고리즘이 비선형 리그레트를 유지하는가?

주요 결과

  • UCR-T1 정책은 오프라인 설정에서 최적임을 증명하였으며, 암을 $\theta_i / c_i$ 기준으로 순위 매기고 첫 번째 성공 후 정지한다.
  • CC-UCB 알고리즘은 $O(\log T)$의 누적 리그레트를 달성하며, 유도된 $\Omega(\log T)$ 하한값과 일치하여 순서 최적성임을 입증한다.
  • 비용 통계가 알려진 경우 리그레트가 크게 감소한다. 예를 들어 $K=6$, $L=3$, $\Delta_{L+1}=0.1$ 일 때 $T=10^5$에서 352.88 대비 1,445.3 감소.
  • 리그레트는 $K$가 증가할수록 증가하고 $L$이 증가할수록 감소하며, $c$가 알려지지 않은 경우 특히 $\Delta_{L+1}$가 감소할수록 더 높아진다.
  • 실세계 Yandex 데이터에서는 누적 리그레트가 비선형적으로 증가하고 비용 $c$와 함께 단조적으로 증가하여 이론적 스케일링을 확인한다.
  • 실세계 데이터에서 i.i.d. 가정이 약간만 만족되더라도 알고리즘이 강인함을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.