Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying the stochastic and the adversarial Bandits with Knapsack

Anshuka Rangi, Massimo Franceschetti|arXiv (Cornell University)|2018. 10. 23.
Advanced Bandit Algorithms Research참고 문헌 15인용 수 3
한 줄 요약

이 논문은 보상이 비용을 초과해야 한다는 제한적인 가정 없이 순서적으로 최적의 리그레트를 달성하는 새로운 알고리즘인 EXP3.BwK와 EXP3++.BwK를 제안한다. 이 알고리즘들은 스위치적 및 적대적 설정 모두에서 성능을 통합하여, 적대적 경우에서는 $O(\sqrt{KB})$의 리그레트를, 스위치적 경우에서는 $O(\log B)$의 리그레트를 제공하며, EXP3++.BwK의 경우 추가로 $\log B$ 요소가 있다.

ABSTRACT

This paper investigates the adversarial Bandits with Knapsack (BwK) online learning problem, where a player repeatedly chooses to perform an action, pays the corresponding cost, and receives a reward associated with the action. The player is constrained by the maximum budget $B$ that can be spent to perform actions, and the rewards and the costs of the actions are assigned by an adversary. This problem has only been studied in the restricted setting where the reward of an action is greater than the cost of the action, while we provide a solution in the general setting. Namely, we propose EXP3.BwK, a novel algorithm that achieves order optimal regret. We also propose EXP3++.BwK, which is order optimal in the adversarial BwK setup, and incurs an almost optimal expected regret with an additional factor of $\log(B)$ in the stochastic BwK setup. Finally, we investigate the case of having large costs for the actions (i.e., they are comparable to the budget size $B$), and show that for the adversarial setting, achievable regret bounds can be significantly worse, compared to the case of having costs bounded by a constant, which is a common assumption within the BwK literature.

연구 동기 및 목표

  • 스위치적 및 적대적 밴디트 with 컨스트레인트(BwK) 설정에서 둘 다 잘 작동하는 알고리즘이 부족한 문제를 해결한다.
  • 이전 연구에서 적대적 BwK에서 보상이 비용을 초과해야 한다는 제한적인 가정을 제거한다.
  • 스위치적 및 적대적 BwK에서 모두 순서적으로 최적의 리그레트를 달성하는 통합 알고리즘 프레임워크를 제공한다.
  • 큰 액션 비용(예산 B와 유사한 크기)이 적대적 BwK에서 리그레트 한계에 미치는 영향을 분석한다.
  • 물리적 또는 차원 비교 가능성 가정 없이 일반적인 보상-비용 설정에서도 유효한 이론적 리그레트 보장을 수립한다.

제안 방법

  • 예산 제약 하에 탐색과 이용의 균형을 이루기 위해 시간에 따라 변하는 학습률 $\gamma_t = 0.5\sqrt{c_{\text{min}}^2 \log K / Kt}$를 사용하는 EXP3.BwK를 도입하여 EXP3 알고리즘을 BwK 설정으로 확장한다.
  • 더 적극적인 탐색 스케줄을 통합함으로써 스위치적 설정에서 리그레트 한계를 향상시키는 개선된 변종인 EXP3++.BwK를 제안한다.
  • 손실 및 보상 추정의 추정 오차를 제어하기 위해 $\epsilon_t(i) \leq 0.5c_{\text{min}}\sqrt{\log K / tK}$의 신뢰도 기반 탐색 전략을 사용한다.
  • 집중 불등식과 마틴게일 추론을 적용하여 추정 오차, 탐색, 학습률 항으로 분해된 기대 리그레트를 경계한다.
  • 컨스트레인트의 구조를 활용하기 위해 예산이 소진될 때의 정지 시간 $\tau(E)$를 정의하고, $T = \max\{T(i^*), \tau(E)\}$까지의 리그레트를 분석한다.
  • 크로프포르 유형의 불등식과 합계 불등식을 조합하여 리그레트 한계를 유도하며, 특히 $\sum_t \exp(-\gamma_t \tilde{\Delta}_t(i))$와 같은 항을 적분 및 渐近 분석을 통해 경계한다.

실험 결과

연구 질문

  • RQ1보상이 비용을 초과해야 한다는 가정 없이도 단일 알고리즘이 스위치적 및 적대적 BwK에서 모두 순서적으로 최적의 리그레트를 달성할 수 있는가?
  • RQ2큰 액션 비용(예산 B와 유사한 크기)이 적대적 BwK에서 달성 가능한 리그레트에 어떤 영향을 미치는가?
  • RQ3EXP3 프레임워크는 어떻게 컨스트레인트를 처리하면서도 최적의 리그레트 보장을 유지할 수 있는가?
  • RQ4스위치적 BwK 설정에서 리그레트를 $O(\log B)$로 향상시킬 수 있으며, 同시에 적대적 경우에 $O(\sqrt{KB})$ 리그레트를 유지할 수 있는가?
  • RQ5비용이 상수로 유계되지 않고 예산 B에 따라 스케일링될 경우, 리그레트의 이론적 한계는 무엇인가?

주요 결과

  • EXP3.BwK는 보상-비용 우세성 가정 없이도 적대적 BwK 설정에서 $O(\sqrt{KB})$의 기대 리그레트를 달성하며, 이는 순서적으로 최적이다.
  • EXP3++.BwK는 스위치적 BwK 설정에서 $O(\log B)$의 기대 리그레트를 달성하며 추가로 $\log B$ 요소가 있으므로 거의 최적이다.
  • EXP3.BwK의 리그레트 한계는 $O\left(\sqrt{BK\log K / c_{\text{min}}^3}\right)$이며, 최소 비용 $c_{\text{min}}$에 대한 의존성을 보여준다.
  • 비용이 클 경우(예산 B와 유사한 크기일 경우), 적대적 BwK 설정에서 달성 가능한 리그레트 한계는 유계 비용 케이스보다 상당히 악화될 수 있다.
  • 분석 결과, 이전 연구에서 흔히 사용되는 비용의 유계성 가정이 핵심적임을 확인하였으며, 이 가정이 없을 경우 리그레트 보장이 상당히 악화된다.
  • 집중 불등식과 지수 항의 합계를 사용하여 이론적 한계를 도출하였으며, 주요 단계는 레마 10과 $\sum_t \exp(-\gamma_t \tilde{\Delta}_t(i))$에 대한 경계에 기반한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.