Skip to main content
QUICK REVIEW

[논문 리뷰] Non-stationary Bandits with Knapsacks

Shang Liu, Jiashuo Jiang|arXiv (Cornell University)|2022. 05. 25.
Advanced Bandit Algorithms Research인용 수 6
한 줄 요약

이 논문은 보상과 자원 분포가 시간에 따라 변화하는 비정상적인 밴디트 with 컨스트레인트(BwK) 프레임워크를 제안하며, 비정상성을 캡처하기 위해 새로운 글로벌 변동 예산 측정법을 도입한다. 슬라이딩 윈도우 UCB 알고리즘을 통해 근사 최적의 리그레트 경계를 확립하고, 제약 조건이 있는 온라인 볼록 최적화(OCOwC)로 분석을 확장하여, 기존의 변동 예산 측정법이 제약 조건 간섭으로 인해 부적절하다는 것을 보여준다.

ABSTRACT

In this paper, we study the problem of bandits with knapsacks (BwK) in a non-stationary environment. The BwK problem generalizes the multi-arm bandit (MAB) problem to model the resource consumption associated with playing each arm. At each time, the decision maker/player chooses to play an arm, and s/he will receive a reward and consume certain amount of resource from each of the multiple resource types. The objective is to maximize the cumulative reward over a finite horizon subject to some knapsack constraints on the resources. Existing works study the BwK problem under either a stochastic or adversarial environment. Our paper considers a non-stationary environment which continuously interpolates between these two extremes. We first show that the traditional notion of variation budget is insufficient to characterize the non-stationarity of the BwK problem for a sublinear regret due to the presence of the constraints, and then we propose a new notion of global non-stationarity measure. We employ both non-stationarity measures to derive upper and lower bounds for the problem. Our results are based on a primal-dual analysis of the underlying linear programs and highlight the interplay between the constraints and the non-stationarity. Finally, we also extend the non-stationarity measure to the problem of online convex optimization with constraints and obtain new regret bounds accordingly.

연구 동기 및 목표

  • 스토케스틱과 악성 설정 사이를 완만하게 연결하는 비정상적인 환경에서의 밴디트 with 컨스트레인트(BwK)에 대한 연구 갭을 메우기 위해.
  • 제약 조건이 있는 BwK 환경에서 기존의 비정상성 측정법(예: 변동 예산, 변화점)의 한계를 규명하기 위해.
  • 백업 제약 조건을 고려하면서도 비정상성을 캡처할 수 있는 새로운 글로벌 변동 예산 측정법을 제안하기 위해.
  • 기초 선형 프로그래밍의 원형-쌍대 분석을 통해 날카로운 상한 및 하한 리그레트 경계를 유도하기 위해.
  • 새로운 비정상성 측정법을 온라인 볼록 최적화 with 제약 조건(OCOwC)으로 확장하고, 새로운 리그레트 경계를 도출하기 위해.

제안 방법

  • BwK에서 시간에 따라 변화하는 보상 및 자원 분포를 정량화하기 위해, 비정상성의 새로운 측정법인 글로벌 변동 예산을 제안한다.
  • 제약 조건 인식 탐색을 가능하게 하는 슬라이딩 윈도우 기반 UCB 알고리즘을 BwK에 적용하여 비정상적인 환경을 다룬다.
  • 기초 선형 프로그래밍의 원형-쌍대 분석을 통해 리그레트 경계를 유도하고, 제약 조건의 구조와 비정상성 간의 연관성을 연결한다.
  • 시간에 따라 변화하는 최적 정책을 반영하기 위해, 악성 BwK에서 사용되는 정적 벤치마크보다 더 강력한 동적 벤치마크를 도입한다.
  • 볼록 목표 함수와 제약 조건에 적응하는 분석을 통해 글로벌 변동 예산을 OCOwC로 확장한다.
  • 스토케스틱 슬레이터 조건과 조건부 기대값 분해를 활용하여 이중 변수를 유한하게 유지하고, 스토케스틱 확장에서 O(√T) 리그레트를 달성한다.

실험 결과

연구 질문

  • RQ1다중 자원 제약 조건이 있는 BwK 문제에서 기존의 비정상성 측정법(예: 변동 예산)이 왜 부적절한가?
  • RQ2BwK에서 제약 조건과 시간에 따라 변화하는 분포 간의 상호작용을 캡처할 수 있는 새로운 비정상성 측정법을 정의할 수 있는가?
  • RQ3비정상적인 BwK에서 달성 가능한 최적의 리그레트는 무엇이며, 실용적인 알고리즘이 이를 따라잡을 수 있는가?
  • RQ4제약 조건의 존재가 비정상적인 환경에서 밴디트 알고리즘의 설계 및 분석에 어떤 영향을 미치는가?
  • RQ5새로운 비정상성 측정법을 온라인 볼록 최적화 with 제약 조건과 같은 더 넓은 설정으로 일반화할 수 있는가?

주요 결과

  • 백업 제약 조건이 의사결정의 가능성을 영향을 주기 때문에, 기존의 변동 예산 측정법은 BwK에서 하위선형 리그레트를 달성하는 데 부적절하다.
  • 제안된 글로벌 변동 예산은 슬라이딩 윈도우 기반 UCB 기반 BwK 알고리즘에 대해 근사 최적의 O(√T) 리그레트 경계를 도출하는 데 기여한다.
  • 하한 경계 분석을 통해 도출된 리그레트 경계가 로그 인자까지는 날카로운 경계임을 확인하여, 비정상적인 BwK 설정에서의 최적성의 성립을 입증한다.
  • 새로운 비정상성 측정법은 온라인 볼록 최적화 with 제약 조건(OCOwC)으로 자연스럽게 확장되며, 유사한 조건 하에서 O(√T) 리그레트 경계를 도출한다.
  • OCOwC의 스토케스틱 확장에서, 가상 큐 알고리즘이 O(√T) 리그레트와 O(d√T) 이하의 제약 위반을 달성하며, 스토케스틱 슬레이터 조건 하에서 성립한다.
  • 분석 결과, 이중 변수와 리그레트를 유한하게 유지하는 데 핵심은 과거 정보를 기반으로 한 미래 함수의 조건부 독립성에 있으며, 이를 통해 기대값 분해가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.