Skip to main content
QUICK REVIEW

[논문 리뷰] An Efficient Pessimistic-Optimistic Algorithm for Stochastic Linear Bandits with General Constraints

Xin Liu, Bin Li|arXiv (Cornell University)|2021. 02. 10.
Advanced Bandit Algorithms Research참고 문헌 44인용 수 17
한 줄 요약

이 논문은 일반적인 비선형 제약 조건을 가진 스토하스틱 선형 밴디트 문제를 위해 비관적-낙관적 알고리즘을 제안하며, 원본-이중 프레임워크를 활용하여 $\tilde{\mathrm{O}}\bigl((K^{0.75}/\bar{\delta} + d)\sqrt{\tau}\bigr)$의 리그레트와 상수 시간 $\tau^\prime$ 이후에 제로 제약 위반을 달성한다. 이 알고리즘은 원본 및 이중 업데이트를 분리함으로써 계산 효율성을 확보하며, 이중 복잡도는 액션 또는 특징 공간의 크기와는 무관하게 제약 조건의 수에만 비례한다.

ABSTRACT

This paper considers stochastic linear bandits with general nonlinear constraints. The objective is to maximize the expected cumulative reward over horizon $T$ subject to a set of constraints in each round $τ\leq T$. We propose a pessimistic-optimistic algorithm for this problem, which is efficient in two aspects. First, the algorithm yields $ ilde{\cal O}\left(\left(\frac{K^{0.75}}δ+d ight)\sqrtτ ight)$ (pseudo) regret in round $τ\leq T,$ where $K$ is the number of constraints, $d$ is the dimension of the reward feature space, and $δ$ is a Slater's constant; and zero constraint violation in any round $τ>τ',$ where $τ'$ is independent of horizon $T.$ Second, the algorithm is computationally efficient. Our algorithm is based on the primal-dual approach in optimization and includes two components. The primal component is similar to unconstrained stochastic linear bandits (our algorithm uses the linear upper confidence bound algorithm (LinUCB)). The computational complexity of the dual component depends on the number of constraints, but is independent of the sizes of the contextual space, the action space, and the feature space. Thus, the overall computational complexity of our algorithm is similar to that of the linear UCB for unconstrained stochastic linear bandits.

연구 동기 및 목표

  • 일반적인 비선형 제약 조건 하에서 스토하스틱 선형 밴디트 문제를 다루며, 특히 안전성, 공정성 또는 예산 준수 요구가 있는 설정을 대상으로 한다.
  • 수렴 시간에 관계없이 유한한 시간 이후에 리그레트를 낮추면서 제약 위반을 완전히 제거하는 알고리즘을 설계한다.
  • 액션 또는 특징 공간 크기와는 무관하게 이중 업데이트 복잡도가 제약 조건의 수에만 의존하도록 하여 계산 효율성을 확보한다.
  • 기존의 밴디트 설정을 일반화하여 매 라운드마다 만족되어야 하는 '임의의 시점 누적 제약 조건'을 도입함으로써, 수명 주기의 끝에만 만족하는 제약 조건이 아닌, 모든 시점에서의 제약 조건 이행을 보장한다.

제안 방법

  • 알고리즘은 원본-이중 접근 방식을 사용하며, 원본 구성 요소는 보상 최적화를 위해 선형 상한 신뢰도(LinUCB) 스타일 업데이트를 사용한다.
  • 이중 구성 요소는 누적 제약 위반에 기반하여 라그랑주 승수를 유지하며, 업데이트 복잡도는 제약 조건의 수 $K$에만 의존한다.
  • 비관적-낙관적 전략은 보상과 비용 추정치의 신뢰 구간을 통합하여 탐색과 제약 조건 이행을 균형 잡는다.
  • 알고리즘은 시간에 따라 변하는 학습률 $\epsilon_t = \frac{4d\log(1+T)}{\sqrt{t}}$과 값 매개변수 $V_t = \frac{\delta d\sqrt{t}\log(1+T)}{4}$를 사용하여 리그레트와 제약 위반을 제어한다.
  • 제약 위반의 진동을 분석하고 예상 누적 비용에 대한 경계를 유도하기 위해 새로운 리아푸노프 유사 함수를 도입한다.
  • 모든 $\tau > \tau^\prime = \frac{64d^2\log^2(1+T)}{\delta^2}$에서 제약 위반이 0이 되도록 하기 위해 $\epsilon_t \leq \delta/2$를 유지함으로써 $\tau^\prime$ 시점 이후에 제로 제약 위반을 달성한다.

실험 결과

연구 질문

  • RQ1일반적인 비선형 제약 조건을 가진 스토하스틱 선형 밴디트 문제에 대해 계산 효율성이 확보된 알고리즘을 설계할 수 있는가? 이 알고리즘은 유한한 시간 이후에 제로 제약 위반을 달성할 수 있는가?
  • RQ2임의의 시점 누적 제약 조건 하에서 달성 가능한 리그레트 경계는 무엇이며, 제약 조건 수 $K$, 차원 수 $d$, 슬레이터 상수 $\delta$에 따라 어떻게 척도화되는가?
  • RQ3알고리즘은 알려지지 않은 비용 함수가 존재하는 밴디트 설정에서 저리그레트와 강력한 제약 조건 이행을 동시에 유지하기 위해 원본-이중 프레임워크를 어떻게 적응시킬 수 있는가?
  • RQ4액션 및 특징 공간 크기와는 무관하게 이중 업데이트 복잡도를 분리할 수 있는가? 이는 대규모 컨텍스트 문제에 대한 확장성 향상에 기여한다.

주요 결과

  • 알고리즘은 라운드 $\tau$에서 $\mathcal{R}(\tau) = \tilde{\mathcal{O}}\bigl(\bigl(\frac{K^{0.75}}{\delta} + d\bigr)\sqrt{\tau}\bigr)$의 리그레트 경계를 달성하며, 이는 비선형이면서 거의 최적이다.
  • 모든 $\tau > \tau^\prime = \frac{64d^2\log^2(1+T)}{\delta^2}$에서 제약 위반이 0이며, 이는 $\tau^\prime$이 수명 주기 $T$에 독립적임을 의미한다.
  • 기대 누적 비용 위반 $\mathbb{E}[Q(\tau)]$는 $\mathcal{O}\bigl(\frac{d^2\log^2(1+T)}{\delta^2} + \frac{1}{\delta}\bigr)$로 경계가 되며, 장기적인 실행 가능성 보장을 한다.
  • 계산 복잡도는 액션 또는 특징 공간 크기와는 무관하게 제약 조건 수 $K$에만 의존하므로, 비제약 조건 LinUCB와 유사한 수준의 계산 효율성을 확보한다.
  • 리아푸노프 함수 분석을 통해 알고리즘이 유한한 시간 이후에 제약 조건 위반을 0으로 이끌어내며 타당성을 유지한다.
  • 알고리즘은 비선형 비용 함수에 대해 강건하며, 비용 구조에 선형성을 요구하지 않아 의료 및 예산 제약이 있는 추천 시스템과 같은 실제 문제에 광범위하게 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.