Skip to main content
QUICK REVIEW

[논문 리뷰] On Kernelized Multi-Armed Bandits with Constraints

Xingyu Zhou, Bo Ji|arXiv (Cornell University)|2022. 03. 29.
Advanced Bandit Algorithms Research인용 수 11
한 줄 요약

이 논문은 소프트 제약 조건을 갖는 커널라이제이션된 다수의 손잡이 밴딧에 대해 원시-이중 프레임워크를 제안하며, UCB 및 톰슨 샘플링과 같은 일반적인 탐색 전략을 사용할 때 하위선형의 회귀와 하위선형 또는 영 제약 위반을 가능하게 한다. 주요 기여는 보상 회귀와 제약 위반에 대한 분석을 통합하는 데 필요한 새로운 충분조건을 제공함으로써 비선형, 비볼록 설정에서 더 정교한 복잡도-회귀-제약 균형을 달성하는 것이다. 이는 RKHS 기반의 함수 모델링을 통해 이루어진다.

ABSTRACT

We study a stochastic bandit problem with a general unknown reward function and a general unknown constraint function. Both functions can be non-linear (even non-convex) and are assumed to lie in a reproducing kernel Hilbert space (RKHS) with a bounded norm. This kernelized bandit setup strictly generalizes standard multi-armed bandits and linear bandits. In contrast to safety-type hard constraints studied in prior works, we consider soft constraints that may be violated in any round as long as the cumulative violations are small, which is motivated by various practical applications. Our ultimate goal is to study how to utilize the nature of soft constraints to attain a finer complexity-regret-constraint trade-off in the kernelized bandit setting. To this end, leveraging primal-dual optimization, we propose a general framework for both algorithm design and performance analysis. This framework builds upon a novel sufficient condition, which not only is satisfied under general exploration strategies, including \emph{upper confidence bound} (UCB), \emph{Thompson sampling} (TS), and new ones based on \emph{random exploration}, but also enables a unified analysis for showing both sublinear regret and sublinear or even zero constraint violation. We demonstrate the superior performance of our proposed algorithms via numerical experiments based on both synthetic and real-world datasets. Along the way, we also make the first detailed comparison between two popular methods for analyzing constrained bandits and Markov decision processes (MDPs) by discussing the key difference and some subtleties in the analysis, which could be of independent interest to the communities.

연구 동기 및 목표

  • 경계가 없는 커널라이제이션된 밴딧의 격차를 메우기 위해, 하드 안전성 제약 조건이 아닌 제어 가능한 누적 위반을 允허하는 소프트 제약 조건을 도입하는 것.
  • 모르는 비선형 보상 및 제약 함수를 갖는 커널라이제이션된 밴딧 문제에서 일반적인 탐색 전략(예: UCB 및 톰슨 샘플링 포함)을 지원하는 통합된 알고리즘 및 분석 프레임워크를 개발하는 것.
  • 소프트 제약 조건의 성질을 활용하여 더 정교한 복잡도-회귀-제약 균형을 달성함으로써, 제약 조건 준수를 유지하면서 동시에 비제약 조건 밴딧에 가까운 성능을 달성하는 것.
  • 제약 조건이 있는 밴딧과 MDP에 대한 두 주요 분석 방법 간의 첫 번째 상세 비교를 제공함으로써, 이론적 처리에서의 핵심 차이점과 미묘한 점을 드러내는 것.

제안 방법

  • 프레임워크는 원시-이중 최적화에 기반하며, 일반적인 탐색 전략 하에서 하위선형의 회귀와 제약 위반을 보장하는 데 필요한 새로운 충분조건을 사용한다.
  • 보상 및 제약 함수를 유계 노름을 갖는 재생 커널 힐버트 공간(RKHS)에서 모델링함으로써 비선형 및 비볼록 함수 근사가 가능해진다.
  • 알고리즘은 후행 분산 기반 신뢰 구간(예: $\sigma_{t-1}(x_t)$)을 사용하며, 이중 변수를 통해 여유 변수를 도입하여 제약 위반을 관리한다.
  • 누적 제약 위반을 유한하게 제한하기 위해 초마르팅게일 추론을 사용하며, 유계 증분 하에서 아즈마-후이딩 부등식을 적용한다.
  • 추정 오차를 제어하기 위해 임계값 기반 지표 $\mathcal{I}\{E^{est}\}$ 를 도입하여, 회귀 및 위반에 대한 고확률 경계를 보장한다.
  • 탐색 전략에 대한 충분조건을 만족함으로써, UCB 및 톰슨 샘플링 모두를 지원하며, 통합된 성능 분석이 가능해진다.

실험 결과

연구 질문

  • RQ1소프트 제약 조건 하에서 하드 제약 조건 대비 커널라이제이션된 밴딧에서 더 정교한 복잡도-회귀-제약 균형을 달성할 수 있는가?
  • RQ2UCB를 초월한 일반적인 탐색 전략을 사용하여 제약 조건이 있는 커널라이제이션된 밴딧에 대해 증명 가능하게 효율적인 알고리즘을 설계할 수 있는가?
  • RQ3비선형, 비볼록 설정에서 소프트 제약 조건은 어떻게 하위선형의 회귀를 달성하면서 동시에 하위선형 또는 영 제약 위반을 달성하는가?
  • RQ4제약 조건이 있는 밴딧과 제약 조건이 있는 MDP를 분석할 때의 핵심 차이점과 미묘한 점은 무엇이며, 이는 이론적 보장에 어떻게 영향을 미치는가?
  • RQ5제안된 원시-이중 프레임워크는 제약 조건이 있는 커널라이제이션된 밴딧에서 UCB 및 톰슨 샘플링과 같은 다양한 탐색 전략의 분석을 통합할 수 있는가?

주요 결과

  • 제안된 프레임워크는 소프트 제약 조건이 있는 커널라이제이션된 밴딧에서 UCB 및 톰슨 샘플링 탐색 전략 모두에 대해 하위선형의 회귀와 하위선형 제약 위반을 달성한다.
  • 이중 변수 업데이트에서 여유 변수를 도입함으로써, 제약 위반은 영 또는 유계로 유지되면서 하위선형의 회귀를 유지할 수 있다.
  • 이론적 분석에 따르면, 누적 제약 위반은 $O\left(\frac{1}{p_4} c_f(T)\sqrt{T\gamma_T} + \frac{1}{p_4} \rho c_g(T)\sqrt{T\widetilde{\gamma}_T} + \frac{(c_f(T) + \rho c_g(T))\kappa}{p_4}\sqrt{2T\ln(1/\delta)}\right)$ 로 유계이며, 여기서 $\kappa = 4B + 4\rho G$ 이다.
  • 이 프레임워크는 소프트 제약 조건 하에서 UCB 및 톰슨 샘플링에 대한 첫 번째 통합 분석을 제공하며, 탐색 전략에 대한 새로운 충분조건에 의해 가능해졌다.
  • 합성 및 실세계 데이터셋에 대한 수치 실험은 기존 방법에 비해 뛰어난 경험적 성능을 확인한다.
  • 논문은 제약 조건이 있는 밴딧과 MDP에 대한 두 주요 분석 기법 간의 첫 번째 상세 비교를 제공하며, 추정 오차 처리 및 제약 조건 전파 방식에서 미묘하지만 핵심적인 차이점을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.