Skip to main content
QUICK REVIEW

[논문 리뷰] Online Learning with Vector Costs and Bandits with Knapsacks

Thomas Keßelheim, Sahil Singla|arXiv (Cornell University)|2020. 10. 14.
Advanced Bandit Algorithms Research인용 수 5
한 줄 요약

이 논문은 온라인 의사결정에서 누적 벡터 비용의 $\ell_p$-노름을 최소화하기 위한 프레임워크인 온라인 학습 벡터 비용($\textsc{OLVC}_p$)을 소개한다. 기울기 기반 최적화를 통해 다차원 문제를 1차원 대체 문제로 환원함으로써, 스토하스틱 환경에서는 거의 최적의 리그레트를 달성하고, 악성 환경에서는 $O(\min\{p,\log d\})$의 날카로운 경쟁 비율을 확보한다. 이는 밴디트스 윰 캐스트(Bandits with Knapsacks, BwK)에 적용 가능하다.

ABSTRACT

We introduce online learning with vector costs (\OLVCp) where in each time step $t \in \{1,\ldots, T\}$, we need to play an action $i \in \{1,\ldots,n\}$ that incurs an unknown vector cost in $[0,1]^{d}$. The goal of the online algorithm is to minimize the $\ell_p$ norm of the sum of its cost vectors. This captures the classical online learning setting for $d=1$, and is interesting for general $d$ because of applications like online scheduling where we want to balance the load between different machines (dimensions). We study \OLVCp in both stochastic and adversarial arrival settings, and give a general procedure to reduce the problem from $d$ dimensions to a single dimension. This allows us to use classical online learning algorithms in both full and bandit feedback models to obtain (near) optimal results. In particular, we obtain a single algorithm (up to the choice of learning rate) that gives sublinear regret for stochastic arrivals and a tight $O(\min\{p, \log d\})$ competitive ratio for adversarial arrivals. The \OLVCp problem also occurs as a natural subproblem when trying to solve the popular Bandits with Knapsacks (\BwK) problem. This connection allows us to use our \OLVCp techniques to obtain (near) optimal results for \BwK in both stochastic and adversarial settings. In particular, we obtain a tight $O(\log d \cdot \log T)$ competitive ratio algorithm for adversarial \BwK, which improves over the $O(d \cdot \log T)$ competitive ratio algorithm of Immorlica et al. [FOCS'19].

연구 동기 및 목표

  • d차원에서의 온라인 학습 벡터 비용 문제를 다루며, 총 비용 벡터의 $\ell_p$-노름을 최소화하는 것이 목표이다.
  • 문제를 고전적 온라인 학습의 일반화로 공식화한다 (d=1일 경우) 하고, 이를 로드 밸런싱과 BwK에 적용한다.
  • 고전적 온라인 학습 알고리즘의 사용을 가능하게 하기 위해 d차원의 비용 벡터에서 1차원 대체 문제로의 환원 기법을 개발한다.
  • 스토하스틱 환경에서는 하위선형 리그레트를 달성하고, 악성 환경에서는 OLVC_p 및 BwK에 대해 날카로운 경쟁 비율을 확보한다.
  • 밴디트스 윰 캐스트(Bandits with Knapsacks, BwK)의 경쟁 비율을 악성 환경에서 $O(d \log T)$에서 $O(\log d \cdot \log T)$로 향상시키기 위해 OLVC_p 기법을 적용한다.

제안 방법

  • 비용 벡터의 기울기 기반 변환을 통해 d차원 OLVC_p를 1차원 대체 문제로 환원한다.
  • 총 비용 벡터의 $\ell_p$-노름을 목적함수로 사용하며, 볼록성과 하위기울기 성질을 유지하는 대체 함수를 정의한다.
  • 고전적 온라인 학습 알고리즘(예: Follow-the-Regularized-Leader)을 1차원 대체 문제에 적용하여 알려진 리그레트 한계를 활용한다.
  • 대체 함수의 기울기를 나타내는 이중 변수 $g^{(t)}$를 도입하여 효율적인 업데이트를 가능하게 한다.
  • 이중 변수의 안정성을 제어하고 유한한 리그레트를 보장하기 위해 정규화 항 $\Psi^{(t)}_{p,r}$을 사용한다.
  • 자원 소비를 벡터 비용으로 모델링하고 대체 함수를 통해 경쟁 비율을 유도함으로써, BwK에 이 환원 기법을 적용한다.

실험 결과

연구 질문

  • RQ1온라인 학습에서 다차원 비용을 유지하면서 1차원 대체 문제로 환원할 수 있을까? 이 경우 근사 최적의 리그레트와 경쟁 비율을 유지할 수 있는가?
  • RQ2악성 환경에서 OLVC_p의 경쟁 비율은 얼마이며, 이는 d와 p에 따라 어떻게 변화하는가?
  • RQ3제안된 OLVC_p 프레임워크는 악성 환경에서 밴디트스 윰 캐스트(Bandits with Knapsacks, BwK)의 경쟁 비율을 어떻게 향상시키는가?
  • RQ4OLVC_p의 스토하스틱 환경에서의 리그레트와 악성 환경에서의 경쟁 비율 사이의 상충 관계는 무엇인가?
  • RQ5최적 해가 알려져 있지 않을 때, OLVC_p 프레임워크를 사용해 BwK에 대해 날카로운 경계를 유도할 수 있는가?

주요 결과

  • 1차원 대체 환원 기법과 고전적 온라인 학습 알고리즘을 활용하여, OLVC_p가 스토하스틱 환경에서 하위선형 리그레트를 달성한다.
  • 악성 OLVC_p의 경우 경쟁 비율은 $O(\min\{p, \log d\})$이며, 이는 날카로우며 이전 연구보다 향상된 결과이다.
  • 악성 BwK의 경우 경쟁 비율이 $O(d \log T)$에서 $O(\log d \cdot \log T)$로 향상되었으며, 로그 인자 수준에서 알려진 최고의 경계와 일치한다.
  • 스토하스틱 BwK에서 알고리즘은 고려 확률로 $\textsc{OPT}_{\textsc{BwK}} \cdot \left(1 - O\left(\left(\frac{(p+r)\|\mathbf{1}_d\|_p}{B}\right)^{1/2}\right)\right)$의 보상을 달성한다.
  • 분석에서 최적 값이 알려져 있다는 가정을 제거함으로써, 알고리즘이 $\textsc{OPT}_{\textsc{BwK}}$가 알려져 있지 않을 경우에도 안정적임을 입증하였다.
  • 이론적 보장은 기울기 안정성과 헬더 부등식에 의해 뒷받침되며, 이는 유한한 리그레트와 수렴을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.