Skip to main content
QUICK REVIEW

[논문 리뷰] Learning and Optimization with Seasonal Patterns

Ningyuan Chen, Chun Wang|arXiv (Cornell University)|2020. 05. 16.
Advanced Bandit Algorithms Research참고 문헌 44인용 수 9
한 줄 요약

이 논문은 보상이 알려지지 않은 주기적 패턴을 따르는 비정상적인 다수의 손잡이 밴딧(non-stationary multi-armed bandits) 환경에서 시간에 따라 변화하는 보상에 대해 이중 단계 학습 정책을 제안한다. 각 손잡이의 주기를 추정하기 위해 푸리에 분석을 활용하고, 신뢰구간 기반 탐색-이용 전략을 결합함으로써, 일반적인 주기성 가정 하에 서로 다른 손잡이들 간에 이질적이고 알려지지 않은 주기성을 가진 환경에서도 근사적으로 최적의 성능을 달성하는 $ ilde{O}( extstyleackslashsqrt extbackslash{ T extbackslashsum extbackslash{ k=1 extbackslash}textbackslash{ K extbackslash}T_k extbackslash})$ 의 위상 상한을 확보한다.

ABSTRACT

A standard assumption adopted in the multi-armed bandit (MAB) framework is that the mean rewards are constant over time. This assumption can be restrictive in the business world as decision-makers often face an evolving environment where the mean rewards are time-varying. In this paper, we consider a non-stationary MAB model with $K$ arms whose mean rewards vary over time in a periodic manner. The unknown periods can be different across arms and scale with the length of the horizon $T$ polynomially. We propose a two-stage policy that combines the Fourier analysis with a confidence-bound-based learning procedure to learn the periods and minimize the regret. In stage one, the policy correctly estimates the periods of all arms with high probability. In stage two, the policy explores the periodic mean rewards of arms using the periods estimated in stage one and exploits the optimal arm in the long run. We show that our learning policy incurs a regret upper bound $ ilde{O}(\sqrt{T\sum_{k=1}^K T_k})$ where $T_k$ is the period of arm $k$. Moreover, we establish a general lower bound $Ω(\sqrt{T\max_{k}\{ T_k\}})$ for any policy. Therefore, our policy is near-optimal up to a factor of $\sqrt{K}$.

연구 동기 및 목표

  • 보상 평균이 시간에 따라 주기적으로 변화하는 비정상적인 다수의 손잡이 밴딧 환경에서의 학습 과제를 해결하기 위해.
  • 사전 지식 없이도 $K$개의 손잡이 각각에 대해 알려지지 않은 이질적인 주기 $T_k$를 추정할 수 있는 학습 정책을 개발하기 위해.
  • 보상의 총 변동량이 $T$에 선형적으로 비례하는 시간 변화 환경에서도 누적 위상을 최소화하기 위해.
  • 최소한의 구조적 가정 하에 일반적인 주기적 보상 역학에서 위상 성능에 대한 이론적 보장을 수립하기 위해.

제안 방법

  • 정책은 두 단계로 구성된다: 첫 번째 단계에서, 각 손잡이의 보상 주기 주기를 높은 확률로 추정하기 위해 푸리에 분석을 사용한다.
  • 두 번째 단계에서, 추정된 주기를 활용하여 탐색과 최적의 손잡이 선택을 수행하는 신뢰구간 기반 학습 절차를 적용한다.
  • 알고리즘은 탐색 기간 동안 각 손잡이가 완전한 주기 동안만 선택되도록 보장하여 주기 전체에 걸친 평균 보상 추정을 정확히 수행할 수 있도록 한다.
  • 기하급수적 시리즈 경계와 확률적 농도 불등식을 활용하여 열등한 손잡이의 선택 횟수를 제어한다.
  • 위상은 기대 선택 수와 열등한 갭의 조합을 통해 분해되며, 젠센의 부등식과 갭 항목에 대한 최소-최대 최적화를 통해 경계가 유도된다.
  • 완전하지 않은 주기들을 처리하기 위해, 최소 주기 $T_1$의 가장 가까운 배수로 시간 범위를 연장함으로써 청결한 위상 분석을 보장한다.

실험 결과

연구 질문

  • RQ1비정상적인 다수의 손잡이 밴딧 환경에서, 알려지지 않은 이질적인 주기 패턴의 주기를 효과적으로 추정할 수 있는 학습 정책가 존재하는가?
  • RQ2이러한 주기적 비정상 MAB 문제에서 위상 성능의 기본 한계는 무엇인가?
  • RQ3스펙트럼 분석(푸리에 방법)을 신뢰구간 기법과 어떻게 융합하여 근사적으로 최적의 위상을 달성할 수 있는가?
  • RQ4보상의 총 변동량이 $T$에 선형적으로 비례할 때도 비선형 위상 성능를 달성할 수 있는가?
  • RQ5정책의 성능은 손잡이 수 $K$와 각 손잡이의 주기 $T_k$에 따라 어떻게 스케일링되는가?

주요 결과

  • 제안된 정책은 $ ilde{O}( extstyleackslashsqrt extbackslash{ T extbackslashsum extbackslash{ k=1 extbackslash}textbackslash{ K extbackslash}T_k extbackslash})$ 의 위상 상한을 달성하며, 이는 $ ilde{K}$ 요소까지 근사적으로 최적의 성능이다.
  • 일반적인 주기적 보상 역학 하에서 $ ilde{O}( extstyleackslashsqrt extbackslash{ T\max_k\{T_k\} extbackslash})$ 의 일반적 하한선 $ ilde{\Omega}(\sqrt{T\max_k\{T_k\}})$ 이 확립되었으며, 이는 주어진 가정 하에 어떤 정책도 이보다 더 나은 위상 스케일링을 달성할 수 없음을 보여준다.
  • 위상 상한은 각 손잡이의 주기 합의 제곱근에 비례하여 스케일링되며, 이는 더 긴 주기가 학습 난이도를 증가시킴을 시사한다.
  • 위상 분해의 제1항과 제2항은 $ ilde{O}( extstyleackslashsqrt extbackslash{ TK extbackslash})$ 이며, 제3항 역시 $T_1 \leq \sqrt{T/K}$ 일 때 $ ilde{O}( extstyleackslashsqrt extbackslash{ TK extbackslash})$ 로 동일한 주의를 가진다. 이 조건은 미약한 조건이다.
  • 모든 열등한 손잡이 $k$에 대해 기대 선택 수는 $\mathsf{E}[C_k(T)] \leq 3 + 4\log(KT) + \frac{256\sigma^2}{3\bar{\Delta}_k^2}\log(KT^3) + T_1(1 \lor \log_2(4\sigma/\bar{\Delta}_k))$ 로 경계된다.
  • 완전하지 않은 주기들을 고려하기 위해, 시간 범위가 최소 주기 $T_1$의 가장 가까운 배수로 연장되며, 이로 인해 최대 $T_1$개의 추가 선택이 발생한다. 이는 최종 위상 상한에 흡수된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.