Skip to main content
QUICK REVIEW

[논문 리뷰] Algorithms for Non-Stationary Generalized Linear Bandits

Yoan Russac, Olivier Cappé|arXiv (Cornell University)|2020. 03. 23.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 10
한 줄 요약

이 논문은 환경 파am터의 급격한 변화에 적응하기 위해 슬라이딩 윈도우와 할인 최대우도 추정기를 사용하는 비정상적 일반선형 밴디트(non-stationary generalized linear bandits)를 위한 두 가지 상한 신뢰도(Upper Confidence Bound, UCB) 알고리즘—SW-GLUCB와 D-GLUCB—을 제안한다. 주요 이론적 기여는 $ d $가 매개변수 차원, $ T $가 시간 수평선, $ \Gamma_T $가 단절점 수인 경우, 순도 확률 동적 리그레트 경계가 $ d^{2/3} \Gamma_T^{1/3} T^{2/3} $ 순서임을 보이는 것이다.

ABSTRACT

The statistical framework of Generalized Linear Models (GLM) can be applied to sequential problems involving categorical or ordinal rewards associated, for instance, with clicks, likes or ratings. In the example of binary rewards, logistic regression is well-known to be preferable to the use of standard linear modeling. Previous works have shown how to deal with GLMs in contextual online learning with bandit feedback when the environment is assumed to be stationary. In this paper, we relax this latter assumption and propose two upper confidence bound based algorithms that make use of either a sliding window or a discounted maximum-likelihood estimator. We provide theoretical guarantees on the behavior of these algorithms for general context sequences and in the presence of abrupt changes. These results take the form of high probability upper bounds for the dynamic regret that are of order d^2/3 G^1/3 T^2/3 , where d, T and G are respectively the dimension of the unknown parameter, the number of rounds and the number of breakpoints up to time T. The empirical performance of the algorithms is illustrated in simulated environments.

연구 동기 및 목표

  • 기존 일반선형 밴디트 알고리즘이 정상 환경을 전제로 하여 실제 응용 사례(예: 뉴스 추천 또는 온라인 헬스케어)에서 흔히 현실적이지 않은 점을 해결하기 위해.
  • 변화점에 대한 사전 지식 없이도 기저 보상 생성 매개변수 $ \theta^\star $ 의 급격한 변화에 적응할 수 있는 알고리즘을 개발하기 위해.
  • 특히 급격한 변화가 있는 비정상적 환경에서 시간에 따라 변화하는 매개변수를 고려한 동적 리그레트에 대한 이론적 보장을 제공하기 위해.
  • 비정상적 환경에서 일반선형 모델의 비선형 구조를 활용하여 선형 밴디트 기반 알고리즘(LinUCB 등)과 로지스틱 UCB보다 성능을 향상시키기 위해.

제안 방법

  • 고정 크기의 슬라이딩 윈도우를 사용하여 $ \theta^\star $ 의 최대우도 추정기를 계산함으로써 오래된 데이터를 기각하고 변화에 적응하는 SW-GLUCB를 제안한다.
  • 할인 요소를 사용해 과거 관측치에 지수 감소 가중치를 적용함으로써 오래된 데이터를 점차 잊고 변화하는 매개변수에 적응하는 D-GLUCB를 제안한다.
  • 일반선형 모델 프레임워크 내에서 정규화된 최대우도 추정기 기반의 상한 신뢰도(Upper Confidence Bound, UCB) 전략을 사용하며, 농도 부등식에서 유도된 신뢰구간을 활용한다.
  • 시간에 따라 변하는 액션 세트 $ \mathcal{A}_t \subset \mathbb{R}^d $ 를 사용하여 액션을 적대적으로 선택할 수 있도록 하며, 컨텍스트 벡터에 대해 i.i.d. 가정이 필요하지 않다.
  • 이전 연구에서 나타나는 초기화 문제를 방지하기 위해 정규화된 추정기를 도입함으로써 초기 데이터에 대한 강한 가정이 필요 없어짐.
  • 일반적인 컨텍스트 시퀀스와 급격한 변화 하에서의 이론적 분석을 통해 고확률 동적 리그레트 경계를 유도하였으며, $ d $, $ T $, $ \Gamma_T $ 에 대한 명시적 의존성을 포함한다.

실험 결과

연구 질문

  • RQ1일반선형 밴디트를 위한 UCB 기반 알고리즘은 비정상적 환경에서 매개변수 $ \theta^\star $ 의 급격한 변화를 다룰 수 있도록 어떻게 적응시킬 수 있는가?
  • RQ2진정한 매개변수가 시간에 따라 변화할 때, 슬라이딩 윈도우와 할인 추정기의 성능과 적응 능력은 어떻게 비교될 수 있는가?
  • RQ3비정상적 일반선형 밴디트 환경에서 이러한 적응형 알고리즘의 이론적 동적 리그레트 경계는 어느 정도 달성 가능한가?
  • RQ4제안된 알고리즘은 시뮬레이션 및 실제 비정상적 환경에서 표준 선형 밴디트 및 로지스틱 UCB 기반 알고리즘보다 우수한 성능을 보일 수 있는가?

주요 결과

  • 제안된 SW-GLUCB와 D-GLUCB 알고리즘은 비정상적 일반선형 밴디트에서 급격한 변화가 있는 경우, 순도 확률 동적 리그레트 경계가 $ d^{2/3} \Gamma_T^{1/3} T^{2/3} $ 순서임을 달성하였으며, 이는 급격한 변화가 있는 비정상적 일반선형 밴디트에 대해 처음으로 이뤄진 결과이다.
  • 실험 결과로 SW-GLUCB와 D-GLUCB는 단절점 이후에도 변화하는 매개변수 $ \theta^\star $ 를 정확히 추적하는 것으로 나타났으며, LinUCB와 LogisticUCB는 적응하지 못하고 발산함을 보였다.
  • 여러 개의 단절점이 존재하는 2차원 시뮬레이션 환경에서 SW-GLUCB와 D-GLUCB는 각 단절점 이후 진짜 매개변수에 수렴하는 반면, LinUCB와 LogisticUCB는 긴 정적 기간 이후에도 복구하지 못함을 확인하였다.
  • 실제 데이터 세트인 Pima Indian Diabetes에서 $ t = 1000 $ 에 인위적으로 비정상성을 유도한 경우, SW-GLUCB와 D-GLUCB는 변화 이후에 정적 기반 알고리즘보다 분류 성능을 더 빨리 복구함을 확인하였다.
  • 슬라이딩 윈도우와 할인 방법은 선형 밴디트 기반 알고리즘(SW-LinUCB)보다 우수한 성능을 보였지만, SW-GLUCB와 D-GLUCB는 로지스틱 링크 함수를 적절히 모델링함으로써 더 정확한 성능을 보였다.
  • 보상 분포가 완전히 로지스틱이 아닐 경우(모델 부정확성)에도 불구하고, SW-GLUCB와 D-GLUCB는 강건한 성능을 유지함을 확인하여 실세계 응용에서의 실용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.