Skip to main content
QUICK REVIEW

[논문 리뷰] Doubly-Robust Lasso Bandit

Gi-Soo Kim, Myunghee Cho Paik|arXiv (Cornell University)|2019. 07. 26.
Advanced Bandit Algorithms Research참고 문헌 30인용 수 12
한 줄 요약

이 논문은 이중으로 강건한 라소 밴딧을 제안한다. 이는 라소를 통한 희박한 회귀를 활용하고, 관측되지 않은 암 보상(arm context)을 활용하기 위해 이중으로 강건한 추정을 통합함으로써, 차원 $ d $ 에 대해 로그적으로 스케일링되고 암의 수 $ N $ 에 독립적인 고확률적 리그레트 경계 $ O(s_0 \log(dT)\sqrt{T}) $ 를 달성하는 연장선상의 다중 암 밴딧 알고리즘이다.

ABSTRACT

Contextual multi-armed bandit algorithms are widely used in sequential decision tasks such as news article recommendation systems, web page ad placement algorithms, and mobile health. Most of the existing algorithms have regret proportional to a polynomial function of the context dimension, $d$. In many applications however, it is often the case that contexts are high-dimensional with only a sparse subset of size $s_0 (\ll d)$ being correlated with the reward. We consider the stochastic linear contextual bandit problem and propose a novel algorithm, namely the Doubly-Robust Lasso Bandit algorithm, which exploits the sparse structure of the regression parameter as in Lasso, while blending the doubly-robust technique used in missing data literature. The high-probability upper bound of the regret incurred by the proposed algorithm does not depend on the number of arms and scales with $\mathrm{log}(d)$ instead of a polynomial function of $d$. The proposed algorithm shows good performance when contexts of different arms are correlated and requires less tuning parameters than existing methods.

연구 동기 및 목표

  • 고차원적 컨텍스트 차원 $ d $ 에 대해 리그레트가 다항식적으로 스케일링되는 기존 연속적 밴딧 알고리즘의 한계를 해결하기 위해, 특히 유의미한 특성의 희박한 부분집합 $ s_0 \ll d $ 만이 영향을 미칠 때를 대비한다.
  • 밴딧에서의 적응적 샘플링 하에서 라소 추정의 비호환성 문제를 극복하기 위해, 밴딧의 알려진 암 선택 메커니즘을 활용한다.
  • 손실 데이터 문헌에서 유래한 이중으로 강건한 추정을 적용하여, 선택되지 않은 암의 관측되지 않은(결측한) 보상을 활용함으로써 데이터 효율성을 향상시킨다.
  • 암의 수 $ N $ 에 독립적인 리그레트 경계를 개발하여, 추천 시스템과 같은 동적 또는 대규모 암 집합에 적합하게 한다.
  • 희박성과 모델 오Specification에 대한 강건성을 조합함으로써, 기존의 라소 기반 밴딧 방법보다 더 날카운 리그레트 경계를 달성한다.

제안 방법

  • 공유되는 회귀 매개수 $ \beta \in \mathbb{R}^d $ 를 가진 스토하스틱 선형 연속적 밴딧 문제를 수립하며, 보상은 컨텍스트 벡터 $ b_i(t) $ 에 대해 선형이다.
  • 라소 추정을 적용하여 $ \beta $ 의 희박성을 강제함으로써, 보상에 영향을 미치는 특성은 $ s_0 $ 개 뿐이라고 가정한다.
  • 결과 회귀와 성향 스코어를 조합하여, 선택되지 않은 암에 대해 허위 보상을 구성하기 위해 이중으로 강건한 추정을 사용한다.
  • 이중으로 강건한 추정기 내부에 알려진 암 선택 확률(결측 메커니즘)을 통합함으로써, 관측되지 않은 컨텍스트를 활용할 수 있도록 한다.
  • 호환 조건 하에서 재귀적 농도 부등식을 사용하여, 추정 오차 $ \|\hat{\beta}(t) - \beta\|_1 $ 에 대한 고확률적 신뢰구간을 구성한다.
  • 이중으로 강건한 라소 추정기에서 유도된 신뢰구간을 갖는 UCB 스타일 알고리즘을 설계하여, 추정된 기대 보상에 기반해 암을 선택한다.

실험 결과

연구 질문

  • RQ1희박한 보상 구조를 가진 고차원적 연속적 밴딧에서, 리그레트 경계를 $ d $ 의 다항식이 아닌 $ \log(d) $ 에 따라 스케일링할 수 있는가?
  • RQ2적응적 밴딧 설정에서, 선택되지 않은 암의 관측되지 않은 컨텍스트를 효과적으로 활용하여 매개수 추정을 향상시킬 수 있는가?
  • RQ3손실 데이터 문헌에서 유래한 이중으로 강건한 기법을, 결측 메커니즘이 학습자가 제어하는 연속적 밴딧에 적응시킬 수 있는가?
  • RQ4라소의 희박성과 이중으로 강건한 추정을 조합함으로써, 기존 표준 라소 밴딧 방법에 비해 더 나은 리그레트 성능과 낮은 튜닝 민감도를 달성할 수 있는가?
  • RQ5특히 동적 또는 대규모 암 환경에서, 리그레트 경계가 암의 수 $ N $ 에 독립적인가?

주요 결과

  • 제안된 이중으로 강건한 라소 밴딧는 고확률적 리그레트 상한 $ O(s_0 \log(dT)\sqrt{T}) $ 를 달성하며, 이는 $ d $ 에 대해 다항식이 아닌 $ \log(d) $ 에 따라 스케일링된다.
  • 리그레트 경계는 암의 수 $ N $ 와 독립적이므로, 동적 또는 대규모 암 집합에 대해 확장 가능한 알고리즘이다.
  • 시뮬레이션 결과, 암의 수가 증가하거나 컨텍스트 상관관계가 강할 경우, DR 라소 밴딧가 표준 라소 밴딧보다 뛰어난 성능을 보였다.
  • 라소 밴딧의 리그레트는 $ N $ 에 따라 증가하는 반면, DR 라소 밴딧의 성능은 $ N $ 의 변화에 대해 강건하여 확장 가능성을 입증했다.
  • 특히 이중으로 강건한 추정기의 안정성 덕분에, 기존 방법에 비해 튜닝 파rameter에 대한 민감도가 낮아 보였다.
  • 추정 오차가 임계값을 초과하는 라운드의 부분집합이 고확률적으로 공집합임을 입증하여, 신뢰구간의 날카로움을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.