Skip to main content
QUICK REVIEW

[논문 리뷰] Thresholded Lasso Bandit

Kaito Ariu, Kenshi Abe|arXiv (Cornell University)|2020. 10. 22.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 5
한 줄 요약

이 논문은 희박한 보상 파라미터와 그 지지 집합을 추정하기 위해 임계값을 적용한 Lasso를 사용하는 매개변수 없는 알고리즘인 Thresholded Lasso Bandit을 제안한다. 이는 탐색을 위한 탐욕적 암 선택을 가능하게 하며, 적응적인 밴딧 피드백으로 인해 i.i.d.가 아닌 데이터에서도 높은 확률 추정 보장을 통해 일반적인 경우 $\mathcal{O}(\log d + \sqrt{T})$ 및 마진 조건 하에서 $\mathcal{O}(\log d + \log T)$의 향상된 리그레트 한계를 달성한다.

ABSTRACT

In this paper, we revisit the regret minimization problem in sparse stochastic contextual linear bandits, where feature vectors may be of large dimension $d$, but where the reward function depends on a few, say $s_0\ll d$, of these features only. We present Thresholded Lasso bandit, an algorithm that (i) estimates the vector defining the reward function as well as its sparse support, i.e., significant feature elements, using the Lasso framework with thresholding, and (ii) selects an arm greedily according to this estimate projected on its support. The algorithm does not require prior knowledge of the sparsity index $s_0$ and can be parameter-free under some symmetric assumptions. For this simple algorithm, we establish non-asymptotic regret upper bounds scaling as $\mathcal{O}( \log d + \sqrt{T} )$ in general, and as $\mathcal{O}( \log d + \log T)$ under the so-called margin condition (a probabilistic condition on the separation of the arm rewards). The regret of previous algorithms scales as $\mathcal{O}( \log d + \sqrt{T \log (d T)})$ and $\mathcal{O}( \log T \log d)$ in the two settings, respectively. Through numerical experiments, we confirm that our algorithm outperforms existing methods.

연구 동기 및 목표

  • d개의 특성 중 일부만 보상에 영향을 주는 고차원 희박한 스토케스틱 컨텍스트럴 선형 밴딧에서 리그레트 최소화 문제를 해결한다.
  • 희박성 인덱스 $s_0$에 대한 사전 지식이 필요로 하지 않으며 대칭 조건 하에서 매개변수 없는 알고리즘을 개발한다.
  • 희박한 선형 밴딧의 기존 리그레트 한계를 향상시키기 위해 임계값을 적용한 Lasso 추정을 활용하여 지지 집합 복구 및 파라미터 추정 정확도를 향상시킨다.
  • 차원 $d$와 시간 $T$에 대해 유리하게 스케일링되는 비점근적 리그레트 보장을 확립한다. 특히 마진 조건 하에서.

제안 방법

  • 각 라운드에서 알려지지 않은 보상 파라미터 $\theta$와 그 희박한 지지 집합을 추정하기 위해 임계값을 적용한 Lasso 프레임워크를 사용한다.
  • 임계값을 적용한 $\theta$의 추정치를 그 추정 지지 집합에 투영하여 암 선택을 위한 개선된 파라미터 추정치를 형성한다.
  • 추정된 $\theta$와 암 특성 벡터 간의 내적을 기반으로 탐욕적으로 암을 선택하여 잠재적으로 관련 있는 특성을 탐색한다.
  • 적응적인 비 i.i.d. 데이터 샘플링 조건 하에서도 유한 차원 $d$에 독립적인 추정 오차에 대한 고확률 경계를 유도한다.
  • 이전 연구(Oh 등, 2021)에서 제안한 대칭성 가정을 활용하여 매개변수 없는 설계와 엄밀한 리그레트 분석을 가능하게 한다.
  • 유한 시간 분석을 적용하여 일반적인 경우 $\mathcal{O}(\log d + \sqrt{T})$ 및 마진 조건 하에서 $\mathcal{O}(\log d + \log T)$로 스케일링되는 리그레트 한계를 확립한다.

실험 결과

연구 질문

  • RQ1임계값을 적용한 Lasso 추정은 적응적 비 i.i.d. 밴딧 피드백에서 지지 집합 복구 및 파라미터 추정 정확도를 향상시킬 수 있는가?
  • RQ2제안된 알고리즘은 고차원 설정에서 기존의 희박한 선형 밴딧 방법보다 더 날카로운 리그레트 한계를 달성하는가?
  • RQ3대칭 조건 하에서 매개변수 없는 설계를 유지하면서도 강력한 리그레트 보장을 확보할 수 있는가?
  • RQ4보상 분포상에서 암들이 잘 분리되어 있는 마진 조건 하에서 알고리즘이 어떻게 작동하는가?
  • RQ5합성 및 실제 세계 설정에서 최신 기준 알고리즘과 비교해 볼 때 알고리즘의 경험적 성능은 어떠한가?

주요 결과

  • 일반적인 경우 알고리즘은 비점근적 리그레트 상한 $\mathcal{O}(\log d + \sqrt{T})$을 달성하며, 이는 이전 최고 성능인 $\mathcal{O}(\log d + \sqrt{T \log(dT)})$보다 향상된 것이다.
  • 마진 조건 하에서 리그레트는 $\mathcal{O}(\log d + \log T)$로 스케일링되며, 이는 이전의 $\mathcal{O}(\log T \log d)$ 한계보다 더 날카롭다.
  • 일반적인 경우 $\theta$의 추정 오차는 리그레트에 $\mathcal{O}(\sqrt{T})$ 기여를 하며, 마진 조건 하에서는 $\mathcal{O}(\log T)$ 기여를 한다. $\mathcal{O}(\log d)$ 항은 지지 집합 추정 오차에서 기인한다.
  • 수치 실험 결과 Thresholded Lasso Bandit이 추정 정확도 및 누적 리그레트 측면에서 Lasso Bandit, Doubly-Robust Lasso Bandit, Sparsity-Agnostic Lasso Bandit을 모두 능가함을 확인하였다.
  • 최적의 암들이 $\theta$의 지지 집합을 커버하지 않는 어려운 사례에서, 상관관계 수준과 차원($d \in \{1000, 2000\}$)이 다양할 때도 경쟁 알고리즘보다 낮은 리그레트를 달성한다.
  • 실제 데이터셋인 R6A에서 알고리즘이 랜덤 정책과 LinUCB 모두를 초월하여 평균 사용자 클릭 수에서 뛰어난 성능을 보여 실용적 효과를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.