Skip to main content
QUICK REVIEW

[논문 리뷰] Nearly Dimension-Independent Sparse Linear Bandit over Small Action Spaces via Best Subset Selection

Yi Chen, Yining Wang|arXiv (Cornell University)|2020. 09. 04.
Advanced Bandit Algorithms Research참고 문헌 60인용 수 4
한 줄 요약

이 논문은 높은 차원에서 희소 선형 컨텍스추얼 밴딧 문제에 대해, 최적의 부분 선택과 이중으로 증가하는 에포크를 사용하여 차원 수에 거의 의존하지 않는 거의 차원 독립적인 희소 선형 밴딧 알고리즘을 제안한다. 이는 작은 무작위 행동 공간에서 $\tilde{O}(s\sqrt{T})$의 리그레트를 달성한다. 알고리즘은 탐색과 이용의 균형을 유지하면서 계산 가능성을 확보하고, 저차원 영역에서 최소화 하한을 충족시켜 거의 최적성을 확보한다.

ABSTRACT

We consider the stochastic contextual bandit problem under the high dimensional linear model. We focus on the case where the action space is finite and random, with each action associated with a randomly generated contextual covariate. This setting finds essential applications such as personalized recommendations, online advertisements, and personalized medicine. However, it is very challenging to balance the exploration and exploitation tradeoff. We modify the LinUCB algorithm in doubly growing epochs and estimate the parameter using the best subset selection method, which is easy to implement in practice. This approach achieves O(sT) regret with high probability, which is nearly independent of the “ambient” regression model dimension <i>d</i>. We further attain a sharper O(sT) regret by using the SupLinUCB framework and match the minimax lower bound of the low-dimensional linear stochastic bandit problem. Finally, we conduct extensive numerical experiments to empirically demonstrate our algorithms’ applicability and robustness. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 환경 차원 $d$가 표본 크기 $T$보다 훨씬 클 때 발생하는 고차원 선형 컨텍스추얼 밴딧 문제에 대응하기 위해 계산 효율성을 유지하는 것.
  • 희소 고차원 설정에서 환경 차원 $d$에 거의 의존하지 않는 실용적이고 구현 가능한 알고리즘을 개발하는 것.
  • 유한하고 작은, 무작위로 생성된 행동 공간에서 탐색과 이용을 효과적으로 균형 잡는 것.
  • 최적의 부분 선택을 통해 SupLinUCB 프레임워크를 정교화하여 저차원 선형 밴딧 문제의 최소화 하한을 충족시키는 것.
  • 다양한 시나리오에서 제안된 알고리즘의 강건성과 적용 가능성에 대한 실증적 검증을 수행하는 것.

제안 방법

  • 알고리즘은 시간 간격의 크기가 점차 증가하는 이중으로 증가하는 에포크를 사용하여 체계적으로 탐색과 이용을 균형 잡는다.
  • 최적의 부분 선택을 통해 희소 파라미터 벡터 $\theta^*$를 추정하며, 비영인 $s$개의 성분에만 집중함으로써 추정 오차를 감소시키고 해석 가능성을 향상시킨다.
  • 각 에포크 내에서 릿지 회귀 추정기와 신뢰 영역을 사용하여 추정 오차를 제한하며, 자기정규화된 마틴게일 농도 부등식을 활용한다.
  • 신뢰 영역은 경험적 그램 행렬과 정규화를 사용하여 구성되어 파라미터 추정 오차에 대한 고확률 경계를 보장한다.
  • SupLinUCB 프레임워크를 최적의 부분 선택을 통합하여 신뢰 영역을 정교화하고 더 날카운 리그레트 경계를 달성하도록 개조한다.
  • 알고리즘은 각 에포크마다 추정된 파라미터의 지지 집합 $S_{\tau-1}$을 동적으로 갱신하여 희소성 인식 학습을 보장한다.

실험 결과

연구 질문

  • RQ1희소 고차원 설정에서 환경 차원 $d$에 거의 의존하지 않는 희소 선형 밴딧 알고리즘이 리그레트를 거의 독립적으로 달성할 수 있는가?
  • RQ2최적의 부분 선택이 어떻게 컨텍스추얼 밴딧 프레임워크에 효과적으로 통합되어 계산 가능성과 통계 효율성을 유지할 수 있는가?
  • RQ3유한하고 작은, 무작위로 생성된 행동 공간에서 탐색과 이용의 최적의 트레이드오프는 무엇인가?
  • RQ4제안된 방법이 저차원 선형 밴딧 문제의 최소화 하한과 일치하는 리그레트 경계를 달성할 수 있는가?
  • RQ5알고리즘이 다양한 희소성 수준과 노이즈 수준에서 실증적으로 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 알고리즘은 고확률로 $\widetilde{\mathcal{O}}(s\sqrt{T})$의 리그레트 경계를 달성하며, 이는 환경 차원 $d$에 거의 의존하지 않는다.
  • 최적의 부분 선택과 SupLinUCB 프레임워크를 조합함으로써 메트릭스 경계가 $\widetilde{\mathcal{O}}(\sqrt{sT})$로 더 날카워지며, 저차원 선형 밴딧 문제의 최소화 하한과 일치한다.
  • 최적의 부분 선택과 에포크 단위 추정을 통해 계산 가능성을 유지하여 고차원에서의 전체 희소 회귀의 비가용성을 피한다.
  • 이론적 분석은 자기정규화된 마틴게일 농도와 릿지 정규화를 사용하여 파라미터 추정기의 신뢰 영역이 엄격하게 제어됨을 확인한다.
  • 수치 실험은 알고리즘이 다양한 고차원 및 희소 설정에서 강건성과 뛰어난 실증 성능을 보임을 보여준다.
  • 희소성과 유한하고 작은 행동 공간을 활용하여 차원의 저주를 효과적으로 다루며, 리그레트 성장률을 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.