Skip to main content
QUICK REVIEW

[논문 리뷰] Bilinear Bandits with Low-rank Structure

Kwang-Sung Jun, Rebecca Willett|arXiv (Cornell University)|2019. 01. 08.
Advanced Bandit Algorithms Research참고 문헌 38인용 수 13
한 줄 요약

이 논문은 저랭크 구조를 가진 이차형 밴딧 문제를 소개한다. 보상은 두 개의 특징 벡터와 알려지지 않은 저랭크 행렬 $\mathbf{\Theta}^*$의 이차형 함수로 정의된다. 제안된 ESTR 알고리즘은 $\mathbf{\Theta}^*$의 부분공간을 먼저 탐색한 후, 정규화된 선형 밴딧 방법(LowOFUL)을 사용하여 이를 정밀화하여 $\widetilde{\mathcal{O}}((d_1+d_2)^{3/2}\sqrt{rT})$의 리그레트 한계를 달성한다. 이는 난이도 높은 선형 밴딧 감소 접근 방식의 $\widetilde{\mathcal{O}}(d_1d_2\sqrt{T})$ 리그레트 한계보다 향상된 것이다.

ABSTRACT

We introduce the bilinear bandit problem with low-rank structure in which an action takes the form of a pair of arms from two different entity types, and the reward is a bilinear function of the known feature vectors of the arms. The unknown in the problem is a $d_1$ by $d_2$ matrix $\mathbfΘ^*$ that defines the reward, and has low rank $r \ll \min\{d_1,d_2\}$. Determination of $\mathbfΘ^*$ with this low-rank structure poses a significant challenge in finding the right exploration-exploitation tradeoff. In this work, we propose a new two-stage algorithm called "Explore-Subspace-Then-Refine" (ESTR). The first stage is an explicit subspace exploration, while the second stage is a linear bandit algorithm called "almost-low-dimensional OFUL" (LowOFUL) that exploits and further refines the estimated subspace via a regularization technique. We show that the regret of ESTR is $\widetilde{\mathcal{O}}((d_1+d_2)^{3/2} \sqrt{r T})$ where $\widetilde{\mathcal{O}}$ hides logarithmic factors and $T$ is the time horizon, which improves upon the regret of $\widetilde{\mathcal{O}}(d_1d_2\sqrt{T})$ attained for a naïve linear bandit reduction. We conjecture that the regret bound of ESTR is unimprovable up to polylogarithmic factors, and our preliminary experiment shows that ESTR outperforms a naïve linear bandit reduction.

연구 동기 및 목표

  • 보상 행렬 $\mathbf{\Theta}^*$가 저랭크일 때 이차형 밴딧 문제의 탐색-이용 균형 문제를 해결하기 위해.
  • 나이브한 선형 밴딧 감소 방식에 비해 리그레트를 줄일 수 있도록 저랭크 구조를 효율적으로 활용하는 알고리즘을 설계하기 위해.
  • 리그레트 한계가 $\sqrt{d_1d_2T}$ 대신 $\sqrt{rT}$에 비례하도록 이론적으로 분석하여 저랭크 문제의 진정된 복잡도를 반영하기 위해.
  • 먼저 $\mathbf{\Theta}^*$의 부분공간을 추정하고, 이후 정규화된 선형 밴딧 접근 방식을 사용해 이를 정밀화하는 이중 단계 방법을 개발하기 위해.

제안 방법

  • 저랭크 구조를 가진 이차형 밴딧 문제를 다루기 위해 '탐색-부분공간-다시조정(ESTR)'이라고 불리는 이중 단계 알고리즘을 제안한다.
  • 첫 번째 단계에서 ESTR는 알려지지 않은 행렬 $\mathbf{\Theta}^*$의 저차원 부분공간을 추정하기 위해 명시적인 부분공간 탐색을 수행한다.
  • 두 번째 단계에서 ESTR는 새로운 정규화된 선형 밴딧 알고리즘인 '거의 저차원 OFUL'(LowOFUL)을 사용한다. 이 알고리즘은 추정된 부분공간을 활용하기 위해 특수하게 설계된 정규화 행렬 $\bm{\Lambda}$를 사용한다.
  • 정규화 행렬 $\bm{\Lambda}$는 추정된 부분공간을 강조하고 고차원 영역의 노이즈를 억제함으로써 리그레트를 최소화하도록 설계되어 있다.
  • 알고리즘은 $\mathbf{\Theta}^*$가 랭크 $r \ll \min\{d_1, d_2\}$를 가지므로, 전체 행렬 추정의 $d_1d_2$ 차원 복잡도를 피할 수 있다.
  • 이론적 분석 결과, LowOFUL은 전체 차원의 합 $d_1 + d_2$와 랭크 $r$에 따라 리그레트 한계를 가지며, 전체 행렬 크기에는 영향을 받지 않는다.

실험 결과

연구 질문

  • RQ1나이브한 선형 밴딧 감소 방식보다 훨씬 우수한 리그레트를 달성할 수 있는 저랭크 보상 구조를 가진 이차형 밴딧 문제를 해결할 수 있는가?
  • RQ2모르는 저랭크 행렬의 부분공간을 먼저 탐색하고, 이후에 효율적으로 정밀화하는 이중 단계 알고리즘을 설계할 수 있는가?
  • RQ3저랭크 구조를 가진 이차형 밴딧 문제에서 달성 가능한 최적의 리그레트 한계는 무엇이며, 실용적인 알고리즘으로 이를 달성할 수 있는가?
  • RQ4부분공간에 대한 사전 지식이 없을 때, 어떻게 정규화를 사용하여 밴딧 환경에서 부분공간 지식을 효과적으로 활용할 수 있는가?

주요 결과

  • ESTR 알고리즘은 $\widetilde{\mathcal{O}}((d_1 + d_2)^{3/2}\sqrt{rT})$의 리그레트 한계를 달성하며, 난이도 높은 선형 밴딧 감소 접근 방식의 $\widetilde{\mathcal{O}}(d_1d_2\sqrt{T})$ 리그레트 한계보다 향상된다.
  • 리그레트 한계는 전체 $d_1d_2$ 차원성 대신 $\sqrt{rT}$에 비례하여, 저랭크 문제의 진정된 복잡도를 반영한다.
  • 제안된 LowOFUL 알고리즘은 철저히 설계된 정규화 행렬 $\bm{\Lambda}$를 통해 추정된 부분공간을 효과적으로 활용하여 고차원 환경에서 리그레트를 감소시킨다.
  • 이론적 분석 결과, 리그레트 한계는 다항로그 인자 외에는 개선될 수 없으며, 이는 ESTR가 거의 최적임을 시사한다.
  • 초기 실험 결과에서 ESTR가 실생활에서 난이도 높은 선형 밴딧 감소 방식을 능가하는 것으로 나타났다.
  • 이 방법은 약물-단백질 상호작용 예측, 온라인 데이팅 매칭, 패션 매칭과 같이 두 종류의 실체가 함께 보상에 기여하는 실세계 추천 시스템에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.