[논문 리뷰] Contextual Bandits with Latent Confounders: An NMF Approach
이 논문은 잠재 공액인자가 존재하지만 관측되지 않는 맥락 기반 밴딧 문제를 위한 NMF-Bandit 알고리즘을 제안한다. 비음수 행렬 분해(NMF)를 사용하여 평균 보상 행렬의 저질서 구조를 모델링한다. 이는 $\mathcal{O}(L\cdot\mathrm{poly}(m,\log K)\log T)$의 리그레트 경계를 달성하며, $m \ll L,K$일 때 기존 맥락 기반 밴딧의 $\mathcal{O}(LK\log T)$보다 크게 향상된다. 이는 낮은 질서와 일관성 조건이 만족될 경우에 해당된다.
Motivated by online recommendation and advertising systems, we consider a causal model for stochastic contextual bandits with a latent low-dimensional confounder. In our model, there are $L$ observed contexts and $K$ arms of the bandit. The observed context influences the reward obtained through a latent confounder variable with cardinality $m$ ($m \ll L,K$). The arm choice and the latent confounder causally determines the reward while the observed context is correlated with the confounder. Under this model, the $L imes K$ mean reward matrix $\mathbf{U}$ (for each context in $[L]$ and each arm in $[K]$) factorizes into non-negative factors $\mathbf{A}$ ($L imes m$) and $\mathbf{W}$ ($m imes K$). This insight enables us to propose an $ε$-greedy NMF-Bandit algorithm that designs a sequence of interventions (selecting specific arms), that achieves a balance between learning this low-dimensional structure and selecting the best arm to minimize regret. Our algorithm achieves a regret of $\mathcal{O}\left(L\mathrm{poly}(m, \log K) \log T ight)$ at time $T$, as compared to $\mathcal{O}(LK\log T)$ for conventional contextual bandits, assuming a constant gap between the best arm and the rest for each context. These guarantees are obtained under mild sufficiency conditions on the factors that are weaker versions of the well-known Statistical RIP condition. We further propose a class of generative models that satisfy our sufficient conditions, and derive a lower bound of $\mathcal{O}\left(Km\log T ight)$. These are the first regret guarantees for online matrix completion with bandit feedback, when the rank is greater than one. We further compare the performance of our algorithm with the state of the art, on synthetic and real world data-sets.
연구 동기 및 목표
- 관측되지 않는 저차원 잠재 공액인이 보상에 영향을 주는 맥락 기반 밴딧 문제에서 리그레트 최소화의 과제를 해결하기 위해.
- 크기가 $m \ll L,K$인 잠재 공액인자에 의해 유도된 평균 보상 행렬 $\mathbf{U} \in \mathbb{R}^{L \times K}$의 저질서 구조를 활용하기 위해.
- 보상 행렬의 잠재 NMF 구조를 학습하면서 탐색과 이용의 균형을 이루는 온라인 학습 알고리즘을 개발하기 위해.
- 표준 RIP보다 더 약한 조건 하에서 이론적 리그레트 경계를 확립하기 위해.
- 행렬 질서가 1을 초과할 때 벨류에이션 피드백을 통한 온라인 행렬 완성에 대해 처음으로 리그레트 보장을 제공하기 위해.
제안 방법
- 잠재 공액인자에 의해 유도된 평균 보상 행렬 $\mathbf{U}$를 두 개의 비음수 행렬 $\mathbf{A} \in \mathbb{R}^{L \times m}$과 $\mathbf{W} \in \mathbb{R}^{m \times K}$의 곱으로 모델링한다. 여기서 $\mathbf{A}$는 맥락에서 공액인자로의 사상, $\mathbf{W}$는 공액인자에서 액션으로의 사상이다.
- NMF-Bandit 알고리즘에서 $\epsilon$-그리디 전략을 사용하여 액션 탐색과 학습된 NMF 요소의 이용을 균형 잡는다.
- 관측된 맥락 $S$가 잠재 공액인자 $Z$의 노이즈 있는 프록시이고, 보상 $Y$가 액션 $A$와 $Z$에 모두 의존하는 인과 모델을 적용한다.
- 균일한 공액인자 분포 하에서 각 맥락이 관측되는 기대 횟수가 $\Theta(T/m)$임을 활용하여 구조적 탐색을 가능하게 한다.
- KL 발산 기반 정보 이론적 접근과 찬너프 경계를 사용하여 리그레트의 하한을 유도하며, 열열하지 않은 액션의 구별 가능성에 의존한다.
- NMF 구조와 밴딧 리그레트 이론을 융합한 새로운 분석 프레임워크를 사용하여, $\mathbf{A}$와 $\mathbf{W}$에 대한 약한 충족 조건 하에서 리그레트 경계를 확립한다.
실험 결과
연구 질문
- RQ1관측되지 않는 잠재 공액인이 존재할 때, 보상 행렬이 저질서 구조를 띠는 맥락 기반 밴딧 문제에서 더 나은 리그레트 경계를 달성할 수 있는가?
- RQ2직접 공액인자를 접근할 수 없을 때, 이 잠재 저질서 구조를 효과적으로 학습하고 활용할 수 있는 온라인 학습 알고리즘을 어떻게 설계할 수 있는가?
- RQ3행렬 질서가 1을 초과할 때, 밴딧 피드백을 통한 온라인 행렬 완성에 대해 어떤 이론적 리그레트 보장을 확립할 수 있는가?
- RQ4제안된 NMF 요소에 대한 조건은 표준 가정인 제한 이sov레션 성질(RIP)과 어떻게 비교되는가?
- RQ5이 설정에서 리그레트의 기본 하한은 무엇이며, 제안된 알고리즘이 달성한 상한과 비교해 볼 때 어떻게 되는가?
주요 결과
- 제안된 NMF-Bandit 알고리즘은 $\mathcal{O}(L\cdot\mathrm{poly}(m,\log K)\log T)$의 리그레트 경계를 달성하며, $m \ll L,K$일 때 기존 맥락 기반 밴딧의 $\mathcal{O}(LK\log T)$보다 크게 향상된다.
- 리그레트 경계는 표준 Restricted Isometry Property(RIP)보다 더 약한 조건인 NMF 요소의 약한 충족 조건 하에서도 성립한다.
- 논문은 리그레트에 대해 $\mathcal{O}(Km\log T)$의 하한을 확립하였으며, 이는 제안된 알고리즘의 리그레트가 로그 인자 수준에서 거의 최적임을 보여준다.
- 분석은 NMF 구조와 밴딧 리그레트 이론을 융합한 새로운 기법을 도입하였으며, KL 발산과 찬너프 경계를 사용하여 정보 이론적 하한을 도출한다.
- 알고리즘은 합성 및 실세계 데이터셋에서 실험적으로 검증되었으며, 최신 기준 대비 뛰어난 성능을 보였다.
- 결과는 보상 행렬의 잠재 저질서 구조를 활용함으로써 고차원 맥락 기반 밴딧 문제에서 확장 가능하고 효율적인 온라인 의사결정이 가능함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.