[논문 리뷰] Low-rank Bandits with Latent Mixtures
이 논문은 사용자 선호도와 아이템 보상이 모두 사전에 알려지지 않은 이중 불확실성(두 측면의 불확실성)을 가진 추천 시스템을 위한 새로운 밴딧 알고리즘을 제안한다. 사용자를 C개의 대표적 유형으로 구성된 잠재 혼합 모델로 모델링하며, T번의 상호작용 후 $ ilde{O}(Cackepsilon{BT})$의 리그레트 한계를 달성한다. 이는 부분 피드백과 저질 랭크 보상 구조 하에서 성립한다.
We study the task of maximizing rewards from recommending items (actions) to users sequentially interacting with a recommender system. Users are modeled as latent mixtures of C many representative user classes, where each class specifies a mean reward profile across actions. Both the user features (mixture distribution over classes) and the item features (mean reward vector per class) are unknown a priori. The user identity is the only contextual information available to the learner while interacting. This induces a low-rank structure on the matrix of expected rewards r a,b from recommending item a to user b. The problem reduces to the well-known linear bandit when either user or item-side features are perfectly known. In the setting where each user, with its stochastically sampled taste profile, interacts only for a small number of sessions, we develop a bandit algorithm for the two-sided uncertainty. It combines the Robust Tensor Power Method of Anandkumar et al. (2014b) with the OFUL linear bandit algorithm of Abbasi-Yadkori et al. (2011). We provide the first rigorous regret analysis of this combination, showing that its regret after T user interactions is $\ ilde O(C\\sqrt{BT})$, with B the number of users. An ingredient towards this result is a novel robustness property of OFUL, of independent interest.
연구 동기 및 목표
- 제한된 사용자 상호작용 하에서 사용자 및 아이템 특징이 사전에 알려지지 않은 상황에서 온라인 추천의 과제를 해결한다.
- 사용자를 C개의 잠재 유형에 대한 확률적 혼합으로 모델링하며, 각 유형은 아이템 간에 다른 보상 프로파일을 가진다. 이는 저질 랭크 보상 행렬을 형성한다.
- 부분 피드백(밴딧 스타일)을 통해 동시에 사용자 유형 혼합과 아이템 보상 프로파일을 학습하는 밴딧 알고리즘을 개발한다.
- 잠재 혼합 모델이 있는 이중 불확실성 설정에서 밴딧 알고리즘에 대한 첫 번째 엄밀한 리그레트 분석을 제공한다.
- 노이즈가 섞인 부분 관측으로부터 유도된 추정 공분산 행렬 하에서 OFUL의 강건성을 확보한다.
제안 방법
- OFUL 선형 밴딧 알고리즘과 저질 랭크 구조 및 부분 피드백을 다룰 수 있는 강력한 텐서 승법(RTP) 방법의 변종을 통합한다.
- 밴딧 설정에서 단일 액션 피드백으로부터 보상의 두 번째 및 세 번째 순서 모멘트를 추정하기 위해 중요도 샘플링 기법을 사용한다.
- 제안된 중요도 샘플링 기반으로, 노이즈가 섞인 부분 관측에서 아이템 측면 특징(각 유형별 잠재 보상 벡터)을 복원하기 위한 서브루틴(알고리즘 1)을 적용한다.
- OFUL을 사용해 사용자 선호도 벡터에 대한 신뢰 타원체를 유지하며, 공분산 행렬의 가역성을 보장하기 위해 정규화를 적용한다.
- 모멘트 텐서의 추정 오차 하에서 추정 공분산 행렬이 잘 조절된 상태를 유지함으로써 OFUL의 강건성을 입증한다.
- 고확률 농도 경계와 행렬 섭동 이론을 사용해 추정된 사용자 및 아이템 특징의 오차를 통제한다.
실험 결과
연구 질문
- RQ1사용자 선호도와 아이템 보상 프로파일이 모두 잠재적이고 사전에 알려지지 않은 추천 시스템에서 밴딧 알고리즘이 낮은 리그레트를 달성할 수 있는가?
- RQ2단일 보상(하나의 상호작용당 하나의 보상)만 제공되는 부분 피드백 상황에서 보상 행렬의 저질 랭크 구조는 어떻게 활용할 수 있는가?
- RQ3이중 불확실성 하에서 OFUL과 텐서 기반 추정을 융합한 하이브리드 알고리즘의 리그레트 성능은 어떠한가?
- RQ4공분산 행렬이 노이즈가 섞인 밴딧 수준의 관측으로 추정될 경우 OFUL 알고리즘이 리그레트 보장을 유지할 수 있는가?
- RQ5추정 오차가 존재하는 상황에서 추정 공분산 행렬의 가역성과 안정성을 보장하는 조건은 무엇인가?
주요 결과
- 제안된 알고리즘은 T번의 사용자 상호작용 후 $ackepsilon{O}(Cackepsilon{BT})$의 리그레트 한계를 달성한다. 여기서 B는 사용자 수, C는 잠재 사용자 유형 수이다.
- 이 리그레트 한계는 각 사용자가 소수의 횟수만 상호작용하는 조건 하에서 성립하며, 사용자 또는 아이템 특징에 대한 사전 지식이 없을 때도 유지된다.
- OFUL의 새로운 강건성 성질이 입증되었으며, 이는 공분산 행렬이 오차가 있는 상태로 추정되더라도 리그레트 보장을 유지함을 보여준다.
- 제안된 중요도 샘플링 기반으로 RTP 방법을 통한 잠재 아이템 보상 벡터 복원이 일관적으로 이루어짐을 입증하였다.
- 초기 상호작용 수 $n_0$가 $A$, $C$, $ackepsilon$, 진짜 보상 행렬의 스펙트럼 특성과 관련된 특정 하한을 충족할 경우, 알고리즘의 성능은 고확률 $1 - ackepsilon$로 보장된다.
- 분석을 통해 관측 수가 진짜 행렬의 조건수와 스펙트럼 갭에 연관된 임계값을 초과할 경우, 추정 공분산 행렬이 고확률로 가역적임을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.