Skip to main content
QUICK REVIEW

[논문 리뷰] Latent Contextual Bandits and their Application to Personalized Recommendations for New Users

Li Zhou, Emma Brunskill|arXiv (Cornell University)|2016. 04. 22.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 22
한 줄 요약

이 논문은 새로운 사용자에게 개인화된 추천을 향상시키기 위해 사용자를 유한한 잠재 클래스 집합 중 하나에 속하게 하는 Latent Contextual Bandits (LCB)를 제안한다. 과거 사용자 데이터로부터 이러한 잠재 클래스를 학습하고, 초기 상호작용을 개인화하는 데 활용함으로써, 실세계 평가에서 최신 기준인 CLUB 및 Population LinUCB보다 유의미하게 낮은 회귀 손실과 최대 10% 높은 클릭률(CTR)을 달성한다.

ABSTRACT

Personalized recommendations for new users, also known as the cold-start problem, can be formulated as a contextual bandit problem. Existing contextual bandit algorithms generally rely on features alone to capture user variability. Such methods are inefficient in learning new users' interests. In this paper we propose Latent Contextual Bandits. We consider both the benefit of leveraging a set of learned latent user classes for new users, and how we can learn such latent classes from prior users. We show that our approach achieves a better regret bound than existing algorithms. We also demonstrate the benefit of our approach using a large real world dataset and a preliminary user study.

연구 동기 및 목표

  • 기존 상호작용 데이터가 없는 신규 사용자에 대한 냉시작 문제를 해결하기 위해.
  • 사용자 특성에만 의존하는 것과는 달리, 사용자 행동을 유한한 수의 잠재 클래스로 모델링하여 신규 사용자에 대한 학습 효율을 향상시키기 위해.
  • 과거 사용자 데이터를 활용해 잠재 사용자 클래스를 학습하고, 최소한의 초기 상호작용으로도 신규 사용자에게 개인화된 추천을 제공할 수 있는 맥락적 밴디트 알고리즘을 개발하기 위해.
  • 기존 알고리즘보다 더 날카로운 이론적 회귀 손실 경계를 제공하기 위해.
  • 대규모 실세계 데이터셋과 초기 사용자 연구를 통해 접근법을 실증적으로 검증하기 위해.

제안 방법

  • 모든 사용자를 N개의 잠재 클래스 중 하나에 속하게 모델링하며, 각 클래스는 보상 예측을 위한 공유 가중치 벡터 βh와 연결된다.
  • 이전 사용자 데이터로부터 잠재 클래스 구조를 학습하기 위해 텐서 분해 기법(Chaganty & Liang, 2013)을 사용하여 사용자 이질성의 효율적 표현을 가능하게 한다.
  • 알고리즘은 두 단계로 운영된다: 1단계는 초기 탐색을 위해 LinUCB를 사용해 사용자별 파라미터를 학습하고, 2단계는 초기 상호작용 기반으로 신규 사용자를 가장 가능성 높은 잠재 클래스에 할당한다.
  • 사용자 상호작용 패턴을 바탕으로 클러스터링 절차를 통해 잠재 클래스 소속을 추론하며, 모델 파라미터는 온라인 또는 배치 방식으로 업데이트된다.
  • 온라인 학습과 잠재 변수 모델링을 조합하여 탐색과 이용의 균형을 이루면서도 빠르게 신규 사용자에 적응할 수 있도록 한다.
  • 두 단계 학습 과정을 사용한다: 첫째, 이력 데이터로부터 잠재 클래스를 학습하고, 둘째, 신규 사용자를 가장 유사한 잠재 클래스에 할당하여 개인화를 가속화한다.

실험 결과

연구 질문

  • RQ1이전 사용자 데이터로부터 잠재 클래스 구조를 학습하는 것이 신규 사용자에 대한 맥락적 밴디트 성능을 유의미하게 향상시킬 수 있는가?
  • RQ2제안된 잠재 맥락적 밴디트의 회귀 손실이 CLUB 및 Population LinUCB와 같은 기존 알고리즘과 비교해 어떻게 되는가?
  • RQ3냉시작 추천 시나리오에서 개인화와 일반화의 균형을 맞추기 위해 최적의 잠재 클래스 수는 얼마인가?
  • RQ4이중 및 노이즈 있는 보상과 같은 실세계 데이터 제약 조건 하에서 이 방법은 어떻게 성능을 내는가?
  • RQ5순차적 환경에서 새로운 사용자에 빠르게 적응하기 위해 잠재 클래스 모델을 온라인으로 효과적으로 업데이트할 수 있는가?

주요 결과

  • 실세계 Yahoo! 데이터셋(10,000명의 신규 사용자 포함)에서 배치 오프라인 평가 결과, LCB는 CLUB 및 Population LinUCB보다 10% 높은 클릭률(CTR)을 기록했다.
  • 15개 또는 30개의 잠재 모델을 사용할 경우, LCB는 각각 CLUB 및 Population LinUCB보다 CTR을 5%와 10% 높여, 잠재적 구조의 유용성을 입증했다.
  • 순차적 온라인 학습 환경에서, LCB는 매 10,000명의 사용자마다 CLUB 및 Population LinUCB보다 5% 높은 CTR를 유지했으며, 동적인 환경에서의 강건성을 보였다.
  • 기존 기준 알고리즘보다 유의미하게 낮은 회귀 손실을 기록했고, 이론적 회귀 손실 경계도 기존 접근보다 더 날카로웠다.
  • 10명의 참가자가 참여한 예비 사용자 연구에서, LCB는 CTR 0.380 ± 0.076을 기록했고, Population LinUCB의 0.196 ± 0.096보다 뛰어난 성능을 보였다.
  • LCB는 사용자당 20회의 상호작용만으로도 CLUB를 능가했으며, 낮은 데이터 환경과 노이즈 있는 이진 보상 상황에서도 내구성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.