Skip to main content
QUICK REVIEW

[논문 리뷰] Latent Bandits Revisited

Joey Hong, Branislav Kveton|arXiv (Cornell University)|2020. 06. 15.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 11
한 줄 요약

이 논문은 모델 불확실성과 모델 잘못 설정을 명시적으로 고려하는 잠재 밴디트에 대한 문맥적 UCB 및 톰슨 샘플링 알고리즘을 제안하며, 더 빠르고 더 강건한 잠재 상태 식별을 가능하게 한다. 잠재 상태 수가 액션 수보다 작은 조건에서 기존 밴디트 정책보다 더 낮은 손실을 기록하며, 합성 데이터와 MovieLens 1M 데이터셋에서 검증되었으며, 평균 및 최악의 사용자 시나리오 모두에서 뛰어난 성능을 보였다.

ABSTRACT

A latent bandit problem is one in which the learning agent knows the arm reward distributions conditioned on an unknown discrete latent state. The primary goal of the agent is to identify the latent state, after which it can act optimally. This setting is a natural midpoint between online and offline learning---complex models can be learned offline with the agent identifying latent state online---of practical relevance in, say, recommender systems. In this work, we propose general algorithms for this setting, based on both upper confidence bounds (UCBs) and Thompson sampling. Our methods are contextual and aware of model uncertainty and misspecification. We provide a unified theoretical analysis of our algorithms, which have lower regret than classic bandit policies when the number of latent states is smaller than actions. A comprehensive empirical study showcases the advantages of our approach.

연구 동기 및 목표

  • 사용자 의도나 선호가 관측되지 않지만 보상에 영향을 주는 온라인 학습 환경에서의 잠재 상태 식별 문제를 해결하기 위해.
  • 오프라인 학습된 보상 모델의 불확실성과 모델 잘못 설정에 강건한 문맥적 밴디트 알고리즘을 설계하기 위해.
  • 잠재 밴디트 프레임워크에서 UCB와 톰슨 샘플링의 이론적 분석을 통합하고, 증명 가능한 손실 한계를 도출하기 위해.
  • 특히 쿨스타트 및 최악의 개인화 시나리오에서 최첨단 기준보다 우수한 경험적 성능을 보여주기 위해.

제안 방법

  • 암시적 보상 모델 파라미터의 불확실성을 반영하기 위해, 무기(arms)가 아닌 잠재 상태에 대한 신뢰구간을 유지하는 새로운 문맥적 UCB 알고리즘을 제안한다.
  • 잠재 상태에 대한 사후 분포에서 샘플링하는 톰슨 샘플링 변형을 도입하며, 오프라인 추정 모델 파라미터 중심의 가우시안 사전분포를 사용하고, 경험적 공분산을 통해 불확실성 정량화를 수행한다.
  • 서브가우시안 보상 가정 하에, UCB와 후행 샘플링 간의 밀접한 연결을 활용하여 통합된 이론적 손실 한계를 도출한다.
  • UCB와 TS를 동시에 분석할 수 있는 통합 프레임워크를 활용하여, 모델 잘못 설정 하에서 이론적 비교 및 강건성 보장을 가능하게 한다.
  • 사용자 및 아이템 표현을 위한 저랭크 행렬 분해 모델을 활용하며, 이는 역사적 데이터를 기반으로 오프라인 학습을 통해 잠재 상태 및 보상 모델을 초기화하는 데 사용된다.
  • 미래 연구에서 비정상적인 잠재 상태 역학을 다루기 위해 할인 및 슬라이딩 윈도우 기법을 적용한다.

실험 결과

연구 질문

  • RQ1UCB와 톰슨 샘플링은 오프라인 학습된 모델 파라미터의 불확실성을 명시적으로 다룰 수 있도록 잠재 밴디트 설정에 적응시킬 수 있는가?
  • RQ2잠재 상태 수가 액션 수보다 작은 조건에서, 불확실성 인식 알고리즘이 기존 밴디트 정책 대비 손실 측면에서 어떻게 성능을 내는가?
  • RQ3제안된 알고리즘은 쿨스타트 및 최악의 사용자 시나리오에서 개인화 속도와 강건성을 얼마나 향상시키는가?
  • RQ4잠재 밴디트 프레임워크에서 UCB와 톰슨 샘플링에 대한 통합된 이론적 분석을 개발할 수 있는가?

주요 결과

  • 제안된 mmTS 알고리즘은 MovieLens 1M 데이터셋에서 평균 및 최악의 사용자 성능 모두에서 mTS 및 LinTS를 능가하며, 평균 평점이 유의미하게 높아졌다.
  • 전체 영화 벡터 정보에 접근할 수 있는 조건에서도 mmTS는 EXP4 및 LinUCB보다 더 나은 장기적 보상을 달성하며 수렴한다.
  • 가장 열악한 10% 사용자들에 대해서도 mmTS는 mTS보다 훨씬 높은 평균 평점을 기록하며, 모델 잘못 설정에 대한 강건성을 입증한다.
  • 잠재 상태 수가 액션 수보다 작은 조건에서 제안된 알고리즘의 이론적 손실 한계는 기존 밴디트 정책보다 낮다.
  • 경험적 결과는 모델 불확실성을 고려함으로써 쿨스타트 시나리오에서 특히 더 빠르고 신뢰할 수 있는 잠재 상태 식별이 가능하다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.