Skip to main content
QUICK REVIEW

[논문 리뷰] Combating the Cold Start User Problem in Model Based Collaborative Filtering

Sampoorna Biswas, Laks V. S. Lakshmanan|arXiv (Cornell University)|2017. 02. 18.
Recommender Systems and Techniques인용 수 10
한 줄 요약

이 논문은 행렬 분해 기반 협업 필터링에서 프로필 추정 오차를 최소화하는 것을 목표로, 콜드 스타트 사용자에게 최적의 b개 항목을 추천하기 위한 최적화 프레임워크를 제안한다. 문제를 최적의 인터뷰 설계(Optimal Interview Design, OID)로 공식화하고, 목적 함수의 NP-난이도 및 비하위모듈성(Non-submodularity)을 증명하며, 이전 방법들보다 유의미하게 뛰어난 확장성과 비교 가능한 추천 정확도를 유지하는 가속화된 그레디 휴리스틱을 도입한다. 네 개의 실세계 데이터셋에서 검증되었다.

ABSTRACT

For tackling the well known cold-start user problem in model-based recommender systems, one approach is to recommend a few items to a cold-start user and use the feedback to learn a profile. The learned profile can then be used to make good recommendations to the cold user. In the absence of a good initial profile, the recommendations are like random probes, but if not chosen judiciously, both bad recommendations and too many recommendations may turn off a user. We formalize the cold-start user problem by asking what are the $b$ best items we should recommend to a cold-start user, in order to learn her profile most accurately, where $b$, a given budget, is typically a small number. We formalize the problem as an optimization problem and present multiple non-trivial results, including NP-hardness as well as hardness of approximation. We furthermore show that the objective function, i.e., the least square error of the learned profile w.r.t. the true user profile, is neither submodular nor supermodular, suggesting efficient approximations are unlikely to exist. Finally, we discuss several scalable heuristic approaches for identifying the $b$ best items to recommend to the user and experimentally evaluate their performance on 4 real datasets. Our experiments show that our proposed accelerated algorithms significantly outperform the prior art in runnning time, while achieving similar error in the learned user profile as well as in the rating predictions.

연구 동기 및 목표

  • 신규 사용자가 충분한 평가 기록이 없어 발생하는 모델 기반 협업 필터링에서의 콜드 스타트 문제를 해결하기 위해.
  • 진정한 사용자 프로필을 학습하는 데 오차를 최소화하기 위해 콜드 스타트 사용자에게 최적의 b개 항목을 추천하는 문제를 공식적으로 정의하기 위해.
  • 행렬 분해 기반 협업 필터링에서 프로필 학습을 위한 최적의 b개 항목을 선택하는 문제의 계산 복잡도를 분석하고, NP-난이도 및 근사화의 어려움을 증명하기 위해.
  • 낮은 계산 비용으로 높은 품질의 프로필 학습을 달성하는 확장 가능한 휴리스틱 알고리즘을 개발하기 위해.
  • 실세계 데이터셋에서 제안된 알고리즘을 실험적으로 평가하여, 이전 기법들에 비해 뛰어난 확장성과 유사한 정확도를 입증하기 위해.

제안 방법

  • 콜드 스타트 항목 선택 문제를, 진짜와 학습된 사용자 프로필 간의 제곱오차를 최소화하는 최적의 인터뷰 설계(Optimal Interview Design, OID)로 공식화한다.
  • 선택된 b개 항목의 잠재 요인에 기반해 프로필 오차의 닫힌 형태 표현식을 유도함으로써, 진짜 사용자 데이터 없이도 목적 함수를 계산할 수 있도록 한다.
  • 정확 커버리지 문제(Exact Cover by 3-Sets, X3C)로의 감소를 통해 OID 문제의 NP-난이도를 증명함으로써 계산의 비현실성을 입증한다.
  • 목적 함수가 하위모듈성(submodular)이나 초하위모듈성(supermodular)이 아니라는 점을 입증함으로써, 효율적인 근사 알고리즘이 존재할 가능성이 낮다는 것을 시사한다.
  • 고품질의 항목 집합을 탐색하기 위한 가속화된 그레디 휴리스틱—앞서 가속화된 그레디(Foreward Greedy, FG), 앞서 가속화된 그레디 2 (FG2), 뒤에서 가속화된 그레디 (Backward Greedy, BG), 뒤에서 가속화된 그레디 2 (BG2)—을 제안한다.
  • FG2와 BG2에서 빠른 근사 전략을 활용해 중복 계산을 줄임으로써, 정확도를 희생시키지 않고도 수십 배에서 수백 배의 속도 향상을 달성한다.

실험 결과

연구 질문

  • RQ1행렬 분해 기반 협업 필터링에서 콜드 스타트 사용자의 진짜 사용자 프로필을 학습하는 데 오차를 최소화하기 위해 추천할 최적의 b개 항목은 무엇인가?
  • RQ2행렬 분해 기반 협업 필터링에서 프로필 학습을 위한 최적의 b개 항목을 선택하는 문제의 계산 복잡도는 얼마나 되는가?
  • RQ3프로필 오차 목적 함수는 하위모듈성 또는 초하위모듈성인가? 이는 근사 알고리즘에 어떤 의미를 갖는가?
  • RQ4기존 방법들보다 훨씬 빠른 실행 시간을 확보하면서도 높은 품질의 프로필 학습을 달성할 수 있는 확장 가능한 휴리스틱 알고리즘을 설계할 수 있는가?
  • RQ5제안된 알고리즘은 대규모 실세계 데이터셋에서 프로필 오차, 예측 오차, 실행 시간 측면에서 어떻게 성능을 발휘하는가?

주요 결과

  • 최적의 인터뷰 설계(Optimal Interview Design, OID) 문제는 α/θ 요인 이내로 근사가 어려우며, 이는 효율적인 정확하거나 근사 최적해를 찾는 것이 거의 불가능하다는 것을 의미한다.
  • 목적 함수인 진짜와 학습된 사용자 프로필 간의 제곱오차는 하위모듈성이나 초하위모듈성 모두 아니며, 이는 표준 근사 기법이 성공할 가능성이 낮다는 것을 시사한다.
  • 가속화된 그레디 알고리즘인 FG2와 BG2는 ML-100K, ML-1M, Netflix, ML-20M에서의 실험을 통해 비가속화된 대안들과 유사한 프로필 오차와 예측 오차를 달성한다.
  • IDEAL 조건 하에서 ML-100K에서 b=100일 때 FG2는 ABG2가 소요하는 시간의 1/6 이하로 실행 시간을 단축시켰으며, 이는 뚜렷한 확장성 향상을 보여준다.
  • b가 작아질수록 뒤에서 그레디 알고리즘(BG와 BG2)의 실행 시간이 급격히 증가하여, 일반적으로 b가 작은 실세계 시스템에서는 실용성이 떨어진다.
  • 모든 데이터셋에서 FG2는 실행 시간에서 모든 베이스라인들을 압도하며, 프로필 오차와 예측 오차 측면에서도 동등하거나 뛰어난 성능을 보여, 가장 효과적인 휴리스틱으로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.