Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale Collaborative Filtering with Product Embeddings

Thom Lake, Sinead A. Williamson|arXiv (Cornell University)|2019. 01. 11.
Recommender Systems and Techniques참고 문헌 41인용 수 9
한 줄 요약

이 논문은 4000만 명의 사용자와 1000만 개의 품목을 포함한 대규모 개인화 추천에서 기존 행렬 분해의 확장성과 계산 부담 문제를 해결하기 위해 사전 훈련된 제품 임베딩을 활용하는 주의 기반 공동 필터링 모델을 제안한다. 목표 품목에 대한 관련성을 기반으로 사용자의 이전 상호작용을 동적으로 가중치를 부여함으로써, 오프라인 평가에서 최신 기술 수준의 성능을 달성하고 온라인 A/B 테스트에서 실제 전자상거래 환경에서 우수한 커버리지, 효율성, 적응성으로 생산 시스템을 능가한다.

ABSTRACT

The application of machine learning techniques to large-scale personalized recommendation problems is a challenging task. Such systems must make sense of enormous amounts of implicit feedback in order to understand user preferences across numerous product categories. This paper presents a deep learning based solution to this problem within the collaborative filtering with implicit feedback framework. Our approach combines neural attention mechanisms, which allow for context dependent weighting of past behavioral signals, with representation learning techniques to produce models which obtain extremely high coverage, can easily incorporate new information as it becomes available, and are computationally efficient. Offline experiments demonstrate significant performance improvements when compared to several alternative methods from the literature. Results from an online setting show that the approach compares favorably with current production techniques used to produce personalized product recommendations.

연구 동기 및 목표

  • 4000만 명의 사용자와 1000만 개의 품목을 포함한 대규모 공동 필터링 환경에서 기존 행렬 분해 기반의 추천 시스템의 확장성과 계산 부담 문제를 해결하기 위해.
  • 사용자 선호도 모델링을 위해 사전 훈련된 품목 임베딩을 활용하여 재학습이 필요 없는 성능 향상을 도모하기 위해.
  • 주어진 쿼리 품목에 대해 관련된 이전 상호작용을 선택하는 맥락 인식형 주의 기반 메커니즘을 개발하여 개인화 수준을 향상시키기 위해.
  • 생산 추천 파이프라인에서 신속한 데이터 및 기능 통합을 가능하게 하고, 저지연 시간 추론을 지원하는 효율적인 아키텍처를 확보하기 위해.
  • 주의 기반 모델링이 사전 훈련된 임베딩을 활용할 경우 오프라인 및 온라인 환경에서 기존 공동 필터링 및 비개인화 기반 베이스라인을 능가하는가를 입증하기 위해.

제안 방법

  • 모델은 스킵그램 방식의 알고리즘을 공동 필터링에 적응시켜 학습한 사전 훈련된 품목 임베딩을 사용하여, 제품에 대한 조밀하고 공유 가능한 표현을 제공한다.
  • 사용자 선호도 모델링을 위해 주의 메커니즘이 쿼리 품목과의 유사도를 기반으로 사용자의 이전 상호작용에 대한 맥락 의존적 가중치를 계산한다.
  • 사용자-품목 쌍의 최종 예측 점수는 주의 가중치가 학습된 피드포워드 신경망을 통해 계산된 가중치를 기반으로 품목 임베딩 유사도의 가중합으로 계산된다.
  • 주의 메커니즘은 사용자의 관련된 과거 행동에 동적으로 집중할 수 있도록 해, 고정된 사용자 임베딩보다 더 유연한 적응성을 확보한다.
  • 모델은 암시적 피드백을 기반으로 엔드 투 엔드로 훈련되며, NDCG 및 Recall@K와 같은 순위 기반 지표 최적화를 위해 경험 분포에서의 음성 샘플링을 활용한다.
  • 아키텍처는 증분 업데이트를 지원하며 계산적으로 효율적이므로 대규모 실시간 추론이 가능하다.

실험 결과

연구 질문

  • RQ1목표 품목에 대한 관련성을 기반으로 사용자의 이전 상호작용을 동적으로 가중치를 부여함으로써 주의 메커니즘이 개인화 순위 매기기 성능을 향상시킬 수 있는가?
  • RQ2사전 훈련된 품목 임베딩을 활용한 주의 기반 모델은 기존 공동 필터링 및 비개인화 기반 베이스라인과 비교해 순위 성능에서 어떻게 다른가?
  • RQ3사전 훈련된 품목 임베딩이 대규모 추천 시스템에서 확장성 향상과 학습 비용 절감에 얼마나 기여하는가?
  • RQ4주의 기반 모델은 다양한 샘플링 분포(예: 균일 분포 대 비경험 분포)에서 다양한 평가 지표에 대해 잘 일반화되는가?
  • RQ5기존 생산 환경에서의 개인화 알고리즘과 비교해 주의 메커니즘이 실시간 온라인 CTR 성능을 향상시킬 수 있는가?

주요 결과

  • 주의 기반 모델은 모든 평가 환경에서 NDCG 및 Recall@K에서 통계적으로 유의미한 향상을 달성하였으며, 비개인화 및 행렬 분해 기반 베이스라인을 모두 능가하였다.
  • 경험 분포에서 음성 샘플링을 활용한 오프라인 평가에서 주의 모델은 가장 높은 NDCG와 Recall@K를 기록하였으며, 다음으로 좋은 베이스라인 대비 상대적 개선률이 10퍼센트 이상이었다.
  • 온라인 A/B 테스트에서 제안된 모델을 활용해 생성된 콘텐츠는 가장 높은 CTR를 기록하였으며, 상위 두 성능을 보인 콘텐츠 항목 모두 주의 모델에 의해 생성되었다.
  • 주의 네트워크의 깊이를 2에서 4로 늘일 경우 성능 향상이 뚜렷했으며, 깊이 4를 초과하면 수익 감소 효과가 나타났다.
  • 모델은 다양한 샘플링 분포(예: 균일 대비 경험 분포)에서도 강건하게 성능을 유지하였으며, 다양한 평가 조건 하에서도 뛰어난 성능을 보였다.
  • 주의 메커니즘은 해석 가능한 주의 가중치를 제공하여 어떤 과거 상호작용이 추천에 영향을 주었는지에 대한 통찰을 제공하였으며, 모델의 투명성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.