Skip to main content
QUICK REVIEW

[논문 리뷰] Music Recommendations in Hyperbolic Space: An Application of Empirical Bayes and Hierarchical Poincaré Embeddings

Tim Schmeier, Sam Garrett|arXiv (Cornell University)|2019. 07. 24.
Music and Audio Processing참고 문헌 11인용 수 5
한 줄 요약

이 논문은 음악 엔티티(예: 아티스트, 장르, 스테이션) 간의 신뢰할 수 있는 계층적 링크를 추론하기 위해 매개변수적 경험 베이즈를 통합한 초월성 포앙카레 임베딩 모델을 제안한다. 허브릭스 공간에 이러한 엔티티를 임베딩하고, 희박한 사용자 데이터로부터 경험 베이즈를 사용해 링크 신뢰도를 추정함으로써, A/B 테스트에서 유클리드 행렬 분해보다 유의하게 뛰어난 성능을 보이며 개인화된 플레이리스트에서 평균 청취 시간을 17.4% 증가시켰다.

ABSTRACT

Matrix Factorization (MF) is a common method for generating recommendations, where the proximity of entities like users or items in the embedded space indicates their similarity to one another. Though almost all applications implicitly use a Euclidean embedding space to represent two entity types, recent work has suggested that a hyperbolic Poincaré ball may be more well suited to representing multiple entity types, and in particular, hierarchies. We describe a novel method to embed a hierarchy of related music entities in hyperbolic space. We also describe how a parametric empirical Bayes approach can be used to estimate link reliability between entities in the hierarchy. Applying these methods together to build personalized playlists for users in a digital music service yielded a large and statistically significant increase in performance during an A/B test, as compared to the Euclidean model.

연구 동기 및 목표

  • 아티스트, 장르, 라디오 스테이션과 같은 음악 엔티티 간의 계층적 관계를 모델링하여 음악 추천 품질을 향상시키는 것.
  • 고차원적이고 희박한 사용자 상호작용 데이터를 가진 계층적 데이터를 표현하는 데 있어 유클리드 공간의 한계를 해결하는 것.
  • 경험 베이즈를 사용하여 다양한 데이터 소스에서 유의미한 엔티티 링크를 데이터 기반으로 스케일러블하게 추론하는 방법을 개발하는 것.
  • 실제 추천 시스템에서의 초월성 임베딩 성능을 평가하고, 특히 개인화된 플레이리스트 생성에 초점을 맞추는 것.
  • 링크 신뢰도 추정을 통해 새로운 아티스트와 트랙에 대한 수동 쿠리에이션 의존도를 줄이고 자동으로 낮은 데이터 초기화를 가능하게 하는 것.

제안 방법

  • 저자들은 라이브 라디오 스테이션, 포맷, 아티스트, 장르, 트랙의 다섯 가지 음악 엔티티 유형으로 구성된 계층적 네트워크를 구축하며, 방향성 있는 링크를 통해 계층적 및 행동적 관계를 반영한다.
  • 사용자 상호작용을 공액 지수족 분포(예: 이항분포, 포아송분포)로 모델링하여 이질적인 데이터 소스를 통합함으로써, 매개변수적 경험 베이즈를 사용해 엔티티 간 링크 신뢰도를 추정한다.
  • 경험 베이즈에서 도출한 낮은 신뢰도 구간을 사용해 약하거나 노이즈가 많은 링크를 필터링함으로써, 통계적으로 탄탄한 연결만 네트워크에 포함시킨다.
  • 결과적으로 생성된 계층적 네트워크는 초월성 기하학을 사용해 포앙카레 볼에 임베딩되며, 이는 유클리드 공간보다 더 적은 파라미터로 나무 형태의 계층을 자연스럽게 포착한다.
  • 추천은 포앙카레 공간 내에서의 근접도를 계산함으로써 생성되며, 더 가까운 임베딩은 사용자 선호도와 유사도가 높다는 것을 의미한다.
  • 모델은 iHeartRadio의 월간 믹스테이프 플레이리스트 시스템에서 기준 모델인 컬렉티브 행렬 분해(CMF) 모델과의 A/B 테스트를 통해 평가된다.

실험 결과

연구 질문

  • RQ1초월성 포앙카레 임베딩은 유클리드 임베딩보다 음악 엔티티 간 계층적 관계를 더 효과적으로 표현할 수 있는가?
  • RQ2희박하고 이질적인 사용자 데이터를 사용해 매개변수적 경험 베이즈가 음악 엔티티 간 링크의 신뢰도를 신뢰성 있게 추정할 수 있는가?
  • RQ3포앙카레 임베딩과 경험 베이즈 링크 추정을 조합함으로써 실세계 음악 추천 성능에 측정 가능한 향상이 이루어지는가?
  • RQ4모델은 역사적 데이터가 극히 적은 쿨스타트 아이템을 어떻게 다루며, 수동 쿠리에이션 의존도를 줄일 수 있는가?
  • RQ5포앙카레 기반 추천의 장기적 영향은 初기 노출 효과를 초월해 사용자 참여도에 어떤 영향을 미치는가?

주요 결과

  • 포앙카레 모델은 CMF 기준 모델 대비 평균 청취 시간(ALT)을 17.4% 향상시켰으며, 부트스트랩 순열 검정에서 통계적으로 유의미한 결과(p < 0.0001)를 보였다.
  • A/B 테스트 종료 후 최대 3주간 성능 향상이 유지되어 신선도 효과를 초월한 지속적인 긍정적 영향을 보였다.
  • 모델은 쿨스타트 시나리오에 대해 뛰어난 내재성을 보이며, 역사적 데이터가 극히 적은 신규 아티스트와 트랙의 자동 임베딩을 가능하게 했다.
  • 경험 베이즈의 사용은 다양한 데이터 소스의 통합 모델링을 가능하게 하였고, 다양한 데이터 생성 과정 간의 링크 신뢰도 추정을 향상시켰다.
  • 포앙카레 임베딩의 계층적 구조는 고수준 개념(예: 장르, 포맷)과 저수준 엔티티(예: 트랙)를 분리함으로써 모델의 해석 가능성과 효율성을 향상시켰다.
  • 결과는 초월성 공간이 유클리드 공간보다 계층적 음악 데이터에 더 자연스럽고 효과적인 표현 방식을 제공한다는 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.