Skip to main content
QUICK REVIEW

[논문 리뷰] Determining Song Similarity via Machine Learning Techniques and Tagging Information

Renato L. F. Cunha, Evandro Caldeira|arXiv (Cornell University)|2017. 04. 12.
Music and Audio Processing참고 문헌 6인용 수 3
한 줄 요약

이 논문은 오직 메타데이터(아티스트, 제목)와 사용자 생성 태그만을 사용하여 음악 유사도를 결정하는 기계학습 접근법을 제안한다. tf-idf와 k-NN 모델을 활용하며, tf-idf는 Word2Vec보다 뛰어나고, k-NN은 SVM과 선형 회귀보다 뚜렷이 슈퍼리어하다. 이는 500만곡의 Last.fm 데이터셋에서 가장 높은 R² 점수를 기록했다.

ABSTRACT

The task of determining item similarity is a crucial one in a recommender system. This constitutes the base upon which the recommender system will work to determine which items are more likely to be enjoyed by a user, resulting in more user engagement. In this paper we tackle the problem of determining song similarity based solely on song metadata (such as the performer, and song title) and on tags contributed by users. We evaluate our approach under a series of different machine learning algorithms. We conclude that tf-idf achieves better results than Word2Vec to model the dataset to feature vectors. We also conclude that k-NN models have better performance than SVMs and Linear Regression for this problem.

연구 동기 및 목표

  • 오디오 파일이 필요 없이 메타데이터와 태그 기반의 확장 가능한 음악 유사도 예측 방법을 개발하기 위해.
  • 텍스트 기반 메타데이터와 태그에서 음악 특징 벡터를 모델링하는 데에 NLP 기법들인 tf-idf와 Word2Vec의 효과를 평가하기 위해.
  • 다양한 기계학습 알고리즘—k-NN, SVM, 선형 회귀—의 음악 유사도 예측 성능을 비교하기 위해.
  • 사용자 청취 이력에서 음악 쌍의 동시 발생 빈도를 기반으로 한 유사도 메트릭을 기준 진짜 유사도로 설정하기 위해.
  • 음악 유사도 예측에 있어 가장 효과적인 특징 표현 방식과 학습 알고리즘 조합을 규명하기 위해.

제안 방법

  • 데이터셋은 Last.fm API를 통해 수집되었으며, 음악 메타데이터, 사용자 태그, 1,380만 개의 음악 쌍에 대한 동시 발생 기반 유사도 점수를 포함한다.
  • 텍스트 정규화를 적용하여 음절, 특수 문자를 제거하고, 유니코드를 가장 가까운 라틴 문자로 변환하였으며, 'Rolling Stones'와 같은 다단어 용어는 단일 토큰으로 통합되었다.
  • 두 가지 NLP 기법을 사용하여 특징 벡터를 구성하였다: tf-idf(각 음악의 태그를 문서로 간주)와 Word2Vec(태그 벡터의 가중 평균을 사용하며, 태그 빈도를 가중치로 활용).
  • k-NN 모델은 특징 벡터 간 코사인 유사도를 사용하여 유사도를 예측하였으며, 성능 평가에 R² 점수를 사용하였다.
  • 데이터셋은 원본, s>1%, s>2.5%로 세 가지 버전으로 필터링되어, 저유사도 쌍에 대한 민감도를 평가하기 위해 사용되었다.
  • 모델 평가는 10만 개의 샘플링된 음악을 사용하였으며, 훈련 및 테스트 세트로 나누었으며, R²를 주요 메트릭으로 사용하여 모델 적합도를 평가하였다.

실험 결과

연구 질문

  • RQ1메타데이터와 태그에서 유사도를 예측할 때, tf-idf가 Word2Vec보다 더 효과적인 음악 특징 표현을 제공하는가?
  • RQ2텍스트 기반 특징을 사용할 때, k-NN, SVM, 선형 회귀 모델 간의 음악 유사도 예측 성능은 어떻게 비교되는가?
  • RQ3저유사도 음악 쌍(s < 1% 또는 s < 2.5%)을 제거함으로써 모델 성능이 향상되는가?
  • RQ4사용자 청취 이력에서 유도된 동시 발생 기반 유사도 메트릭이 음악 유사도에 대해 타당하고 효과적인 기준 진짜 값인가?
  • RQ5이 맥락에서 k-NN이 SVM과 선형 회귀와 같은 더 복잡한 모델보다 뛰어난 성능을 보이는 이유는 무엇인가?

주요 결과

  • tf-idf는 모든 데이터 필터링 조건에서 Word2Vec보다 높은 R² 점수를 기록하여 더 뛰어난 성능을 보였다.
  • k-NN 모델은 SVM과 선형 회귀를 모두 능가하였으며, 특히 원본 데이터셋에서 가장 높은 R² 점수를 기록하였고, k=10일 때 R²가 0.305에 도달하였다.
  • 원본 데이터셋에서 가장 성능이 뛰어난 k-NN 모델은 R² 점수 0.305를 기록하였으며, 이는 평균 예측기(R² = 0)를 크게 뛰어넘어 의미 있는 예측 능력을 지닌다는 것을 시사한다.
  • SVM(SVR)는 모든 설정에서 가장 열악한 성능을 보였으며, R² 점수는 모든 구성에서 0.2 이하였고, 일부 필터링 설정에서는 음수 점수를 기록하였다.
  • 저유사도 쌍(s>1% 또는 s>2.5%)을 제거함으로써 모든 모델의 성능이 떨어졌으며, 특히 k-NN의 경우 R²가 각각 0.105와 0.069로 하락하여, 저유사도 쌍이 모델의 일반화에 기여한다는 점을 시사한다.
  • 선형 회귀 모델은 매우 열악한 성능을 보였으며, R² 점수는 거의 0에 가까워, 데이터셋의 평균 값을 예측하는 것과 거의 동일한 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.