[논문 리뷰] MusicMood: Predicting the mood of music from song lyrics using machine learning
이 논문은 가사에 기반해 음악이 행복하거나 슬픈 분위기를 전달하는지 예측하는 나이브 베이즈 분류기를 제안하며, 200곡의 검증 세트에서 88.89%의 정밀도를 달성한다. 시스템은 n-그램 및 스테밍 기법을 적용한 전처리된 가사에서 tf-idf 특성 벡터를 사용하여, 작은 데이터셋 크기로 인한 잠재적 과적합에도 불구하고 행복한 음악을 효과적으로 걸러내는 데 높은 정밀도를 보였다.
Sentiment prediction of contemporary music can have a wide-range of applications in modern society, for instance, selecting music for public institutions such as hospitals or restaurants to potentially improve the emotional well-being of personnel, patients, and customers, respectively. In this project, music recommendation system built upon on a naive Bayes classifier, trained to predict the sentiment of songs based on song lyrics alone. The experimental results show that music corresponding to a happy mood can be detected with high precision based on text features obtained from song lyrics.
연구 동기 및 목표
- 음악의 분위기를 가사만을 기반으로 예측하는 기계학습 모델을 개발하는 것.
- 분위기 예측 연구를 위해 '행복' 또는 '슬픔'으로 레이블링된 2,773개의 가사로 구성된 새로운 데이터셋을 구축하는 것.
- 아티스트와 곡 제목을 입력받아 실시간으로 음악의 분위기를 예측할 수 있는 웹 애플리케이션을 구축하는 것.
- 다양한 텍스트 특성 표현 방식과 전처리 기법이 분위기 분류 성능에 미치는 영향을 평가하는 것.
- 텍스트 기반 감성 분석을 활용해 감정적 분위기를 가진 음악 라이브러리에서 필터링할 수 있는지의 가능성을 탐색하는 것.
제안 방법
- 밀리언 송 데이터셋에서 무작위로 10,000首의 곡을 추출하였으며, 아티스트와 곡 제목 메타데이터를 사용해 LyricWikia에서 가사를 수집하였다.
- 영어 단어 수와 총 단어 수를 비교하여 비영어 가사를 걸러내었으며, 주로 영어로 구성된 곡들만 유지하였다.
- 최종적으로 2,773곡의 데이터셋을 1,000개의 학습 샘플과 200개의 검증 샘플로 분할하였으며, 가사 내용과 청취 테스트를 바탕으로 수작업으로 분위기 레이블(행복/슬픔)을 할당하였다.
- 텍스트 특성은 n-그램(1–3), 불용어 제거, Porter 스테밍을 적용한 백오브워즈 모델을 사용한 후, 이진화, 단어 빈도(tf), tf-idf 벡터화를 거쳤다.
- 10겹 교차검증을 통해 다항분포 및 다변량 베르누이 나이브 베이즈 모델 3종을 학습하고 평가하였으며, 그리드 서치를 통한 초모수 튜닝을 실시하였다.
- 최종 모델은 전체 학습 세트로 재학습하고 검증 세트에서 평가하였으며, 정밀도, 재현율, ROC-AUC 지표를 사용해 성능을 측정하였다.
실험 결과
연구 질문
- RQ1가사만으로도 음악의 분위기를 행복 또는 슬픔으로 정확히 예측할 수 있는가?
- RQ2불용어 제거, 스테밍, n-그램 크기 등의 다양한 텍스트 전처리 기법이 분위기 분류 성능에 미치는 영향은 어떠한가?
- RQ3가사 텍스트에 대해 나이브 베이즈를 사용할 때, 이진화, tf, tf-idf 중 어떤 특성 표현 방식이 분위기 예측에 가장 적합한가?
- RQ4고차원적 특성 공간에서 작은 데이터셋으로 학습할 경우 과적합이 얼마나 심각하게 발생하는가?
- RQ5실용적인 음악 추천 시스템에서 슬픈 곡을 최소한의 오진 억제로 효과적으로 걸러낼 수 있는 고정밀도 분위기 분류기를 구축할 수 있는가?
주요 결과
- tf-idf 특성 표현 방식을 사용한 다항분포 나이브 베이즈 분류기가 ROC-AUC 점수에서 가장 높은 성능을 보이며, 베르누이 및 tf 기반 모델을 모두 앞섰다.
- 불용어 제거가 모든 설정에서 일관되게 성능 향상을 이끌어내었으며, 이는 일반적인 단어들이 분위기 예측 신호를 감소시킨다는 것을 시사한다.
- 학습 세트에서는 99.60%의 정밀도를 기록했고, 200곡의 검증 세트에서는 88.89%의 정밀도를 달성하여, 작은 데이터셋 크기와 광범위한 초모수 튜닝으로 인한 과적합 위험이 있음을 시사한다.
- 1-그램을 초과하는 n-그램 크기 증가는 성능에 악영향을 미치며, 모든 설정에서 1-그램이 가장 우수한 결과를 보였다.
- 워드 클라우드 시각화 결과, 행복한 곡과 슬픈 곡 양쪽 모두에서 관련 없는 공통 단어가 빈번히 나타나, 이러한 단어를 억제하기 위해 tf-idf의 사용이 타당하다는 것을 입증하였다.
- 높은 정밀도를 기록한 모델은 감정 기반 분류 이전에 큰 음악 라이브러리에서 슬픈 음악을 효과적으로 제거하는 신뢰할 수 있는 필터로 활용될 수 있음을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.