[논문 리뷰] Love Me, Love Me, Say (and Write!) that You Love Me: Enriching the WASABI Song Corpus with Lyrics Annotations
이 논문은 173만 개의 노래 가사로 구성된 다국어 대규모 WASABI 노래 가사 코퍼스를 제시한다. 이 코퍼스는 자동화된 주석을 통해 구조, 정서, 노골적 내용, 주제, 주요 문장 등을 풍부하게 처리하였다. 자연어 처리(NLP) 및 음성 분석 기법을 활용해 가사에서 의미적이고 정서적 특징을 추출함으로써 지능형 음악 탐색, 추천 및 분석이 가능해졌으며, 지속적인 모델 개선과 데이터 및 도구의 공개가 이루어지고 있다.
We present the WASABI Song Corpus, a large corpus of songs enriched with metadata extracted from music databases on the Web, and resulting from the processing of song lyrics and from audio analysis. More specifically, given that lyrics encode an important part of the semantics of a song, we focus here on the description of the methods we proposed to extract relevant information from the lyrics, such as their structure segmentation, their topics, the explicitness of the lyrics content, the salient passages of a song and the emotions conveyed. The creation of the resource is still ongoing: so far, the corpus contains 1.73M songs with lyrics (1.41M unique lyrics) annotated at different levels with the output of the above mentioned methods. Such corpus labels and the provided methods can be exploited by music search engines and music professionals (e.g. journalists, radio presenters) to better handle large collections of lyrics, allowing an intelligent browsing, categorization and segmentation recommendation of songs.
연구 동기 및 목표
- 음악 정보 검색 및 추천를 지원하기 위해 의미적이고 정서적 메타데이터로 풍부하게 처리된 대규모 다국어 노래 가사 코퍼스를 구축하기 위해.
- 노래 가사가 핵심적인 의미적 및 정서적 내용을 담고 있기 때문에, 이러한 가사에서 의미 있고 구조화된 정보를 추출하는 데 도전하는 것.
- 노래 가사의 구조, 정서, 노골성, 주제, 주요 문장 등을 자동으로 주석화하기 위한 NLP 방법을 개발하고 적용하기 위해.
- 풍부하게 주석 처리된 가사 데이터를 활용해 음악 전문가 및 검색 엔진이 지능적인 브라우징, 분류 및 개인화된 추천을 수행할 수 있도록 하기 위해.
- 재현 가능성과 향후 연구를 위해 코퍼스, 훈련된 모델, 도구에 대한 개방형 접근을 제공하기 위해.
제안 방법
- 웹 기반 음악 데이터베이스(예: LyricWiki, DBpedia, Last.fm)를 활용하여 210만 개의 노래에 대한 메타데이터를 수집하고 통합하였으며, 그 중 173만 개는 가사가 포함되어 있었다.
- 시퀀스 모델링 및 정렬 기법을 사용하여 구조적 단위(예: 연주, 후렴, 브릿지 등)로 가사를 계층적으로 분할하는 모델을 적용하였다.
- 구조적 신호와 임베딩 기반 클러스터링을 융합한 접근 방식을 통해 주요 문장을 바탕으로 간결하고 대표적인 노래 요약문을 생성하였다.
- BERT 기반 임베딩을 사용하고 정제된 데이터셋으로 미세조정한 이진 분류기로 가사의 노골적 내용을 탐지하였다.
- 가성도와 각성도를 기반으로 한 이중 차원 정서 모델을 개발하였으며, 가사 임베딩에 대해 약한 지도 기반 클러스터링을 통해 훈련하였다.
- 전체 코퍼스에 대해 확률적 주제 모델링을 적용하기 위해 60개 주제를 가진 잠재도출 분포(Latent Dirichlet Allocation, LDA)를 사용하여 이해하기 쉬운 주제 레이블을 추출하였다.
실험 결과
연구 질문
- RQ1어떻게 자연어 처리 기법을 활용하여 노래 가사를 연주, 후렴, 브릿지 등의 구조적 구성요소로 자동으로 분할할 수 있는가?
- RQ2지속적인 가성도-각성도 차원을 사용해 노래 가사의 정서를 얼마나 잘 모델링할 수 있으며, 인간의 인식과 얼마나 잘 일치하는가?
- RQ3대규모 노래 가사에서 주제 모델링이 이해하기 쉬운 주제를 효과적으로 추출할 수 있는가? 이러한 주제들은 시간이 지남에 따라 어떻게 변화하는가?
- RQ4노골적 내용 및 주요 문장과 같은 주석이 장르, 정서, 가사 구조와 어떻게 상관관계가 있는가?
- RQ5인기 음악의 수십 년에 걸친 시간적 흐름에서 가사 주제, 노골성, 정서 표현의 변화 추세는 어떠한가?
주요 결과
- WASABI 노래 가사 코퍼스는 36개 언어로 구성된 173만 개의 고유한 노래 가사로 이루어져 있으며, 그 중 105만 개는 60개 주제 LDA 모델에 의해 주석 처리되었다.
- 가성도-각성도 프레임워크를 사용하여 173만 개의 노래에 대해 정서 주석을 성공적으로 예측하였으며, 16,000개의 노래는 상세한 정서 벡터를 획득하였다.
- 노골적 내용 주석이 715,000개의 노래에 대해 부여되었으며, 그 중 52,000개는 노골적이라고 레이블링되어 있어 성숙한 콘텐츠의 상당 비율을 차지하고 있음을 시사한다.
- 구조적 특징과 임베딩 기반 선택을 조합하여 50,000개의 노래에 대해 주요 문장 요약문을 생성하였으며, 이는 요약 품질 향상에 기여하였다.
- 주제 모델링 분석 결과, '사랑'과 '마약'과 같은 주제는 특정 시대에 걸쳐 뚜렷한 시간적 추세를 보였으며, 변화가 관찰되었다.
- 상관관계 분석 결과, 정서적으로 강렬한 가사는 더 자주 구조적으로 분할되고 주제적으로 집중되어 있음을 확인하여, 다층 주석의 실용성을 뒷받침하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.