[논문 리뷰] Evaluating language models of tonal harmony
이 연구는 대규모 서양 공통실습 톤 음악 코퍼스에서 유한한 문맥(n-그램) 및 순환 신경망(RNN) 언어 모델을 사용하여 카드 예측을 평가한다. 이는 조화의 다양성을 유지하는 데이터 기반 카드 인코딩 체계를 사용한다. PPM 기반의 유한한 문맥 모델은 희귀한 카드 유형에 확률을 할당할 수 있는 능력 덕분에 RNN보다 뛰어나며, 특히 피아노 음악에서 그렇다. 이는 RNN이 희귀한 카드에 어려움을 겪는다는 것을 확인한 회귀 분 析로 뒷받침된다.
This study borrows and extends probabilistic language models from natural language processing to discover the syntactic properties of tonal harmony. Language models come in many shapes and sizes, but their central purpose is always the same: to predict the next event in a sequence of letters, words, notes, or chords. However, few studies employing such models have evaluated the most state-of-the-art architectures using a large-scale corpus of Western tonal music, instead preferring to use relatively small datasets containing chord annotations from contemporary genres like jazz, pop, and rock. Using symbolic representations of prominent instrumental genres from the common-practice period, this study applies a flexible, data-driven encoding scheme to (1) evaluate Finite Context (or n-gram) models and Recurrent Neural Networks (RNNs) in a chord prediction task; (2) compare predictive accuracy from the best-performing models for chord onsets from each of the selected datasets; and (3) explain differences between the two model architectures in a regression analysis. We find that Finite Context models using the Prediction by Partial Match (PPM) algorithm outperform RNNs, particularly for the piano datasets, with the regression model suggesting that RNNs struggle with particularly rare chord types.
연구 동기 및 목표
- 톤 음악의 카드 유형에 대해 사전 가정을 최소화하는 데이터 기반으로도 유연한 카드 표현 체계를 개발하는 것.
- 공통실습 시대 음악의 대규모 코퍼스에서 최신 기술의 언어 모델—유한한 문맥(n-그램) 및 RNN—을 사용하여 카드 예측을 평가하는 것.
- 특히 피아노 음악와 오케스트라 음악 간의 성능 차이에 초점을 맞추어, 다양한 모델 아키텍처와 데이터셋 간의 예측 정확도를 비교하는 것.
- 회귀 분석을 통해 모델 성능 격차를 설명하고, 예측 오차의 주요 코퍼스 수준 예측 변수를 특정하는 것.
- 데이터 기반 화성 모델링과 전문가가 애너테이션한 카드 유형 체계 간 격차를 메우기 위해, 비지도 학습을 통해 화성 구조를 탐색할 수 있도록 하는 것.
제안 방법
- 음계도의 음계도와 피트 클래스 집합을 기반으로 하여, 사전 유형 체계에 대한 가정 없이 1개의 음계도당 200개 이상의 고유한 카드 유형을 유지하는 데이터 기반의 탄력적인 카드 인코딩 체계를 개발하였다.
- 1710~1910년 사이의 1,000편의 작품에서 유도된 100만 개 이상의 카드 토큰을 포함하는 복합 코퍼스를 사용하였으며, 바흐의 차오랄, 베토벤의 4중주 및 소나타, 쇼팽의 피아노 작품, 조플린의 래그스를 포함한다. 모든 자료는 MusicXML 및 MIDI 형식으로 인코딩되었다.
- 유한한 문맥 모델은 예측의 일부 일치(PPM) 알고리즘을 사용하여 개발되었으며, 이는 문맥 기록을 활용하여 알려지지 않은 또는 희귀한 카드 유형에 확률를 할당한다.
- 순환 신경망(LSTM) 모델은 카드 발생 시퀀스에 대해 엔드 투 엔드로 훈련되어 시퀀스의 다음 카드를 예측하도록 하였다.
- 예측 정확도를 측정하기 위해 교차 엔트로피 손실을 사용하여 다양한 데이터셋과 모델 구성에서의 성능을 평가하였다.
- 단계적 회귀 분석을 통해 모델 성능 격차를 예측하는 코퍼스 수준의 특성(예: 어휘 크기, 토큰 빈도, 단성적 내용)을 특정하였다.
실험 결과
연구 질문
- RQ1대규모 데이터 기반의 공통실습 톤 음악 코퍼스에서, 금속적 문맥(n-그램) 모델과 순환 신경망(RNN) 모델은 카드 진행 예측에서 어떻게 비교되는가?
- RQ2유한한 문맥 모델의 PPM 알고리즘이, 특히 알려지지 않은 또는 희귀한 카드 유형을 다룰 때 RNN보다 성능상의 이점을 제공하는가?
- RQ3어휘 크기, 비가능한 사건 비율 등 코퍼스 수준의 특성 중에서 예측 정확도에 가장 강하게 영향을 주는 것은 무엇인가?
- RQ4모델 성능 격차가 음악 장르나 악기 편성(예: 피아노 대 오케스트라 음악)과 얼마나 관련이 있는가?
- RQ5데이터 기반 카드 표현 체계는 전통적인 전문가 애너테이션 기반 유형 체계보다 더 정확하고 일반화된 톤 화성 언어 모델링을 가능하게 하는가?
주요 결과
- PPM 알고리즘을 사용한 금속적 문맥 모델이 RNN보다 카드 예측에서 뛰어나며, 특히 피아노 데이터셋에서 교차 엔트로피 점수가 유의미하게 낮았다.
- PPM이 알려지지 않은 또는 희귀한 카드 유형에 0이 아닌 확률를 할당할 수 있는 능력이 그 성능 향상의 핵심 요소였으며, 이는 RNN이 비가능한 카드 유형을 다루는 데 어려움을 겪는다는 것을 확인한 회귀 분 析로 뒷받침되었다.
- 유한한 문맥 모델의 경우, 교차 엔트로피의 53% 변동성이 네 가지 예측 변수—토큰 수, 어휘 크기, 단성적 내용, 비가능한 사건 수—에 의해 설명되었다.
- 반면, RNN(LSTM)의 경우 비가능한 사건 비율이 교차 엔트로피에 강한 정적 영향을 미쳤다(β = 0.463), 이는 희귀한 카드에 대한 일반화 능력이 떨어짐을 시사한다.
- RNN 모델은 짧은 시퀀스와 작은 어휘 크기에서 더 나은 성능를 보였으며, 반복적인 인접 토큰에서 유리함을 얻었지만, 단성적 내용과 높은 어휘 다양성에 의해 악영향을 받았다.
- 회귀 결과는 RNN이 희귀한 화성 사건을 모델링하는 데 덜 효과적임을 확인하였으며, 이는 톤 화성 전체 분포에 걸쳐 일반화 능력에 본질적인 한계가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.