Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Multi-Task Learning Method for Symbolic Music Emotion Recognition

Qiu Jibao, C. L. Philip Chen|arXiv (Cornell University)|2022. 01. 15.
Music and Audio Processing인용 수 9
한 줄 요약

이 논문은 기존의 감정 인식 방법이 감정 표현에 핵심적인 음악적 구조적 특징을 忽略하는 문제를 해결하기 위해, 감정 인식과 보조 작업으로서 키 분류 및 속도 분류를 동시에 학습하는 새로운 다중 작업 학습 프레임워크 MT-SMNN을 제안한다. 추가 수동 레이블링이 필요 없이 음악의 내재된 구조적 특징—즉, 키 서명과 속도 값—을 활용함으로써, EMOPIA에서 4.17% 향상되고 VGMIDI에서 1.97% 향상된 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Symbolic Music Emotion Recognition(SMER) is to predict music emotion from symbolic data, such as MIDI and MusicXML. Previous work mainly focused on learning better representation via (mask) language model pre-training but ignored the intrinsic structure of the music, which is extremely important to the emotional expression of music. In this paper, we present a simple multi-task framework for SMER, which incorporates the emotion recognition task with other emotion-related auxiliary tasks derived from the intrinsic structure of the music. The results show that our multi-task framework can be adapted to different models. Moreover, the labels of auxiliary tasks are easy to be obtained, which means our multi-task methods do not require manually annotated labels other than emotion. Conducting on two publicly available datasets (EMOPIA and VGMIDI), the experiments show that our methods perform better in SMER task. Specifically, accuracy has been increased by 4.17 absolute point to 67.58 in EMOPIA dataset, and 1.97 absolute point to 55.85 in VGMIDI dataset. Ablation studies also show the effectiveness of multi-task methods designed in this paper.

연구 동기 및 목표

  • 감정 표현에 핵심적인 음악적 구조적 특징을 간과하는 기존의 SMER 방법의 한계를 해결한다.
  • 키와 속도와 같은 내재된 음악적 구조에서 파생된 보조 작업을 통합하여 상징적 음악 감정 인식 성능을 향상시킨다.
  • 학습에 감정 레이블만 필요하고, 보조 레이블은 상징적 음악 데이터에서 자동으로 추출 가능한 다중 작업 프레임워크를 개발한다.
  • 최소한의 추가 파라미터로 공개된 SMER 벤치마크(EPOPIA 및 VGMIDI)에서 최신 기술 수준의 성능을 달성한다.
  • 다양한 사전 훈련된 모델에 적용 가능한 일반화 가능한 프레임워크를 구축한다.

제안 방법

  • 감정 인식과 키 분류 및 속도 분류라는 두 가지 보조 작업을 동시에 최적화하는 다중 작업 학습 프레임워크인 MT-SMNN를 제안한다.
  • Krumhansl-Kessler 알고리즘을 사용하여 상징적 음악 데이터에서 키 서명을 자동으로 결정함으로써 수동 레이블링이 필요 없도록 한다.
  • MIDI 파일에서 직접 속도 값을 추출하여 음량의 대체 지표로 활용하며, 속도와 청취자 인지된 음량 간의 알려진 상관관계를 활용한다.
  • 기존의 사전 훈련된 모델들(MIDIBERT-Piano, MIDIGPT 등)에 공유 표현 위에 작업 전용 분류기를 추가하여 보조 작업을 통합한다.
  • 감정, 키, 속도 분류에 대한 교차 엔트로피 손실을 조합한 다중 작업 손실 함수를 사용하여 모델을 종합적으로 훈련한다.
  • 과적합을 방지하고 최적의 성능을 확보하기 위해 훈련 중에 조기 정지와 모델 체크포인팅을 적용한다.

실험 결과

연구 질문

  • RQ1키와 속도와 같은 음악적 구조적 특징을 통합하면 상징적 음악 감정 인식 성능이 향상되는가?
  • RQ2내재된 음악적 구조에서 유도된 보조 작업이 SMER 모델의 일반화 능력과 견고성에 어떤 영향을 미치는가?
  • RQ3제안된 다중 작업 프레임워크는 표준 SMER 벤치마크에서 사전 훈련된 모델의 단일 작업 미세조정보다 우수한 성능을 내는가?
  • RQ4성능 향상은 다중 작업 학습 메커니즘 탓인지, 단지 추가 파라미터 때문인가?
  • RQ5보조 작업 중에서 키 분류와 속도 분류 중 어느 것이 감정 인식 성능 향상에 더 크게 기여하는가?

주요 결과

  • MT-SMNN 프레임워크는 EMOPIA 데이터셋에서 기존 SOTA보다 4.17% 높은 67.58%의 정확도를 달성하여 새로운 최신 기술 수준의 성능을 확립했다.
  • VGMIDI 데이터셋에서는 55.85%의 정확도를 기록하여 이전 최신 기술 수준보다 1.97% 향상된 성능을 보였다.
  • 절단 실험 결과, 키 분류와 속도 분류 모두 감정 인식 성능 향상에 기여하며, 특히 키 분류가 더 크게 기여한다(3.6% 향상), 속도 분류의 기여도는 1.3% 향상이다.
  • 혼동 행렬 분석 결과, 이 프레임워크는 고 밸런스 카테고리(Q1: 기쁨, Q4: 진정)에서 분류 성능 향상을 특히 뚜렷하게 보이며, 긍정적 감정에 대한 민감도 향상을 시사한다.
  • 성능 향상은 모델 용량 증가 때문이 아니라 다중 작업 학습 메커니즘 탓이며, 추가 분류기로 인한 파라미터 증가가 극히 미미하다.
  • 이 프레임워크는 아키텍처 수정 없이도 다양한 사전 훈련된 모델(MIDIBERT-Piano, MIDIGPT 등)에 일반화 가능하게 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.