Skip to main content
QUICK REVIEW

[논문 리뷰] The NES Music Database: A multi-instrumental dataset with expressive performance attributes

Chris Donahue, Huanru Henry Mao|arXiv (Cornell University)|2018. 06. 11.
Music and Audio Processing참고 문헌 21인용 수 8
한 줄 요약

이 논문은 NES 비디오 게임 음악의 대규모 다이얼러그 악기 데이터셋인 NES-MDB(NES Music Database)를 소개한다. 이 데이터셋은 단성 음악 악기 음성과 세밀한 표현적 연주 특성(dynamics, timbre)을 명시적으로 분리하여, 기존의 기호적 절차와 하드웨어 에뮬레이션을 통한 실제 NES 오디오로의 전환을 가능하게 하는 새로운 파ip라인을 제공한다. 이를 통해 구성과 표현적 연주를 종단 간(end-to-end)으로 모델링할 수 있으며, 파형 렲영을 위한 오픈소스 도구를 통해 재현 가능한 기준을 설정한다.

ABSTRACT

Existing research on music generation focuses on composition, but often ignores the expressive performance characteristics required for plausible renditions of resultant pieces. In this paper, we introduce the Nintendo Entertainment System Music Database (NES-MDB), a large corpus allowing for separate examination of the tasks of composition and performance. NES-MDB contains thousands of multi-instrumental songs composed for playback by the compositionally-constrained NES audio synthesizer. For each song, the dataset contains a musical score for four instrument voices as well as expressive attributes for the dynamics and timbre of each voice. Unlike datasets comprised of General MIDI files, NES-MDB includes all of the information needed to render exact acoustic performances of the original compositions. Alongside the dataset, we provide a tool that renders generated compositions as NES-style audio by emulating the device's audio processor. Additionally, we establish baselines for the tasks of composition, which consists of learning the semantics of composing for the NES synthesizer, and performance, which involves finding a mapping between a composition and realistic expressive attributes.

연구 동기 및 목표

  • 기존 음악 생성 데이터셋이 표현적 연주 특성을 결여하고 있으며, 특히 다이얼러그 악기 음악에 대해 이러한 결여가 심각한 문제임을 해결하기 위해.
  • NES 음악의 구조화되고 분리된 절차 표현을 제공하여 개별 악기 음성 데이터와 표현적 특성을 유지하기 위해.
  • 기호적 구성과 실제 오디오 렌더링을 결합하여 전체 음악 생성 파이프라인(구성 및 표현적 연주)의 연구를 가능하게 하기 위해.
  • 신경 시퀀스 모델을 사용하여 구성 및 연주 작업에 대한 재현 가능한 기준을 설정하기 위해.
  • 기호적 절차를 NES 기계어로 변환하여 실제 오디오 재생이 가능한 오픈소스 도구체인을 제공하기 위해.

제안 방법

  • 1,400개의 NES 게임 원본 기계어를 분석하여, 네 가지 악기 음성에 대한 음악 절차와 표현적 특성을 추출함으로써 데이터셋을 구축함.
  • 각 곡은 세 가지 형식으로 표현됨: 혼합 절차(표준 다성 음악 표현), 분리된 절차(개별 단성 음성 시퀀스), 표현적 절차(각 음성에 대한 다이내믹스 및 톤 색채 변화 포함).
  • 기호 음악 형식(MIDI 등)과 NES 기계어 간의 변환을 가능하게 하는 커스터마이징 라이브러리로, 모든 연주 세부 정보를 유지함.
  • 저자들은 데이터셋을 기반으로 RNN 기반 모델을 훈련 및 평가하여 분리된 구성 및 표현적 연주 작업을 수행함.
  • 하드웨어 에뮬레이션 도구를 통해 생성된 구성물을 실제 NES 스타일 오디오로 렌더링하여, 정성적 및 정량적 평가를 가능하게 함.
  • 구성 및 연주 예측 작업에 대해 RNN 및 조건부 확률 인과 분해와 같은 시퀀스 모델링 기법을 사용하여 기준을 설정함.

실험 결과

연구 질문

  • RQ1혼합된 카드형 표현이 아닌 분리된 단성 음성 표현을 기반으로 훈련된 신경 모델이 다이얼러그 악기 음악의 의미를 효과적으로 학습할 수 있는가?
  • RQ2기호적 절차가 주어졌을 때, 모델이 다이내믹스 및 톤 색채 변화와 같은 표현적 연주 특성을 얼마나 잘 예측할 수 있는가?
  • RQ3악기 음성을 분리함으로써 혼합 절차 모델링 대비 생성 음악의 품질과 표현성은 어느 정도 향상되는가?
  • RQ4구성 및 연주 모델링을 통합한 유일한 파이프라인은 각 작업을 별도로 모델링하는 것보다 더 자연스럽고 음악적으로 일관된 NES 스타일 음악을 생성할 수 있는가?
  • RQ5다이얼러그 악기 상호작용의 복잡성 고려 시, 이 데이터셋에서의 표현적 연주 모델링은 단일 피아노에 초점을 맞춘 기존 방법과 비교해 어떻게 다른가?

주요 결과

  • NES-MDB 데이터셋은 라이센스가 있는 NES 게임에서 유래한 1,400개 이상의 다이얼러그 악기 음악을 포함하며, 각 곡은 네 가지 분리된 악기 음성과 세밀한 표현적 특성을 지님.
  • 분리된 절차 표현 방식은 혼합 절차 형식에 비해 다성 음악의 더 정확하고 표현적인 모델링을 가능하게 함.
  • 저자들은 RNN 기반 모델을 사용하여 구성 및 연주 작업에 대해 재현 가능한 기준을 설정하였으며, 기존 방법 대비 더 높은 표현성을 입증함.
  • 오픈소스 도구체인을 통해 생성된 절차를 직접 실제 NES 오디오로 재생할 수 있어, 생성 음악의 현실적인 평가가 가능함.
  • 이 데이터셋은 기호적 구성에서 파형 렌더링까지의 전체 음악 생성 파이프라인을 지원하여, 다이얼러그 악기 음악 및 표현적 음악 생성 연구 분야에서 중요한 격차를 메움.
  • 연구 결과로 표현적 연주 특성(다이내믹스 및 톤 색채 변화 등)이 생성 음악의 정성적 품질을 크게 향상시키며, 더 자연스럽고 음악적으로 일관된 들리게 한다는 점을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.