Skip to main content
QUICK REVIEW

[논문 리뷰] BandNet: A Neural Network-based, Multi-Instrument Beatles-Style MIDI Music Composition Machine

Yichao Zhou, Wei Chu|arXiv (Cornell University)|2018. 12. 18.
Music and Audio Processing참고 문헌 14인용 수 7
한 줄 요약

BandNet는 빌리즈 스타일의 MIDI 음악에서 학습하여 인간의 간섭을 최소화하고 다이내믹한 악기 편성과 스타일적으로 정확한 곡을 작곡하는 RNN 기반 음악 생성 시스템이다. 키 일관성, 코드 타이밍 정규화, 멜로디 간격 조절 등의 음악 이론적 제약 조건을 통합함으로써, 청취자 평가에서 원본 비틀즈 곡과 유사한 스타일과 전문적인 사운드를 가진 고품질의, 체계적으로 통일된 음악을 생성한다. 특히 주관적 평가에서 원본 비틀즈 곡과 유사한 성능을 보인다.

ABSTRACT

In this paper, we propose a recurrent neural network (RNN)-based MIDI music composition machine that is able to learn musical knowledge from existing Beatles' songs and generate music in the style of the Beatles with little human intervention. In the learning stage, a sequence of stylistically uniform, multiple-channel music samples was modeled by a RNN. In the composition stage, a short clip of randomly-generated music was used as a seed for the RNN to start music score prediction. To form structured music, segments of generated music from different seeds were concatenated together. To improve the quality and structure of the generated music, we integrated music theory knowledge into the model, such as controlling the spacing of gaps in the vocal melody, normalizing the timing of chord changes, and requiring notes to be related to the song's key (C major, for example). This integration improved the quality of the generated music as verified by a professional composer. We also conducted a subjective listening test that showed our generated music was close to original music by the Beatles in terms of style similarity, professional quality, and interestingness. Generated music samples are at https://goo.gl/uaLXoB.

연구 동기 및 목표

  • 비틀즈 음악의 복잡한 스타일적 특징을 정확히 반영하는 자동화된, 데이터 기반의 음악 생성 시스템을 개발하기 위해.
  • 다양한 피아노, 기타, 베이스, 드럼 등의 다이내믹한 악기 파트 간 상호의존성과 다양한 피아노 구조 및 화성 구조를 모델링하는 데 도전하기 위해.
  • 신경망 프레임워크에 전문 음악 이론 지식을 통합하여 생성 품질을 향상시키기 위해.
  • 최소한의 인간 간섭으로 RNN 기반 생성이 진정으로 비틀즈 곡과 구분되지 않는 스타일과 품질의 음악을 생성할 수 있는지 평가하기 위해.
  • 주관적 청취 품질에서 전문적으로 구성된 시드가 무작위 시드보다 유의미한 이점을 제공하는지 확인하기 위해.

제안 방법

  • 모델은 비틀즈 곡의 다중 채널 MIDI 데이터(보컬, 코드, 베이스)를 사용하며, 시간 이산화를 위해 노트를 16분음표 단위로 정렬한다.
  • 각 곡은 12개의 반음 간격으로 옮겨 훈련 데이터를 증강하고 모든 음계에서의 생성을 가능하게 한다.
  • 반복 신경망(RNN)이 시퀀스에서 다음 노트 또는 제어 이벤트를 예측하도록 훈련되어, 여러 악기의 공동 분포를 모델링한다.
  • 생성 중에 음악 이론 제약 조건이 통합된다: 코드 전환은 시간에 따라 정규화되고, 멜로디 간격은 일관되게 유지되며, 노트는 곡의 키(예: C 메이저)에 제한된다.
  • 생성된 음악은 다수의 무작위 또는 전문적 시드에서 유래한 클립을 연결하여 구성되며, 각 시드는 2마디 시드에서 6마디 세그먼트를 생성한다.
  • 온도 기반 샘플링 전략을 사용하는 시퀀스-투-시퀀스 생성 방식을 통해 창의성과 통일성의 균형을 이룬다.

실험 결과

연구 질문

  • RQ1RNN 기반 모델은 원시 MIDI 데이터에서 비틀즈 음악의 복잡한 화성, 멜로디 및 리듬적 구조를 학습하고 재현할 수 있는가?
  • RQ2음악 이론 지식을 통합할 경우 생성 음악의 체계적이고 스타일적인 품질은 어느 정도 향상되는가?
  • RQ3주관적 평가에서 무작위 시드로 생성된 음악과 전문적으로 구성된 시드로 생성된 음악의 품질은 어떻게 비교되는가?
  • RQ4스타일, 전문적 품질 및 인지된 흥미로움 측면에서 생성된 음악은 진짜 비틀즈 곡과 어느 정도 유사한가?
  • RQ5기계 학습 모델이 블라인드 청취 테스트에서 인간이 작곡한 음악과 구분되지 않는 음악을 생성할 수 있는가?

주요 결과

  • BandNet가 생성한 음악은 무작위 시드에서 유래한 곡들에 대해 평균 스타일 유사도 점수 3.08(5점 척도 기준)를 기록하여 비틀즈 음악과 강한 스타일적 유사성을 보였다.
  • BandNet가 생성한 음악의 평균 전문적인 사운드 점수는 무작위 시드 기준 3.29, 전문 시드 기준 3.16로, 최소한의 인간 간섭에도 불구하고 높은 청취자 인식 품질을 보였다.
  • BandNet가 생성한 음악의 평균 흥미로움 점수는 무작위 시드 기준 3.19, 전문 시드 기준 3.13로, 음악이 매력적이고 새로운 것으로 인식되었음을 시사했다.
  • 블라인드 청취 테스트에서 오직 1.3%의 청취자가 전문적으로 구성된 시드가 원본 비틀즈 곡임을 식별했으며, 이는 효과적인 일반화와 데이터 泄露 없음을 시사한다.
  • 진짜 비틀즈 곡과 BandNet가 생성한 음악 간의 성능 격차는 스타일 유사도 기준 0.202 이하, 전문적 품질 및 흥미로움 기준 약 0.5 이내로 매우 작았으며, 강력한 모방 능력을 입증했다.
  • 주관적 평가에서 전문적으로 구성된 시드를 사용한 경우 무작위 시드를 사용한 경우보다 통계적으로 유의미한 향상이 없었으며, 이는 모델이 전문가의 지시 없이도 고품질 음악을 생성할 수 있음을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.