Skip to main content
QUICK REVIEW

[논문 리뷰] A Hierarchical Recurrent Neural Network for Symbolic Melody Generation

Jian Wu, Changran Hu|arXiv (Cornell University)|2017. 12. 14.
Music and Audio Processing참고 문헌 21인용 수 10
한 줄 요약

이 논문은 3단계로 스택된 장기 기억 장치(LSTM) 네트워크—바, 박자, 노트 단위 레이어—를 사용하여 근본적인 구조에서부터 세밀한 구조로의 음악 생성을 수행하는 계층적 순환 신경망(HRNN)을 제안한다. 모델은 인간 평가에서 단일 레이어 LSTM 및 최신 기술인 MusicVAE와 MidiNet을 초월하며, HRNN-3L이 MusicVAE보다 72.6%의 선호도를 기록했고, MidiNet보다는 77.9%의 선호도를 기록했다.

ABSTRACT

In recent years, neural networks have been used to generate symbolic melodies. However, the long-term structure in the melody has posed great difficulty for designing a good model. In this paper, we present a hierarchical recurrent neural network for melody generation, which consists of three Long-Short-Term-Memory (LSTM) subnetworks working in a coarse-to-fine manner along time. Specifically, the three subnetworks generate bar profiles, beat profiles and notes in turn, and the output of the high-level subnetworks are fed into the low-level subnetworks, serving as guidance for generating the finer time-scale melody components in low-level subnetworks. Two human behavior experiments demonstrate the advantage of this structure over the single-layer LSTM which attempts to learn all hidden structures in melodies. Compared with the state-of-the-art models MidiNet and MusicVAE, the hierarchical recurrent neural network produces better melodies evaluated by humans.

연구 동기 및 목표

  • 긴 기간의 구조적 의존성을 모델링하는 데 어려움이 있는 기호 멜로디 생성 문제를 해결하기 위해.
  • 바, 박자, 노트 등 다양한 시간 척도에서 리듬적 구조를 명시적으로 모델링하여 멜로디 생성 품질을 향상시키기 위해.
  • 더 높은 수준의 리듬 프로파일에 조건을 두어 장기적인 노트 수준 의존성 학습의 난이도를 줄이기 위해.
  • 단일 레이어 RNN 및 최신 기술 모델과 비교해 계층적 모델링이 더 음악적으로 일관되고 인간이 선호하는 멜로디를 생성하는지 평가하기 위해.
  • 계층적 설계가 현실적인 장기적 구조를 갖춘 멜로디 생성에 어떤 영향을 미치는지 조사하기 위해.

제안 방법

  • 모델은 바 수준, 박자 수준, 노트 수준의 3단계 계층적 LSTM 아키텍처를 사용한다.
  • 바 수준 LSTM은 바 프로파일을 생성하며, 이는 박자 수준 LSTM이 박자 프로파일을 생성하도록 이끈다.
  • 노트 수준 LSTM은 바 프로파일과 박자 프로파일에 조건을 두어 개별 음을 생성함으로써 구조적 일관성을 확보한다.
  • 각 더 높은 수준의 네트워크는 다음 더 낮은 수준의 네트워크에 맥락적 조건을 제공하여 거칠기에서 세밀한 구조로의 생성을 가능하게 한다.
  • 모델은 양자화된 시간 단위(바당 16단위)와 4/4 시간 표기법을 사용하여 기호 음악 데이터를 엔드 투 엔드로 훈련한다.
  • 인간 평가를 위해 2AFC(이원 대안 강제 선택) 테스트를 사용하여 생성된 멜로디를 기준 모델과 비교한다.

실험 결과

연구 질문

  • RQ1단일 레이어 RNN보다 계층적 RNN 아키텍처가 장기적인 음악적 구조를 더 잘 모델링할 수 있는가?
  • RQ2바와 박자 수준의 리듬 프로파일에 조건을 두어 노트 수준 생성을 조절하면 멜로디 품질과 일관성이 향상되는가?
  • RQ3제안된 HRNN는 MusicVAE와 MidiNet과 같은 최신 기술 모델과 비교해 인간 선호도 연구에서 어떻게 성과를 내는가?
  • RQ4HRNN는 음악 터닝 테스트에서 인간이 작곡한 곡들과 구별되지 않을 정도로 멜로디를 생성할 수 있는가?
  • RQ5시간 표기법, 리듬 인코딩 등의 데이터 제약 사항이 모델 성능과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • HRNN-3L는 동일한 데이터셋으로 훈련된 MusicVAE보다 통계적으로 유의미한 인간 선호도를 기록했으며, 선호도 비율은 72.6%로 p = 1.41×10⁻²¹이었다.
  • 미리 훈련된 MusicVAE와 비교했을 때 HRNN-3L는 63.5%의 선호도 비율을 기록했으며(p = 5.82×10⁻⁹), 인간 평가에서 일관된 슈퍼리어리티를 입증했다.
  • 2AFC 비교에서 HRNN-3L는 MidiNet보다 77.9%의 선호도 비율을 기록했으며(p = 1.85×10⁻²¹), 높은 성능을 입증했다.
  • 인간 평가 결과와 MusicVAE 출력에서 관찰된 혼란스러운 음 패턴 감소를 통해, 모델은 더 뛰어난 리듬과 구조적 일관성을 갖춘 멜로디를 생성했다.
  • 음악 터닝 테스트에서 HRNN가 생성한 멜로디 중 단지 33.69%만 인간이 작곡한 것으로 오인되었으며, 이는 강력한 성능에도 불구하고 향후 개선 여지가 있음을 시사한다.
  • 연구에서 데이터 품질이 모델 성능에 상당한 영향을 미친다는 점을 발견했으며, 인간이 작곡한 곡들 중 74.95%만 정확하게 인간 제작으로 분류되었고, 이는 모델 일반화 능력에 제한을 초래했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.