Skip to main content
QUICK REVIEW

[논문 리뷰] Conditioning Deep Generative Raw Audio Models for Structured Automatic Music

Rachel Manzelli, Vijay Thakkar|arXiv (Cornell University)|2018. 06. 26.
Music and Audio Processing참고 문헌 7인용 수 8
한 줄 요약

이 논문은 양방향 LSTM가 생성한 기호적 멜로디를 기반으로 웨이브넷 기반의 원시 오디오 생성기 모델을 조건화하는 하이브리드 음악 생성 모델을 제안한다. 이로써 구조적이고 현실적인 사운드를 가진 음악을 생성할 수 있으며, 중간 단계의 기호적-오디오 변환 과정 없이도 표현력 있고 일관된 오디오를 생성할 수 있다. LSTM가 장거리 멜로디적 구조를 추출하여 국소적 조건화 신호로 활용함으로써, 입력된 MIDI와 생성된 오디오 출력 간 높은 상관관계를 달성한다.

ABSTRACT

Existing automatic music generation approaches that feature deep learning can be broadly classified into two types: raw audio models and symbolic models. Symbolic models, which train and generate at the note level, are currently the more prevalent approach; these models can capture long-range dependencies of melodic structure, but fail to grasp the nuances and richness of raw audio generations. Raw audio models, such as DeepMind's WaveNet, train directly on sampled audio waveforms, allowing them to produce realistic-sounding, albeit unstructured music. In this paper, we propose an automatic music generation methodology combining both of these approaches to create structured, realistic-sounding compositions. We consider a Long Short Term Memory network to learn the melodic structure of different styles of music, and then use the unique symbolic generations from this model as a conditioning input to a WaveNet-based raw audio generator, creating a model for automatic, novel music. We then evaluate this approach by showcasing results of this work.

연구 동기 및 목표

  • 웨이브넷과 같은 원시 오디오 생성 모델이 현실적인 음악은 생성하지만 구조가 없는 문제를 해결하기 위해 장거리 음악적 구조를 확보하고자 한다.
  • 기호적 모델의 한계를 극복하고자 하며, 이는 구조적인 음악을 생성하지만 오디오로 변환하기 위해 후처리가 필요하고 사운드의 풍부함이 떨어진다.
  • 표현력 있는 현실감 있는 원시 오디오 모델과 기하학적 일관성을 갖춘 기호적 모델의 장점을 결합한 통합 프레임워크를 개발하고자 한다.
  • 기호적 멜로디 조건화로부터 직접적인 엔드 투 엔드 방식으로 구조적이고 고해상도의 오디오를 생성함으로써 중간 단계의 합성 과정을 제거하고자 한다.

제안 방법

  • 장거리 멜로디적 의존성을 포착하기 위해 음악 데이터에서 기호적 멜로디를 생성하도록 양방향 LSTM 네트워크를 훈련시킨다.
  • 생성된 기호적 시퀀스(MIDI 유사 타임시리즈)를 웨이브넷 기반 원시 오디오 생성기의 국소적 조건화 신호로 사용한다.
  • 웨이브넷 모델은 다양한 악기와 장르에서 현실적인 오디오를 생성하기 위해 MusicNet 데이터셋으로 미세조정된다.
  • 각 타임스텝에서 기호적 멜로디와 오디오 생성 과정을 정렬하기 위해 교차 attention 또는 연결 메커니즘을 통해 조건화를 구현한다.
  • 기호적 입력과 출력 간의 상관관계 분석을 가능하게 하기 위해 MIDI와 스펙트로그램 피크의 주파수 기반 표현을 사용한다.
  • 기존 오디오를 수정하기 위해 기호 입력을 수정하고 해당 오디오를 재생성하는 것이 가능하며, 이 과정에서 오디오의 해상도를 유지할 수 있다.

실험 결과

연구 질문

  • RQ1웨이브넷 기반 원시 오디오 생성기 모델이 기호적 멜로디 시퀀스로 효과적으로 조건화되어 구조적이고 현실적인 음악을 생성할 수 있는가?
  • RQ2조건화된 모델이 생성된 오디오에서 입력된 기호적 시퀀스의 멜로디적 구조를 얼마나 잘 유지하는가?
  • RQ3기호적 조건화 입력을 단지 수정함으로써 기존 오디오를 편집하는 데 얼마나 효과적으로 활용될 수 있는가?
  • RQ4기호적 입력과 생성된 오디오 간의 상관관계가 의미 있는 비난이 아닌 정렬을 반영하는가?
  • RQ5다른 기호적 멜로디로 조건화함으로써 모델이 특정 장르나 악기 기반의 음악을 생성할 수 있는가?

주요 결과

  • 조건화된 웨이브넷 모델은 LSTM가 장거리 멜로디적 의존성을 모델링할 수 있음을 활용하여 현실적으로 들리고 구조적인 음악을 성공적으로 생성한다.
  • 상관관계 분석 결과 기호적 조건화와 생성된 오디오 간에 지연 0에서 뚜렷한 피크(값: 0.3)를 보이며, 이 상관관계는 무작위 MIDI 시퀀스에 비해 통계적으로 유의미하다.
  • 모델은 표현력 있는 오디오 편집을 가능하게 하며, 기호적 멜로디에 대한 작은 변화가 생성된 오디오 웨이브폼에 대해 청각적으로 의미 있는 변화로 이어진다.
  • 다른 트레이닝된 모델을 조건화하여 동일한 멜로디를 다양한 장르나 악기로 병렬 생성할 수 있으며, 이는 모델 간 결합 없이도 앙상블 효과를 낼 수 있게 한다.
  • 인간 평가를 통해 커뮤니티 기반 평가(예: 아마존 메카니컬 터크)를 실시한 결과, 조건화되지 않은 웨이브넷 생성 결과에 비해 청각적 품질과 구조적 일관성이 향상된 것으로 확인되었다.
  • 모듈러 구조는 기호 입력에 정렬된 조건화를 통해 음악과 음성의 통합 등 다양한 도메인의 확장 가능한 음악 생성을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.