Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Black Metal and Math Rock: Beyond Bach, Beethoven, and Beatles

Zack Zukowski, Cameron Carr|arXiv (Cornell University)|2018. 11. 16.
Music and Audio Processing참고 문헌 5인용 수 13
한 줄 요약

이 논문은 블랙 메탈과 매스틱 락과 같은 현대적인 복잡한 음악 장르를 합성하기 위해 레이어가 깊고 다층적인 SampleRNN을 사용하는 원시 오디오 생성 방법을 제안한다. 16kHz에서 전체 앨범의 원시 FLAC 오디오를 훈련시켜, 갑작스러운 전환, 이상한 박자, 풍부한 톤의 특징을 가진 음악을 생성함으로써 신경망 기반 오디오 합성 기술이 전통적인 기호 음악 모델링을 넘어서 현대적 스타일의 소리 복잡성을 포착할 수 있음을 보여준다.

ABSTRACT

We use a modified SampleRNN architecture to generate music in modern genres such as black metal and math rock. Unlike MIDI and symbolic models, SampleRNN generates raw audio in the time domain. This requirement becomes increasingly important in modern music styles where timbre and space are used compositionally. Long developmental compositions with rapid transitions between sections are possible by increasing the depth of the network beyond the number used for speech datasets. We are delighted by the unique characteristic artifacts of neural synthesis.

연구 동기 및 목표

  • 블랙 메탈과 매스틱 락과 같은 현대적이고 복잡한 음악 장르를 합성할 수 있는 신경망 기반 오디오 생성 모델을 개발하기 위해.
  • 기존의 기호 음악 모델링(예: MIDI)을 넘어서 시간 도메인에서 원시 오디오를 생성하여 미세한 음향적 특징을 유지하기 위해.
  • 비기능적 톤 체계를 가진 현대 장르의 구조적이고 톤적인 복잡성을 깊이 있는 계층적 SampleRNN 아키텍처가 학습하고 재현할 수 있는지 조사하기 위해.
  • 신경망 합성의 잠재적 미학적 잠재력, 예를 들어 유령 같은 보컬 레이어나 초현실적인 톤 하이브리드를 창작 도구로 활용하기 위해.

제안 방법

  • 16kHz에서 원시 FLAC 오디오를 8초 단위로 분할하고, 무작위로 섞고, 훈련/검증/테스트 세트 비율을 88/6/6으로 설정.
  • 256의 임bedding 크기, 1024개의 은닉 차원, 5–9층, 256개의 선형 양자화 수준을 사용한 이중 계층 SampleRNN을 활용해 원시 오디오를 생성.
  • 기억 잃기 게이트의 초기값을 3으로 설정하고, 무작위 또는 학습된 초기 은닉 상태(h0)를 사용해 생성 다양성을 향상.
  • argmax 추론을 수정하여 소프트맥스 출력 분포에서 확률적 샘플링을 수행해 음향의 다양성을 증가시키고 모드 붕괴를 방지.
  • NVIDIA K80 GPU에서 3–5일간 훈련하며 가중치 정규화와 스킵 연결을 적용하고, 체크포인트당 10×30초의 클립을 생성.
  • 청각적 점검을 통해 모델 품질을 평가하고, 흰색 잡음만 생성하거나 반복적인 리프를 빠져나오지 못하는 체크포인트를 회피.

실험 결과

연구 질문

  • RQ1전체 앨범의 데이터로 훈련된 원시 오디오 생성 모델이 음악적으로 통일되고 스타일적으로 정확한 블랙 메탈 및 매스틱 락 곡을 생성할 수 있는가?
  • RQ2SampleRNN 아키텍처를 깊이 있게 확장함으로써(말하기 전용 깊이를 넘어서) 갑작스러운 전환을 포함한 복잡한 장기 음악적 구조를 어떻게 생성하는가?
  • RQ3훈련 데이터에서 톤 일관성과 통합된 믹싱/마스터링이 모델의 일반화 능력과 음악적 아이디어의 통합 능력에 얼마나 기여하는가?
  • RQ4추론 샘플링 전략(예: 소프트맥스 샘플링 대비 argmax)이 모드 붕괴를 방지하고 음악적 다양성을 향상시키는 데 어떤 역할을 하는가?
  • RQ5신경망 합성의 고유한 아티팩트가 생성된 음악의 새로운 미학적 품질을 어떻게 만들어내는가?

주요 결과

  • Krallice의 전체 앨범으로 훈련된 5층 LSTM 모델은 원래의 블랙 메탈 스타일, 즉 분위기적인 텍스처, 트레몰 픽업 기타, 깊은 비명 같은 요소를 거의 정확하게 재현한 오디오를 생성했다.
  • Room For A Ghost의 전체 앨범으로 훈련된 7층 LSTM 모델은 갑작스러운 섹션 전환, 이상한 박자, 긴 휴지 시간을 포함한 6분짜리 곡을 생성했으며, 원본 음악을 매스틱 락 스타일로 변형시켰다.
  • GRU 기반 모델은 오디오 패턴을 학습하지 못하고 날카로운 잡음을 생성했지만, LSTM 모델은 성공적으로 학습했으며, 이는 장르의 복잡성에 따라 아키텍처 민감도가 있음을 시사한다.
  • 초기 은닉 상태(h0)를 무작위로 설정함으로써 생성의 다양성이 향상되고 반복이 줄어들었으며, 이는 모드 붕괴를 방지하는 데 중요한 역할을 함을 시사한다.
  • 체크포인트에서 간헐적으로 생성된 오디오는 일반화된 텍스처에서 구조적인 리프와 섹션 전환으로 점진적으로 발전하는 모습을 보였으며, 이는 점진적인 학습을 나타낸다.
  • 모델는 고유한 미학적 아티팩트—예를 들어 유령 같은 보컬 레이어나 초현실적인 톤 하이브리드—를 생성했으며, 이는 현실적인 모방을 넘어서 창작 잠재력을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.