Skip to main content
QUICK REVIEW

[논문 리뷰] Talking Drums: Generating drum grooves with neural networks

Patrick Hutchings|arXiv (Cornell University)|2017. 06. 29.
Music and Audio Processing참고 문헌 6인용 수 5
한 줄 요약

이 논문은 신경 기계 번역에 영감을 받은 시퀀스-투-시퀀스 RNN 모델을 제시하며, 스타일 조건부 토큰화 방식을 사용해 킥 드럼 입력으로부터 전체 드럼 킷 그루브를 생성한다. 각 분할 단위에서 가장 확률이 높은 3개의 드럼 히트를 샘플링한 것이 가장 우수한 성능을 보였으며, 사용자 설문조사에서 39%의 '좋음' 평가를 기록했고, 성능은 음악 스타일에 매우 민감하게 영향을 받았다.

ABSTRACT

Presented is a method of generating a full drum kit part for a provided kick-drum sequence. A sequence to sequence neural network model used in natural language translation was adopted to encode multiple musical styles and an online survey was developed to test different techniques for sampling the output of the softmax function. The strongest results were found using a sampling technique that drew from the three most probable outputs at each subdivision of the drum pattern but the consistency of output was found to be heavily dependent on style.

연구 동기 및 목표

  • 다양한 음악 스타일에 맞는 전체 드럼 킷 파트를 실시간으로 생성할 수 있는 퍼커션 에이전트를 개발하는 것.
  • 원래 기계 번역을 위해 개발된 시퀀스-투-시퀀스 신경망을 음악적으로 일관된 드럼 패턴 생성에 적응시키는 것.
  • 모델의 소프트맥스 출력에 대한 샘플링 전략을 평가하고 최적화하여 청취자에게 더 나은 음악적 품질을 제공하는 것.
  • 출력 품질을 확률 분포와 연결함으로써 다중 에이전트 음악 구성 시스템에서 자가 평가 기능을 가능하게 하는 것.
  • 드럼 그루브를 공통적인 의미적 의도를 가진 다이내믹한 '언어' 형태로 모델링할 수 있는지 탐색하는 것.

제안 방법

  • 팝, 록, 펑크, 아프로-쿠바인 스타일의 250개의 드럼 킷 스코어(장르당 약 7,000~7,500마디)를 music-XML 형식으로 파싱하고, 4/4 마디당 48개의 분할 단위로 토크나이즈하였다.
  • 각 드럼 타입(예: K는 킥, S는 스네어 등)에 고유한 문자 토큰을 할당하고, 스타일 기술자를 특수 토큰으로 사용하여 하나의 네트워크에서 다중 스타일 모델링을 가능하게 하였다.
  • 128개 유닛의 레이어를 가지며 3개의 스택된 레이어를 갖는 RNN 시퀀스-투-시퀀스 아키텍처를 사용하였으며, 학습률 0.55와 경사 하강 최적화를 사용하여 훈련하였다.
  • 에코더 입력을 역순으로 처리하고, 원-핫 인코딩을 사용하여 킥 드럼 패턴을 입력 시퀀스로 처리하였다.
  • 세 가지 샘플링 기법을 구현: 그레디 디코딩, 전체 확률 룰렛 유희 샘플링, 상위 3개 확률 룰렛 유희 샘플링.
  • 사용자가 킥 패턴을 입력하고 실시간으로 샘플된 드럼 사운드로 생성된 그루브를 평가할 수 있는 웹 기반 인터페이스를 개발하였다.

실험 결과

연구 질문

  • RQ1드럼 탭라처 데이터로 훈련된 시퀀스-투-시퀀스 신경망이 킥 드럼 입력으로부터 음악적으로 일관된 전체 드럼 킷 그루브를 생성할 수 있는가?
  • RQ2모델의 소프트맥스 출력에 대한 어떤 샘플링 전략이 인간 청취자에게 가장 청취하기 좋은 드럼 그루브를 생성하는가?
  • RQ3다른 음악 스타일, 특히 아프로-쿠바인과 펑크 스타일에서 생성된 그루브의 청취자 평가 품질은 어떻게 달라지는가?
  • RQ4모델의 내부 확률 분포를 다중 에이전트 음악 구성 시스템에서 자가 평가 기능을 가능하게 하기 위해 활용할 수 있는가?
  • RQ5아프로-쿠바인 음악의 클라베 패턴과 같은 스타일 기반 제약 조건들이 모델의 훈련 및 생성 과정에서 어떻게 자동으로 도출되는가?

주요 결과

  • 상위 3개 확률 샘플링 방법(방법 3)이 온라인 설문조사에서 가장 높은 '좋음' 평가 비율(39%)을 기록했으며, 그레디 디코딩과 전체 확률 룰렛 유희 샘플링보다 뛰어났다.
  • 그레디 디코더(방법 1)는 가장 일관성 있었지만 가장 선호도가 낮은 결과를 보였으며, 70%의 평가가 '보통'으로 분류되었다.
  • 모든 확률에 대한 룰렛 유희 샘플링(방법 2)은 '나쁨' 평가 비율이 가장 높았고(28%), 과도한 무작위성으로 인해 음악적 일관성이 떨어졌다.
  • 평균 평가 점수는 초기 확률이 0.7에서 0.8 사이일 때 최고로 1.54에 도달했으며, 이는 청취자 품질 인식의 이상적인 신뢰도 수준을 의미한다.
  • 아프로-쿠바인 스타일 패턴은 다른 스타일들(16–18%)보다 훨씬 더 많은 '나쁨' 평가(24%)를 받았으며, 이는 관용적인 리듬적 구조를 포착하는 데 한계가 있음을 시사한다.
  • 모델의 출력 품질은 스타일에 매우 민감했으며, 팝, 록, 펑크 스타일에서는 더 높은 일관성과 더 좋은 청취자 평가를 기록했지만, 아프로-쿠바인 패턴에서는 그렇지 못했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.