Skip to main content
QUICK REVIEW

[논문 리뷰] Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm

Ke Chen, Cheng-i Wang|arXiv (Cornell University)|2020. 08. 04.
Music and Audio Processing참고 문헌 23인용 수 22
한 줄 요약

Music SketchNet은 변분 오토에인코더(SketchVAE)를 사용하여 음고와 리듬을 분리된 잠재 표현으로 인과적으로 분해함으로써 사용자가 부분적인 음고 또는 리듬 스케치를 통해 음악 생성을 유도할 수 있는 제어 가능한 음악 생성 프레임워크를 제안한다. 이 모델은 객관적 평가 지표와 주관적 청취 테스트에서 최신 기술을 모두 초월하며, 사용자가 지정한 음형을 정확히 따르면서도 음악적 일관성을 유지하는 데 성공한다.

ABSTRACT

Drawing an analogy with automatic image completion systems, we propose Music SketchNet, a neural network framework that allows users to specify partial musical ideas guiding automatic music generation. We focus on generating the missing measures in incomplete monophonic musical pieces, conditioned on surrounding context, and optionally guided by user-specified pitch and rhythm snippets. First, we introduce SketchVAE, a novel variational autoencoder that explicitly factorizes rhythm and pitch contour to form the basis of our proposed model. Then we introduce two discriminative architectures, SketchInpainter and SketchConnector, that in conjunction perform the guided music completion, filling in representations for the missing measures conditioned on surrounding context and user-specified snippets. We evaluate SketchNet on a standard dataset of Irish folk music and compare with models from recent works. When used for music completion, our approach outperforms the state-of-the-art both in terms of objective metrics and subjective listening tests. Finally, we demonstrate that our model can successfully incorporate user-specified snippets during the generation process.

연구 동기 및 목표

  • 부분적인 음고 또는 리듬 스케치를 통해 음악 완성도를 조절할 수 있도록 유저가 직관적으로 음악 생성을 유도할 수 있도록 하는 것.
  • 기존 모델이 조건부 입력으로 완전한 음악 트랙이 필요로 하는 한계를 해결하기 위해 음악 생성을 위한 스케치 기반 인터페이스를 도입하는 것.
  • 음악의 음고와 리듬 잠재 표현을 분리하여 미세 조절이 가능한 제어 가능한 생성을 지원하는 것.
  • 완전한 음악 입력 없이도 사용자 선호도를 반영하여 음악 복원을 향상시키는 것.
  • 정량적 및 주관적 평가를 통해 사용자 제어의 효과성을 평가하여 일관되고 음악적으로 타당한 음악 생성이 가능한지 확인하는 것.

제안 방법

  • SketchVAE는 인과적 추론 네트워크를 사용하여 음악 메져를 음고 윤곽과 리듬에 대한 분리된 잠재 표현으로 분해하는 변분 오토에인코더이다.
  • SketchInpainter는 과거 및 향후 맥락을 기반으로 누락된 메져에 대한 잠재 표현을 예측하기 위해 스택드 리커런트 네트워크를 사용한다.
  • SketchConnector는 SketchInpainter의 잠재 예측과 사용자가 지정한 음고 또는 리듬 스케치를 통합하여 최종 생성을 유도한다.
  • 통합 확률 모델은 디코더(SketchVAE), 인페인팅 모듈(SketchInpainter), 연결 모듈(SketchConnector)을 하나의 프레임워크로 통합하여 조건부 생성을 수행한다.
  • 모델은 아이ル랜드 민속 음악 데이터를 기반으로 엔드 투 엔드로 훈련되며, 잠재 공간 모델링을 통해 음고와 리듬에 대한 분리된 제어를 가능하게 한다.
  • 가상 제어 실험을 통해 생성 결과와 사용자가 지정한 스케치 간의 음고 및 리듬 정확도를 측정하여 사용자 영향력을 평가한다.

실험 결과

연구 질문

  • RQ1음고와 리듬의 인과적 잠재 표현은 종단간 모델 대비 더 직관적이고 제어 가능한 음악 생성을 가능하게 하는가?
  • RQ2완전한 음악 트랙을 제공하지 않고도 사용자가 부분적인 음고 또는 리듬 스케치를 통해 음악 생성을 얼마나 효과적으로 유도할 수 있는가?
  • RQ3사용자가 지정한 음고 또는 리듬 스케치를 포함함으로써 기준 인페인팅 모델 대비 생성 품질에 통계적으로 유의미한 향상이 이루어지는가?
  • RQ4사용자 스케치에 따라 유도될 때 모델이 음악적 일관성과 구조적 일관성을 어느 정도 유지하는가?
  • RQ5사용자가 지정한 음고 및 리듬 패턴을 높은 정확도로 따르면서도 음악적으로 타당한 콘텐츠를 생성할 수 있는가?

주요 결과

  • Music SketchNet은 객관적 평가 지표와 주관적 청취 테스트에서 최신 기술인 Music InpaintNet을 모두 초월하며, 특히 음악의 구조와 전반적인 음악성에서 뛰어난 성능을 보였다.
  • 주관적 평가 결과, SketchNet은 Music InpaintNet 대비 음악적 구조(p < 0.05)와 전반적인 음악성(p < 0.05)에서 유의미하게 높은 점수를 기록했으며, 복잡성은 유의미한 차이가 없었다(p = 0.364).
  • 가상 제어 실험에서 모델은 사용자가 지정한 리듬 스케치를 97.3%의 정확도로 따르며, 음고 윤곽은 88.1%의 정확도를 기록했다.
  • 원래 멜로디에 옥타브 이동이 있었더라도, 모델은 사용자가 지정한 음고 및 리듬 스케치와 일치하는 일관된 음악을 성공적으로 생성했다.
  • 분리된 잠재 공간 덕분에 의미 있는 제어가 가능했으며, 사용자는 음고 또는 리듬을 독립적으로 영향을 주어 다양한 맥락에 적합한 출력을 생성할 수 있었다.
  • 프레임워크는 사용자가 최소한의 입력으로도 음악 스케치를 유도할 수 있는 상호작용형 음악 스케치에 실용적인 응용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.