Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Music with a Self-Correcting Non-Chronological Autoregressive Model

Wayne Chi, Prachi Kumar|arXiv (Cornell University)|2020. 08. 18.
Music and Audio Processing참고 문헌 28인용 수 5
한 줄 요약

이 논문은 고정 순서의 시퀀스가 아니라 노트 추가 및 제거 이벤트의 시퀀스를 모델링함으로써 오류 누적을 줄이고, 곡을 보정할 수 있는 비순차적 자동회귀 모델인 ES-Net을 제안한다. 이로 인해 오류 누적이 감소하고 세밀한 제어와 상호작용이 가능한 음악 창작이 가능해지며, 정량적 지표와 인간 평가에서 순서 없는 NADE와 견본 추출보다 뛰어난 성능을 보였다.

ABSTRACT

We describe a novel approach for generating music using a self-correcting, non-chronological, autoregressive model. We represent music as a sequence of edit events, each of which denotes either the addition or removal of a note---even a note previously generated by the model. During inference, we generate one edit event at a time using direct ancestral sampling. Our approach allows the model to fix previous mistakes such as incorrectly sampled notes and prevent accumulation of errors which autoregressive models are prone to have. Another benefit is a finer, note-by-note control during human and AI collaborative composition. We show through quantitative metrics and human survey evaluation that our approach generates better results than orderless NADE and Gibbs sampling approaches.

연구 동기 및 목표

  • 노트 제거 기능을 통해 모델이 스스로 오류를 수정할 수 있도록 함으로써 자동회귀 음악 생성에서 오류 누적 문제를 해결한다.
  • 노트 단위의 세밀한 제어와 비순차적 상호작용이 가능한 음악 창작을 가능하게 하여 인간-AI 협업을 지원한다.
  • 직접 피아노 롤을 생성하는 대신 편집 시퀀스(추가/제거 이벤트)를 모델링함으로써 음악 생성 품질을 향상시킨다.
  • 직접 조상 샘플링 기반의 제거 기능을 갖춘 모델이 견본 추출법과 순서 없는 NADE보다 음악 품질과 사용자 선호도에서 뛰어나다는 것을 입증한다.
  • 모델의 적용 범위를 바흐의 4성음악 이외의 영역으로 확장하고, 속도와 지속시간과 같은 표현적 기능을 포함시킬 수 있도록 한다.

제안 방법

  • 고정된 피아노 롤이 아닌, 단일 노트를 추가하거나 제거하는 원핫 편집 이벤트의 시퀀스로 음악을 표현한다.
  • 현재 피아노 롤 상태를 기반으로 각 편집 이벤트의 조건부 확률을 모델링하기 위해 2차원 컨볼루션 신경망을 사용한다.
  • 직접 조상 샘플링을 통해 편집 시퀀스를 생성함으로써, 어떤 순서로든 노트를 반복적으로 추가하거나 제거할 수 있도록 한다.
  • 각 편집 후 업데이트된 피아노 롤을 다시 입력하여 다음 예측을 조건화함으로써 시간이 지남에 따라 오류 수정이 가능하도록 한다.
  • 데이터 증강 과정에서 오류가 포함된 노트를 마스킹하고 추가함으로써 오류를 시뮬레이션하고 이를 학습할 수 있도록 모델을 훈련시킨다.
  • 모든 편집을 순서대로 적용하는 누적 업데이트 함수를 통해 편집 시퀀스를 피아노 롤로 다시 매핑한다.

실험 결과

연구 질문

  • RQ1노트 제거 기능을 지원하는 비순차적 자동회귀 모델이 음악 생성에서 오류 누적을 줄일 수 있는가?
  • RQ2편집 시퀀스 기반 직접 조상 샘플링이 견본 추출법과 순서 없는 NADE보다 음악 품질과 사용자 선호도에서 뛰어나게 되는가?
  • RQ3노트 제거 기능이 음악의 표현력과 정확성 향상에 어느 정도 기여하는가?
  • RQ4모델은 인간과 AI 간의 상호작용적, 노트 단위의 협업 창작을 어떻게 지원하는가?
  • RQ5모델은 바흐의 4성음악을 넘어선 영역으로 일반화될 수 있으며, 속도와 지속시간과 같은 표현적 기능까지 확장될 수 있는가?

주요 결과

  • 제안된 편집 시퀀스 접근 방식은 인간 평가에서 순서 없는 NADE와 견본 추출법보다 음악 품질에서 유의미하게 뛰어나다 (p < 0.001).
  • 참가자들은 제안 모델의 샘플이 기존 멜로디에서 더 크게 향상된 것으로 평가했으며, 통계적으로 유의미한 선호도를 보였다 (p < 0.001).
  • 사용자 순위 평가에서 모델의 결과물은 바흐 스타일의 음악과 더 유사한 것으로 나타나, 스타일 일치도가 높아졌다.
  • 크루스칼-월리스 H-검정을 통해 세 모델 간 음악 품질 평가 점수에 통계적으로 유의미한 차이가 있음을 확인했다 (χ² = 73.07, p < 0.001).
  • 윌코크신 서열 순위 검정 결과, 제안 방법은 모든 평가 차원에서 두 기준 모델보다 유의미하게 더 선호됨을 입증했다 (p < 0.001).
  • 노트 제거 기능은 샘플링 오류를 수정하고 최종 출력 품질을 향상시키는 데 핵심적인 역할을 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.