Skip to main content
QUICK REVIEW

[논문 리뷰] AccoMontage: Accompaniment Arrangement via Phrase Selection and Style Transfer

Jingwei Zhao, Gus Xia|arXiv (Cornell University)|2021. 08. 25.
Topic Modeling참고 문헌 29인용 수 4
한 줄 요약

AccoMontage는 동적 프로그래밍을 통한 문장 검색과 신경망 스타일 전이를 조합하여 피아노 반주 편곡을 하이브리드 방식으로 구현한다. 이는 선택된 기준 자료를 리드 시트에 맞추기 위해 사용된다. 전반적인 민속/팝 곡에 대해 일관성, 구조, 음악성 면에서 최신 기술 수준의 성능을 달성하며, 학습 기반 및 템플릿 기반 기준 모델보다 뚜렷이 뛰어나다.

ABSTRACT

Accompaniment arrangement is a difficult music generation task involving intertwined constraints of melody, harmony, texture, and music structure. Existing models are not yet able to capture all these constraints effectively, especially for long-term music generation. To address this problem, we propose AccoMontage, an accompaniment arrangement system for whole pieces of music through unifying phrase selection and neural style transfer. We focus on generating piano accompaniments for folk/pop songs based on a lead sheet (i.e., melody with chord progression). Specifically, AccoMontage first retrieves phrase montages from a database while recombining them structurally using dynamic programming. Second, chords of the retrieved phrases are manipulated to match the lead sheet via style transfer. Lastly, the system offers controls over the generation process. In contrast to pure learning-based approaches, AccoMontage introduces a novel hybrid pathway, in which rule-based optimization and deep learning are both leveraged to complement each other for high-quality generation. Experiments show that our model generates well-structured accompaniment with delicate texture, significantly outperforming the baselines.

연구 동기 및 목표

  • 기존 딥러닝 모델이 전곡에 걸쳐 장기적이고 구조적으로 일관된 반주를 생성하는 데에 한계가 있음을 해결하기 위해.
  • 새로운 음악 자료를 완전히 생성하는 대신 기존 음악 자료를 활용하여 멜로디-반주 조화와 텍스처 일관성을 향상시키기 위해.
  • 리듬 밀도와 음성 수와 같은 사용자 정의 텍스처 특징을 통해 제어 가능한 음악 생성을 가능하게 하기 위해.
  • 규칙 기반 문장 검색과 딥러닝 기반 스타일 전이를 통합하여 생성 품질을 향상시키기 위해.
  • 인간의 작곡 실천 방식을 영감으로 삼아 반주 편곡을 하이브리드 최적화 및 생성 파이프라인으로 모델링하기 위해.

제안 방법

  • 문장 선택은 그래프 최적화 문제로 모델링되며, 노드는 후보 문장을 나타내고 간선은 전이를 나타낸다. 노드 점수는 규칙 기반 적합도에 기반하고 간선 점수는 대비 학습을 통해 학습된다.
  • 동적 프로그래밍을 사용하여 선택된 문장을 리드 시트의 구조적 제약을 준수하면서 일관된 순서로 재조합한다.
  • 신경망 스타일 전이를 통한 카드 조작을 통해 검색된 문장의 화성 내용을 쿼리 리드 시트의 카드 진행에 맞추어 정렬한다.
  • 시스템은 화성과 텍스처 특징을 별도로 제어할 수 있도록 카드-텍스처 분리 기법을 적용한다.
  • 이웃하는 문장 간의 매끄러운 전환을 확보하기 위해 리듬 밀도와 음성 수의 차이를 최소화하는 대비 손실을 적용한다.
  • 사용자는 리듬 밀도와 음성 수와 같은 두 가지 제어 가능한 텍스처 특징를 사전에 사용하여 후보 문장을 필터링할 수 있어 사용자 중심의 생성이 가능하다.

실험 결과

연구 질문

  • RQ1템플릿 기반 검색과 신경망 스타일 전이를 조합한 하이브리드 접근 방식이 순수 학습 기반 방법보다 더 일관성 있고 구조적으로 일관된 반주를 생성할 수 있는가?
  • RQ2동적 프로그래밍을 통한 문장 검색이 전곡에서 장기적인 음악적 구조를 얼마나 효과적으로 유지하는가?
  • RQ3스타일 전이가 주어진 리드 시트와 참조 문장 간의 화성과 텍스처 적합도를 얼마나 향상시키는가?
  • RQ4리듬 밀도와 음성 수와 같은 사용자 제어 특징이 생성된 반주의 제어 가능성과 품질을 향상시키는 데 얼마나 기여하는가?
  • RQ5제안된 방법이 목적적 평가 지표와 주관적 인간 평가 양면에서 기존 기준 모델을 능가하는가?

주요 결과

  • 주관적 평가에서 72명의 평가자가 5점 척도로 평가한 결과, AccoMontage는 일관성(p < 0.05)과 구조성(p < 0.05) 면에서 모두 기준 모델을 뚜렷이 앞섰다.
  • 모델은 일관성 평균 4.3점, 구조성 평균 4.2점의 점수를 기록하여 멜로디와 뛰어난 조화와 구조 일치를 보였다.
  • 대비 손실은 Random에서 Same Song, Adjacent 문장 쌍으로 갈수록 일관된 감소 추세를 보였으며, 매끄러운 전환을 신뢰성 있게 탐지함을 입증했다.
  • 문장 정확도의 랭킹 정확도(Rank@50)는 0.2425, 곡 정확도는 0.3769로, 후보 풀에서 정확한 이웃 문장을 효과적으로 선별함을 나타냈다.
  • 음악성 면에서 약간 더 높은 성능(p = 0.053)을 기록하여, 통계적 유의성이 엄격히 확보되지 않았음에도 불구하고 높은 종합 음악 품질을 보여주었다.
  • 결과적으로, 규칙 기반 문장 검색과 딥러닝 기반 스타일 전이를 조합함으로써 전곡에 걸쳐 고품질, 제어 가능하고 장기적인 반주 생성이 가능함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.