[논문 리뷰] MeloForm: Generating Melody with Musical Form based on Expert Systems and Neural Networks
MeloForm는 전문가 시스템을 활용한 구조적 작곡과 트랜스포머 기반 신경망을 통한 멜로디 정련을 조합한 하이브리드 시스템으로, 레이블이 없는 음악적 형식 데이터를 요구하지 않으면서도 정확한 음악적 형식 제어를 가능하게 한다. 이 시스템은 음악적 형식 제어 정확도 97.79%를 달성했으며, 주관적 평가에서 형식, 주제적 특성, 풍부함, 종합적 품질 측면에서 베이스라인 대비 0.75~0.89점 향상되었으며, 레이블이 부여된 음악적 형식 데이터가 필요로 하지 않는다.
Human usually composes music by organizing elements according to the musical form to express music ideas. However, for neural network-based music generation, it is difficult to do so due to the lack of labelled data on musical form. In this paper, we develop MeloForm, a system that generates melody with musical form using expert systems and neural networks. Specifically, 1) we design an expert system to generate a melody by developing musical elements from motifs to phrases then to sections with repetitions and variations according to pre-given musical form; 2) considering the generated melody is lack of musical richness, we design a Transformer based refinement model to improve the melody without changing its musical form. MeloForm enjoys the advantages of precise musical form control by expert systems and musical richness learning via neural models. Both subjective and objective experimental evaluations demonstrate that MeloForm generates melodies with precise musical form control with 97.79% accuracy, and outperforms baseline systems in terms of subjective evaluation score by 0.75, 0.50, 0.86 and 0.89 in structure, thematic, richness and overall quality, without any labelled musical form data. Besides, MeloForm can support various kinds of forms, such as verse and chorus form, rondo form, variational form, sonata form, etc.
연구 동기 및 목표
- 데이터 기반 음악 생성에서 명시적이고 고수준의 음악적 형식(예: 스토리지-코러스, 소나타 형식 등)을 갖춘 멜로디 생성 과제를 해결하기 위해.
- 순수 신경망 모델의 한계를 극복하기 위해, 반복을 암묵적으로 학습하지만 정밀한 형식 제어가 어려운 점을 보완하기 위해.
- 정확한 구조적 작곡을 위한 전문가 시스템과 더 높은 멜로디적 표현력을 갖춘 신경망의 통합을 위해.
- 전문가 규칙를 활용해 합성된 완벽하게 레이블링된 형식 데이터를 생성함으로써, 고비용의 인간 레이블링된 음악적 형식 데이터가 필요 없도록 하기 위해.
- 버스터, 라운드, 변주형, 소나타 형식 등 다양한 음악적 형식에 대해 영향을 받지 않는 탄력적인 멜로디 생성을 가능하게 하기 위해.
제안 방법
- 전문가 시스템은 사전에 지정된 음악적 형식에 따라 모티프를 구절과 구역으로 계층적으로 발전시키며, 반복과 변주를 적용하여 멜로디를 생성한다.
- 트랜스포머 기반 정련 모델은 원래의 음악적 형식을 유지하면서도 세밀한 리듬과 화성 패턴에 조건을 두어 멜로디의 풍부함을 향상시킨다.
- 정련 전략은 구절 단위에서 작동하며, 긴장감과 표현을 조절하기 위해 구역 구분 토큰(예: 'AVGPITCH', 'SPAN')을 사용해 반복적인 정련을 수행한다.
- 음악적 형식 데이터는 전문가 시스템에 의해 합성적으로 생성되며, 학습 및 평가에 사용되는 비용이 들지 않고 정확도가 완벽한 레이블을 제공한다.
- 구조적 구성 및 변주 규칙를 조정하여 다양한 음악적 형식을 지원한다. 예를 들어, 소나타 형식의 복귀부에서는 모티프를 이동시키고, 변주형 형식에서는 모티프를 발전시킨다.
- 신경망 정련 모델은 조성, 리듬, 구역 수준의 특징에 조건을 두어 형식에 일관되며 음악적으로 타당한 출력을 보장한다.
실험 결과
연구 질문
- RQ1전문가 시스템과 신경망의 하이브리드 접근 방식이 레이블이 없는 데이터로도 정밀하고 고수준의 음악적 형식 제어를 달성할 수 있는가?
- RQ2규칙 기반의 구조적 작곡과 신경망 정련의 조합이 멜로디의 풍부함과 표현력 향상에 얼마나 효과적인가?
- RQ3제안된 방법이 주관적 및 객관적 평가에서 순수 데이터 기반 모델보다 음악적 품질 측면에서 얼마나 뛰어나게 성능을 내는가?
- RQ4시스템은 버스터, 라운드, 변주형, 소나타 형식 등 다양한 음악적 형식으로 일반화 가능한가?
- RQ5정련 파이프라인의 어떤 구성 요소(예: 리듬 조건, 반복적 정련, 구역 구분)가 청각적 품질 향상에 가장 기여하는가?
주요 결과
- MeloForm는 레이블이 없는 데이터로도 음악적 형식 제어 정확도 97.79%를 달성하여 정확하고 신뢰할 수 있는 구조적 생성 능력을 입증했다.
- 주관적 평가에서 MeloForm는 형식, 주제적 특성, 풍부함, 종합적 품질 측면에서 각각 0.75, 0.50, 0.86, 0.89점 향상되어 베이스라인 시스템을 능가했다.
- 제거 실험 결과 전문가 시스템과 신경망 정련 구성 요소가 모두 필수적임을 확인했으며, 둘 중 하나를 제거하면 성능이 크게 저하됨을 보였다.
- 세밀한 리듬 조건과 구역 구분 토큰의 포함이 선호도 기반 평가에서 청각적 품질 향상에 크게 기여하는 것으로 나타났다.
- 시스템은 버스터, 라운드, 변주형, 소나타 형식을 포함한 여러 음악적 형식에서 일관된 구조적 및 표현적 품질을 유지하며 일반화 성능을 보였다.
- 저자들은 합성 멜로디 데이터셋과 소스 코드를 공개하여 향후 음악 형식 모델링 및 구조적 생성 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.