[논문 리뷰] MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation
이 논문은 다중 트랙 심벌 음악 생성을 위한 새로운 RNN 기반 계층적 VAE 프레임워크인 MIDI-Sandwich2를 제안한다. 이 프레임워크는 트랙 별 모델링을 위해 독립적인 이진 VAE(BVAE)를 사용하고, 교차 트랙 통합을 위해 다중 모odal 융합 생성 VAE(MFG-VAE)를 사용한다. 이진화를 다중 레이블 분류 과제로 재정의함으로써 학습 안정성과 생성 품질을 향상시켰으며, MuseGAN과 같은 최신 모델에 근접한 음악 생성 품질을 달성하였다. VAE 기반 복원은 더욱 표현력 있고 조화로운 결과를 제공하였다.
Currently, almost all the multi-track music generation models use the Convolutional Neural Network (CNN) to build the generative model, while the Recurrent Neural Network (RNN) based models can not be applied in this task. In view of the above problem, this paper proposes a RNN-based Hierarchical Multi-modal Fusion Generation Variational Autoencoder (VAE) network, MIDI-Sandwich2, for multi-track symbolic music generation. Inspired by VQ-VAE2, MIDI-Sandwich2 expands the dimension of the original hierarchical model by using multiple independent Binary Variational Autoencoder (BVAE) models without sharing weights to process the information of each track. Then, with multi-modal fusion technology, the upper layer named Multi-modal Fusion Generation VAE (MFG-VAE) combines the latent space vectors generated by the respective tracks, and uses the decoder to perform the ascending dimension reconstruction to simulate the inverse operation of multi-modal fusion, multi-modal generation, so as to realize the RNN-based multi-track symbolic music generation. For the multi-track format pianoroll, we also improve the output binarization method of MuseGAN, which solves the problem that the refinement step of the original scheme is difficult to differentiate and the gradient is hard to descent, making the generated song more expressive. The model is validated on the Lakh Pianoroll Dataset (LPD) multi-track dataset. Compared to the MuseGAN, MIDI-Sandwich2 can not only generate harmonious multi-track music, the generation quality is also close to the state of the art level. At the same time, by using the VAE to restore songs, the semi-generated songs reproduced by the MIDI-Sandwich2 are more beautiful than the pure autogeneration music generated by MuseGAN. Both the code and the audition audio samples are open source on https://github.com/LiangHsia/MIDI-S2.
연구 동기 및 목표
- 현재 CNN 기반 아키텍처가 지배하고 있는 다중 트랙 심벌 음악 생성 분야에서 효과적인 RNN 기반 모델의 부족을 해결하기 위해.
- BMuseGAN과 같은 기존 GAN 기반 다중 트랙 모델에서 발생하는 기울기 소실 및 비가역적 이진화 문제를 극복하기 위해.
- 공유된 낮은 차원의 잠재 공간을 통해 다중 음악 트랙 간의 계층적이고 다중 모달 융합된 잠재 표현을 가능하게 하기 위해.
- VAE 기반 복원과 생성 음악의 반자동 적응을 활용하여 생성 품질과 표현력을 향상시키기 위해.
- 계층적 VAE와 다중 모달 융합을 결합한 RNN 기반 모델이 다중 트랙 음악 생성에서 최신 성능을 달성할 수 있음을 입증하기 위해.
제안 방법
- 각 음악 트랙에 대해 독립적이고 공유되지 않은 BVAE를 사용하여 RNN 기반 VRAE 아키텍처를 활용해 트랙 별 표현을 학습한다.
- 다중 모달 융합 생성 VAE(MFG-VAE) 인코더는 개별 BVAE의 잠재 벡터를 융합하여 교차 트랙 모델링을 위한 공유된 낮은 차원의 잠재 공간으로 변환한다.
- MFG-VAE 디코더는 융합된 잠재 코드에서 다중 트랙 피아노롤 시퀀스를 재구성하고 생성하기 위해 역다중 모달 융합을 수행한다.
- 이진화 단계가 기존의 미분 가능한 하드 임계값이 아닌 다중 레이블 분류 문제로 재정의되어 학습 중 기울기 흐름이 향상된다.
- 계층적 아키텍처는 스택된 VAE 구성 요소를 통해 국소(트랙 수준) 및 전반적(다중 트랙) 음악 구조를 공동으로 모델링할 수 있다.
- 모델은 Lakh Pianoroll Dataset(LPD)에서 학습되며, 직접 생성과 VAE 기반 복원 모두 평가된다.
실험 결과
연구 질문
- RQ1계층적 VAE와 다중 모달 융합을 갖춘 RNN 기반 모델이 다중 트랙 심벌 음악 생성에 효과적으로 기여할 수 있는가?
- RQ2이진화 단계를 다중 레이블 분류 과제로 재정의하면 다중 트랙 음악 생성에서 학습 안정성과 생성 품질이 향상되는가?
- RQ3RNN 기반 모델의 성능은 MuseGAN과 같은 CNN 기반 최신 모델과 비교해 다중 트랙 음악 생성에서 어떻게 나타나는가?
- RQ4VAE 기반 복원은 생성된 다중 트랙 음악의 표현력과 음악적 조화를 어느 정도 향상시킬 수 있는가?
- RQ5각 트랙에 독립적인 BVAE를 사용하고 공유된 MFG-VAE를 결합하면 공유 가중치 모델보다 더 나은 악기별 연주 스타일을 포착할 수 있는가?
주요 결과
- MIDI-Sandwich2는 최신 성능을 보이는 CNN 기반 GAN 모델인 MuseGAN과 비슷한 음악 생성 품질을 달성하여, RNN 기반 모델이 다중 트랙 음악 생성에서 CNN 성능을 따라할 수 있음을 입증하였다.
- 생성 음악의 VAE 기반 복원은 직접 생성보다 더 높은 품질의 결과를 제공하였으며, 조화롭고 표현력 있는 결과를 얻었다. 사용자 평가 평균 점수는 3.62로 MuseGAN의 3.47을 초월하였다.
- 이진화의 다중 레이블 분류로의 재정의가 학습 안정성과 기울기 흐름을 크게 향상시켜 BMuseGAN의 정밀 조정 단계에서 발생하는 비가역성 문제를 해결하였다.
- 각 트랙에 독립적인 BVAE를 사용할 경우 공유 BVAE보다 고유한 악기 연주 스타일을 더 잘 포착하는 것으로 밝혀졌으며, 시각적 평가 및 사용자 평가 결과에서 개선된 성능을 보였다.
- 사용자 평가 결과, MIDI-Sandwich2의 복원 음악은 조화(4.08), 통합성(3.22), 전반적 품질(3.62)에서 가장 높은 평점을 받았으며, 직접 생성 및 MuseGAN을 모두 능가하였다.
- 모델는 반자동 음악 적응을 가능하게 하여 생성된 음악을 더욱 음악적으로 조화롭고 표현력 있게 미세 조정할 수 있으며, 이는 GAN이나 표준 RNN에서는 찾을 수 없는 기능이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.