Skip to main content
QUICK REVIEW

[논문 리뷰] MidiNet: A Convolutional Generative Adversarial Network for Symbolic-domain Music Generation using 1D and 2D Conditions.

Li-Chia Yang, Szu-Yu Chou|arXiv (Cornell University)|2017. 03. 31.
Music Technology and Sound Studies참고 문헌 11인용 수 32
한 줄 요약

MidiNet는 1D 차수의 코드 조건(조화적 맥락)과 2D 이전 멜로디 조건(순차적 맥락)을 사용하여 바 단위로 음악을 생성하는 1D 및 2D 조건부 컨volution 신경망 생성 모델(GAN)이다. 이는 조화롭고 일관된 멜로디를 생성한다. 각 바는 16분음표 해상도로 16x128 행렬로 표현되며, 연결을 통해 임의의 길이의 연주 가능한 음악 시퀀스를 생성할 수 있다.

ABSTRACT

In this paper, we present MidiNet, a deep convolutional neural network (CNN) based generative adversarial network (GAN) that is intended to provide a general, highly adaptive network structure for symbolic-domain music generation. The network takes random noise as input and generates a melody sequence one mea- sure (bar) after another. Moreover, it has a novel reflective CNN sub-model that allows us to guide the generation process by providing not only 1D but also 2D conditions. In our implementation, we used the intended chord of the current bar as a 1D condition to provide a harmonic context, and the melody generated for the preceding bar previously as a 2D condition to provide sequential information. The output of the network is a 16 by 128 matrix each time, representing the presence of each of the 128 MIDI notes in the generated melody sequence of that bar, with the smallest temporal unit being the sixteenth note. MidiNet can generate music of arbitrary number of bars, by concatenating these 16 by 128 matrices. The melody sequence can then be played back with a synthesizer. We provide example clips showing the effectiveness of MidiNet in generating harmonic music.

연구 동기 및 목표

  • 상징적 영역의 음악 생성을 위한 일반적이고 적응 가능한 딥 러닝 프레임워크 개발.
  • 조화적(1D) 및 순차적(2D) 맥락을 모두 활용한 조건부 음악 생성 가능화.
  • 실시간으로 바 단위로 일관되고 조화로운 멜로디를 생성하며, 음악의 구조와 조화에 대한 완전한 제어 제공.
  • 생성된 바를 연결함으로써 임의의 길이의 음악 생성 지원.

제안 방법

  • 모델은 생성기로 16분음표 해상도에서 바당초 16x128 행렬을 생성하는 조건부 GAN 아키텍처를 사용한다. 이 행렬은 MIDI 노트 이벤트를 나타낸다.
  • 반사형 CNN 서브모델이 1D 코드 조건(조화적 맥락)과 2D 이전 멜로디 조건(순차적 맥락)을 모두 처리하여 생성을 안내한다.
  • 생성기는 임의의 노이즈와 조건 벡터를 입력으로 받아 순차적으로 한 바씩 생성한다.
  • 판별기는 생성된 바의 진위성을 평가하여 실제 음악 시퀀스와 생성된 시퀀스를 구분한다.
  • 네트워크는 음악적으로 일관되고 조화로운 멜로디를 생성하도록 엔드 투 엔드로 훈련된다.
  • 생성된 바는 연결되어 더 긴 시퀀스를 형성하며, 이로써 임의의 길이의 음악 출력이 가능해진다.

실험 결과

연구 질문

  • RQ11D 및 2D 조건을 갖춘 조건부 GAN이 바 단위로 음악적으로 일관되고 조화로운 멜로디를 생성할 수 있는가?
  • RQ21D 코드 조건과 2D 이전 멜로디 조건이 얼마나 효과적으로 구조적으로 일관된 음악 생성을 이끌 수 있는가?
  • RQ3순차적으로 바를 생성하고 연결함으로써 장기간의 연속된 멜로디를 생성할 수 있는가?
  • RQ4반사형 CNN 서브모델은 단일 조건 또는 무조건적 기반 모델 대비 생성 품질을 얼마나 향상시키는가?

주요 결과

  • MidiNet은 현재의 코드 진행과 이전에 생성된 멜로디를 조건으로 하여 조화롭고 일관된 음악 시퀀스를 성공적으로 생성한다.
  • 2D 이전 멜로디를 조건으로 사용함으로써 모델은 바 간의 멜로디 연속성을 유지할 수 있다.
  • 모델은 표준 상징적 형식(16x128 행렬)으로 출력을 생성하여 합성기로 직접 연주할 수 있다.
  • 바 단위 생성 방식은 연결을 통해 임의의 길이의 음악 생성이 가능한 탄력적인 방식을 제공한다.
  • 예시 클립은 모델이 음악적으로 타당하고 조화로운 멜로디를 생성할 수 있음을 보여준다.
  • 반사형 CNN 서브모델은 1D 및 2D 다중 모odal 조건을 효과적으로 통합하여 생성 품질을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.