[논문 리뷰] A variational autoencoder for music generation controlled by tonal tension
이 논문은 나선 배열 이론 기반으로 두 가지 톤의 긴장도 측정법—구름 지름과 인장 응력—을 통합하여 제어 가능한 음악 생성을 위한 변분 오토에인코더(VAE)를 제안한다. 잠재 공간을 스케일된 긴장 방향 및 수준 벡터로 조건화하여, 리듬은 유지하면서 음고 내용을 변경함으로써 원하는 긴장 프로파일에 맞는 음악 변형을 생성함으로써, 생성된 곡에서 음악적 긴장도를 정밀하게 제어할 수 있다.
Many of the music generation systems based on neural networks are fully autonomous and do not offer control over the generation process. In this research, we present a controllable music generation system in terms of tonal tension. We incorporate two tonal tension measures based on the Spiral Array Tension theory into a variational autoencoder model. This allows us to control the direction of the tonal tension throughout the generated piece, as well as the overall level of tonal tension. Given a seed musical fragment, stemming from either the user input or from directly sampling from the latent space, the model can generate variations of this original seed fragment with altered tonal tension. This altered music still resembles the seed music rhythmically, but the pitch of the notes are changed to match the desired tonal tension as conditioned by the user.
연구 동기 및 목표
- 사용자가 생성된 음악의 톤의 긴장도를 형태화할 수 있는 제어 가능한 음악 생성 시스템을 개발하는 것.
- 두 가지 톤의 긴장도 측정법—구름 지름과 인장 응력—을 심층 생성 모델에 통합하여 세밀한 제어를 가능하게 하는 것.
- 사용자가 정의한 긴장 프로파일에 맞추어 리듬적 구조를 유지하면서 음고 내용을 수정하는 것.
- 잠재 공간 벡터로 긴장 방향과 수준를 조건화하여 일관되고 장기적인 음악 변형을 생성하는 것.
- 긴장도 제어가 생성된 음악 조각의 일관성과 청취자 인지 품질에 미치는 영향을 탐색하는 것.
제안 방법
- 모델는 긴장도 관련 벡터로 조건화된 잠재 공간을 갖는 조건부 변분 오토에인코더(VAE) 아키텍처를 사용한다.
- 두 가지 톤의 긴장도 측정법—구름 지름(비조화 기반)과 인장 응력(키 간격 기반)—은 나선 배열 이론을 사용해 음악 조각에서 계산된다.
- MIDI 파일에서 4마디의 단일 음선 멜로디-베이스 조각을 추출하여, 일관된 키 기준을 위해 도 조 또는 라 미너르로 옮긴다.
- 긴장도 특징 벡터(예: 인장 응력 방향, 구름 지름 수준)는 스케일링되어 잠재 공간에 추가되어 출력 긴장도를 조절한다.
- 모델는 3,457개의 팝 MIDI 파일에서 유래한 44,900개의 4마디 조각으로 훈련되며, 피치 및 긴장도 특징은 Midi-Miner를 통해 추출된다.
- 생성된 음악은 시드의 리듬적 구조를 유지하지만, 원하는 긴장 프로파일에 맞게 음고 내용을 변경한다.
실험 결과
연구 질문
- RQ1사용자가 정의한 톤의 긴장도 프로파일을 갖는 음악을 생성하기 위해 VAE 모델이 효과적으로 조건화될 수 있는가?
- RQ2모델는 긴장 목표에 맞추어 음고 내용을 수정하면서도 리듬적 구조를 어느 정도 유지할 수 있는가?
- RQ3다른 긴장도 특징 벡터(예: 인장 응력 대비 구름 지름)는 결과 긴장도 형태와 음고 분포에 어떤 영향을 미치는가?
- RQ4잠재 표현에 긴장도 벡터를 순차적으로 적용함으로써 모델은 일관되고 장기적인 음악 변형을 생성할 수 있는가?
- RQ5긴장도 인식 특징을 통합함으로써 생성된 음악의 청취자 인지 품질과 음고 분포가 향상되는가?
주요 결과
- 잠재 공간에 스케일된 인장 응력 방향 벡터를 추가하면, 상승 긴장 추세를 갖는 음악의 비율이 증가하여 생성 샘플에서 70%의 상승 비율을 기록한다.
- 구름 지름 방향 벡터는 인장 응력 방향 벡터보다 인장 응력 상승 비율에 더 강한 영향을 미치며, 이는 두 요소 간의 계층적 관계를 시사한다.
- 음고 분포에 상당한 변화가 발생: C와 G 음은 빈도가 감소하고, A, E, D 음은 인장 응력 상승 조건화 시 뚜렷하게 증가한다.
- 사용자 정의된 형태의 긴장도 벡터를 사용함으로써, 모델은 \diagup\diagdown 또는 \diagdown\diagup 등의 복잡한 긴장 형태를 성공적으로 생성한다.
- 인장 응력 특징을 통합함으로써베이스 음고 손실이 감소하여, 생성된 음악의 음고 정확도가 향상된다.
- 시드 조각의 잠재 공간에 긴장도 벡터를 순차적으로 적용함으로써, 일관되고 다중 조각으로 구성된 음악 생성이 가능해진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.