[논문 리뷰] Score and Lyrics-Free Singing Voice Generation
이 논문은 음악 점수와 가사 없이도 작곡 가능한 노래 음성 생성을 위한 새로운 작업을 제안하며, GAN 기반 아키텍처에 GRU와 확장된 컨볼루션을 활용해 메르스펙트로그램을 원시 오디오에서 생성함으로써 언어적 또는 음악적 지도 없이도 신뢰할 만한 노래 음성을 생성하는 세 가지 기법—자유, 반주 수반, 솔로 노래—을 제안한다. 다만 음성 품질은 여전히 제한되어 있다.
Generative models for singing voice have been mostly concerned with the task of ``singing voice synthesis,'' i.e., to produce singing voice waveforms given musical scores and text lyrics. In this work, we explore a novel yet challenging alternative: singing voice generation without pre-assigned scores and lyrics, in both training and inference time. In particular, we outline three such generation schemes, and propose a pipeline to tackle these new tasks. Moreover, we implement such models using generative adversarial networks and evaluate them both objectively and subjectively.
연구 동기 및 목표
- 사전에 정해진 음악 점수나 가사 없이도 더 예술적이고 즉흥적인 보컬 생성이 가능한 노래 음성 생성을 탐색한다.
- 음성의 발음이나 톤 정보가 없는 비정렬된 비지도적 음악 데이터로 모델을 훈련시키는 과제를 해결한다.
- 조건이 약하거나 전혀 없는 입력에서 다양하고 표현력 있는 노래 음성을 생성할 수 있는 생성 프레임워크를 개발한다.
- 음성 품질이 제한되어 있음에도 불구하고 생성된 음성이 인간다움, 표현력, 반주와의 호환성 측면에서 평가된다.
- 고정된 입력이 아닌 내부 음악적 아이디어에서 출발해 모델이 창의적 생성을 수행할 수 있도록 한다.
제안 방법
- 메르스펙트로그램의 순차적이고 국소적인 패턴을 모델링하기 위해 게이트드 리커런트 유닛(GRUs)과 그룹화된 확장 컨볼루션을 활용한 BEGAN 기반 GAN 아키텍처를 제안한다.
- 생성된 메르스펙트로그램을 원시 오디오 웨이브폼으로 변환하기 위해 보코더를 사용하여 음성 특징의 정렬이 필요 없도록 한다.
- 공개 음악 자료에서 데이터 수집을 가능하게 하기 위해 최신 소스 분리 모델을 활용해 전체 오디오 녹음에서 보컬과 반주 트랙을 추출한다.
- 세 가지 별도의 모델을 훈련한다: 입력이 없는 자유 가수(무입력), 반주 웨이브폼을 입력으로 받는 반주 수반 가수, 내부 아이디어를 생성하기 위해 임의의 노이즈를 입력으로 받는 솔로 가수.
- 생성된 노래 음성의 청각적 품질과 다양성을 향상시키기 위해 적대적 손실과 다중 척도 디스크림ิน레이터 구성 요소를 적용한다.
- 생성된 보컬이 주어진 반주 트랙과 얼마나 잘 어울리는지를 평가하기 위한 호환성 지표를 도입하였으며, 이는 실제 톤이나 가사 정보가 없더라도 가능하다.
실험 결과
연구 질문
- RQ1모델이 음악 점수나 가사 입력 없이도 신뢰할 만한 노래 음성을 생성할 수 있는가?
- RQ2모델은 톤, 음소, 시간 정보에 대한 지도 없이도 원시 오디오만으로 표현력 있고 일관성 있는 노래를 생성할 수 있는가?
- RQ3원시 노래 오디오에서 비지도 학습을 통해 얼마나 자연스럽고 감정적으로 표현된 음성을 생성할 수 있는가?
- RQ4동일한 반주에 대해 모델이 예술적 자유와 즉흥성의 반영을 통해 다양한 노래 출력을 생성할 수 있는가?
- RQ5음악 점수와 가사 없이도 노래 음성 생성에서 음성 품질과 표현력 사이의 상충 관계는 어떠한가?
주요 결과
- 제안된 모델들은 음악 점수나 가사 입력 없이도 노래 음성을 성공적으로 생성하여 원시 오디오만으로도 신뢰할 만한 노래가 생성될 수 있음을 입증한다.
- 주관적 평가 결과, 생성된 음성이 인간다운 감성과 표현력을 지닌 것으로 평가되었지만, 최신 기술 수준의 SVS 시스템에 비해 여전히 음성 품질이 열 劣하다.
- 반주 수반 가수 모델은 실제 토너먼트나 가사 정보가 없더라도, 자체 개발한 호환성 지표를 통해 입력 반주 트랙과 잘 어울리는 보컬을 생성함을 입증하였다.
- 자유 가수 모델은 입력이 없음에도 불구하고 보컬 유사 음향을 생성하여, 훈련 데이터에서 내재된 음악적 구조를 학습하고 있음을 시사한다.
- GRU와 확장된 컨볼루션의 사용은 노래 음성 생성에서 순차적이고 장거리 의존성을 효과적으로 모델링할 수 있도록 한다.
- 사용자 연구에서 Synthesizer V가 베이스라인으로 존재함에 따라 제안된 모델의 평가 품질이 낮아졌으며, 이는 음성 정밀도 향상 여전히 개선이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.