[논문 리뷰] DDSP-based Singing Vocoders: A New Subtractive-based Synthesizer and A Comprehensive Evaluation
이 논문은 사인파형과 시간에 따라 변하는 필터를 사용하여 위상 연속성과 고조파 일관성을 강제하는 DDSP 기반의 노래 보컬러를 제안한다. 3시간의 훈련 데이터만으로도 최신의 GAN 및 확산 기반 보컬러를 능가하며 자원이 제한된 환경에서 더 빠른 수렴 속도와 뛰어난 청각 품질을 보이며, 비음성 음소에서 잔류하는 '지저귐' 잡음이 존재한다.
A vocoder is a conditional audio generation model that converts acoustic features such as mel-spectrograms into waveforms. Taking inspiration from Differentiable Digital Signal Processing (DDSP), we propose a new vocoder named SawSing for singing voices. SawSing synthesizes the harmonic part of singing voices by filtering a sawtooth source signal with a linear time-variant finite impulse response filter whose coefficients are estimated from the input mel-spectrogram by a neural network. As this approach enforces phase continuity, SawSing can generate singing voices without the phase-discontinuity glitch of many existing vocoders. Moreover, the source-filter assumption provides an inductive bias that allows SawSing to be trained on a small amount of data. Our experiments show that SawSing converges much faster and outperforms state-of-the-art generative adversarial network and diffusion-based vocoders in a resource-limited scenario with only 3 training recordings and a 3-hour training time.
연구 동기 및 목표
- 노래 음성 품질을 떨어뜨리는 신경 보컬러에서의 위상 불연속성과 '글리치' 잡음을 해결하기 위해.
- DDSP 프레임워크 내에서 감산 합성의 적용 가능성을 탐색하기 위해.
- 자원과 시간 제약 조건 하에서 DDSP 기반 보컬러의 훈련 효율성과 청각 품질을 평가하기 위해.
- 표준 및 자원 제한 훈련 환경에서 SawSing의 성능을 최신 신경 보컬러들과 비교하기 위해.
- 비음성 자음과 숨소리가 나는 음소에서 나타나는 청각 잡음, 예를 들어 '지저귐'을 식별하고 이를 완화하기 위해.
제안 방법
- SawSing은 위상 연속성과 고조파 일관성을 보장하기 위해 가역적 사인파형 오실레이터를 조화성 소스로 사용한다.
- 신경망은 입력 멜-스펙트로그램에서 기본 주파수(f0)와 시간에 따라 변하는 FIR 필터 계수를 추정하여 조화성 및 노이즈 성분을 형상화한다.
- 모델은 조화성 경로(필터링된 사인파형)와 확률적 경로(균일한 노이즈를 필터링한)를 조합하여 노래 음성을 합성한다.
- 위상 연속성은 사인파형 신호의 물리적 성질에 의해 강제되며, 일반적인 신경 보컬러에서 흔한 일시적 잡음을 감소시킨다.
- 비음성 프레임 동안 조화성 에너지를 억제하기 위해 Parselmouth를 사용한 후처리 방법을 적용한다.
- 청각적 손실과 재구성 손실의 조합을 사용하여 엔드 투 엔드로 모델을 훈련시키며, 목적적 지표와 주관적 MOS 테스트를 통해 평가한다.
실험 결과
연구 질문
- RQ1DDSP 프레임워크 내 감산 합성 접근 방식이 위상 연속성을 유지하면서 효과적으로 노래 음성을 모델링할 수 있는가?
- RQ2제한된 훈련 데이터와 시간 조건에서 SawSing의 성능은 최신의 GAN 및 확산 기반 보컬러와 비교해 어떻게 되는가?
- RQ3SawSing에서 나타나는 청각 잡음, 예를 들어 '지저귐'은 무엇이며, 후처리 또는 아키텍처 개선을 통해 이를 완화할 수 있는가?
- RQ4소스-필터 모델의 인덕티브 바이어스는 최소한의 데이터로 더 빠른 수렴과 더 나은 일반화를 가능하게 하는가?
- RQ5단음악기 합성과의 차이점에도 불구하고, DDSP의 소스-필터 구조는 노래 음성에 적응시킬 수 있는가?
주요 결과
- 자원이 제한된 환경에서 단지 3시간의 훈련 데이터로 SawSing은 남성 가수의 경우 평균 평가 점수(MOS) 2.4, 여성 가수의 경우 2.1을 기록했으며, 이는 HiFi-GAN의 점수 1.0보다 유의미하게 뛰어나다.
- 저자원 설정에서 SawSing은 HiFi-GAN, DDSP-Add, NSF보다 더 빠른 수렴 속도와 뛰어난 청각 품질을 보였으며, 남성 가수의 경우 통계적으로 유의미한 MOS 차이(p < 0.05)를 보였다.
- 긴 문장에서의 뛰어난 성능과 더 빠른 수렴에도 불구하고, SawSing은 조화성 성분의 과도한 필터링으로 인해 비음성 자음과 숨소리가 나는 음소에서 '지저귐' 잡음을 보였다.
- 이 '지저귐' 잡음은 표준 목적의 손실 함수로는 캡처되지 않았으며, 청각 품질과 훈련 목표 사이의 격차를 시사한다.
- 비음성 프레임 동안 조화성 에너지를 억제하기 위해 Parselmouth를 사용한 후처리가 잡음을 유의미하게 감소시켜 효과성을 입증했다.
- 일반적인 훈련 설정에서 DDSP-Add는 남성 가수의 경우 SawSing을 능가했으며(p < 0.05), 이는 추가 모델링이 일부 음소에 더 강건할 수 있음을 시사하지만, SawSing의 훈련 효율성 덕분에 저자원 환경에서의 경쟁력이 뛰어나다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.