[논문 리뷰] Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling
이 논문은 중국 노래 코퍼스에서 더 나은 시간적 의존성과 더 자연스러운 떨림을 구현하기 위해 깊이 있는 자동회귀(DAR) 신경망을 제안한다. F0와 스펙트럼 특징을 모델링하기 위해 이중으로 디지털화된 F0 예측과 후처리 전략, 그리고 자기주의 강화된 프리넷을 사용함으로써, 음악 노트와의 정렬이 향상되고 더 자연스러운 떨림을 구현한다. 주관적 평가와 객관적 평가에서 RNN 기반 기준 모델을 능가한다.
This paper presents a method of using autoregressive neural networks for the acoustic modeling of singing voice synthesis (SVS). Singing voice differs from speech and it contains more local dynamic movements of acoustic features, e.g., vibratos. Therefore, our method adopts deep autoregressive (DAR) models to predict the F0 and spectral features of singing voice in order to better describe the dependencies among the acoustic features of consecutive frames. For F0 modeling, discretized F0 values are used and the influences of the history length in DAR are analyzed by experiments. An F0 post-processing strategy is also designed to alleviate the inconsistency between the predicted F0 contours and the F0 values determined by music notes. Furthermore, we extend the DAR model to deal with continuous spectral features, and a prenet module with self-attention layers is introduced to process historical frames. Experiments on a Chinese singing voice corpus demonstrate that our method using DARs can produce F0 contours with vibratos effectively, and can achieve better objective and subjective performance than the conventional method using recurrent neural networks (RNNs).
연구 동기 및 목표
- 노래 음성에서 떨림과 같은 세밀한 시간적 동역학을 포착하는 데에 RNN 기반 음성 모델링의 한계를 해결하기 위해.
- 노트 기반의 음고 값에서의 편차를 줄임으로써 음악 표기와의 F0 윤곽 일치도를 향상시키기 위해.
- 자기주의 기반 프리넷 모듈을 사용하여 장거리 의존성을 향상시켜 스펙트럼 특징을 모델링하기 위해.
- 기존의 RNN 기반 방법에 비해 더 높은 자연스러움과 청각적 품질을 달성하기 위해.
- 통합된 SVS 프레임워크 내에서 F0와 스펙트럼 특징을 동시에 모델링하는 DAR 모델의 효과성을 평가하기 위해.
제안 방법
- F0는 Mel 스케일로 변환된 이산화된 F0 값과 N 단계로 양자화된 값을 사용한 깊이 있는 자동회귀 네트워크로 모델링되며, 이는 원-핫 벡터로 표현된다.
- 피드백 연결 메커니즘이 마지막 K개의 예측 출력을 재귀 단위에 통합하여 프레임 간 시간 의존성을 모델링한다.
- F0 후처리 전략은 예측된 F0 윤곽을 음악 노트 기반 음고 값과 정렬하기 위해 이동 평균 필터를 적용하여 편차를 감소시킨다.
- 스펙트럼 모델링을 위해 다중 자기주의 레이어를 갖춘 프리넷 모듈이 역사적 프레임을 처리하여 동적 스펙트럼 변화의 표현을 향상시킨다.
- 스펙트럼 모델은 잔차 연결과 최종 완전 연결 레이어를 사용하여 멜-세프스트럼 계수를 예측하며, 평균 제곱오차(MSE)로 훈련된다.
- 예측된 F0와 스펙트럼 특징에서 웨이브러닝 볼륨을 합성하기 위해 WaveRNN 볼륨이 사용된다.
실험 결과
연구 질문
- RQ1깊이 있는 자동회귀 모델은 떨림과 같은 F0의 局소적 동적 움직임을 효과적으로 모델링할 수 있는가?
- RQ2DAR 모델의 역사 길이(K)는 F0 예측 성능과 자연스러움에 어떤 영향을 미치는가?
- RQ3제안된 F0 후처리 전략은 예측된 F0 윤곽과 음악 노트 음고 사이의 정렬을 유의미하게 향상시키는가?
- RQ4자기주의 강화된 프리넷 모듈은 표준 RNN에 비해 스펙트럼 특징 모델링을 향상시키는가?
- RQ5제안된 DAR 기반 SVS 시스템은 객관적 및 주관적 평가에서 RNN 기반 기준 모델에 비해 어떻게 비교되는가?
주요 결과
- DAR 기반 F0 모델은 자연스러운 F0 윤곽에서 35.09 Hz의 F0 RMSE를 기록했고, 음악 노트 기반 F0에서는 19.14 Hz를 기록하여 RNN 기준 모델(각각 35.09 Hz 및 34.42 Hz)을 뛰어넘었다.
- F0 후처리를 거친 후, 음악 노트 기반 F0에서의 RMSE는 8.45 Hz로 감소하여 강력한 정렬 향상이 확인되었다.
- 노트 기반 F0를 기준으로 예측된 F0 윤곽과 참값 사이의 상관계수는 0.99에 도달하여 높은 정밀도를 보였다.
- 자기주의 기반 프리넷을 사용한 스펙트럼 모델은 멜-세프스트럼 왜곡(MCD)이 3.51 dB로 기준 모델을 능가하여 스펙트럼 정확도 향상을 입증했다.
- 주관적 청취 테스트에서 DAR 기반 모델은 RNN 기준 모델보다 유의미하게 선호되었으며(p < 0.001), DAR+P 변형은 더욱 선호되었다(p < 0.01).
- 이 방법은 RNN 기준 모델이 과도하게 매끄럽게 처리하는 바람에 잘 재현되지 않는 자연스러운 떨림을 가진 F0 윤곽을 성공적으로 생성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.