Skip to main content
QUICK REVIEW

[논문 리뷰] VISinger: Variational Inference with Adversarial Learning for End-to-End Singing Voice Synthesis

Yongmao Zhang, Jian Cong|arXiv (Cornell University)|2021. 10. 17.
Music and Audio Processing인용 수 10
한 줄 요약

VISinger는 변분 추론과 적대적 학습을 기반으로 한 엔드 투 엔드 음성 합성 시스템으로, VITS를 개선하여 음악 특화 음성 변형을 모델링하기 위해 프레임 수준의 사전 네트워크, F0 예측기, 노트 정규화된 지속 시간 예측기를 도입하였다. 중국어 가요 코퍼스에서 두 단계 시스템과 오라클 VITS보다 뛰어난 음성 품질, 자연스러움, 음정 안정성을 달성하였다.

ABSTRACT

In this paper, we propose VISinger, a complete end-to-end high-quality singing voice synthesis (SVS) system that directly generates audio waveform from lyrics and musical score. Our approach is inspired by VITS, which adopts VAE-based posterior encoder augmented with normalizing flow-based prior encoder and adversarial decoder to realize complete end-to-end speech generation. VISinger follows the main architecture of VITS, but makes substantial improvements to the prior encoder based on the characteristics of singing. First, instead of using phoneme-level mean and variance of acoustic features, we introduce a length regulator and a frame prior network to get the frame-level mean and variance on acoustic features, modeling the rich acoustic variation in singing. Second, we further introduce an F0 predictor to guide the frame prior network, leading to stabler singing performance. Finally, to improve the singing rhythm, we modify the duration predictor to specifically predict the phoneme to note duration ratio, helped with singing note normalization. Experiments on a professional Mandarin singing corpus show that VISinger significantly outperforms FastSpeech+Neural-Vocoder two-stage approach and the oracle VITS; ablation study demonstrates the effectiveness of different contributions.

연구 동기 및 목표

  • 독립된 음성 모델과 신경 음원 합성기로 구성된 두 단계 가요 음성 합성 시스템에서 발생하는 학습-추론 불일치 문제를 해결하기 위해.
  • 원래 말하기를 위한 목적으로 설계된 VITS 프레임워크를 고품질 엔드 투 엔드 가요 음성 합성 시스템으로 적응시키기 위해.
  • 진동과 음정과 같은 풍부한 음성 변형을 특화된 아키텍처 수정을 통해 모델링하기 위해.
  • 지속 시간 예측기를 재정의하여 음소-노트 지속 시간 비율을 예측함으로써 리듬 정확도와 노트 정규화를 향상시키기 위해.
  • 변분 추론과 적대적 학습을 통한 엔드 투 엔드 학습이 두 단계 기반 시스템과 오라클 VITS보다 뛰어난 가요 음성 품질을 제공함을 입증하기 위해.

제안 방법

  • VITS에서 영감을 얻어 후행 인코더, 사전 인코더, 적대적 디코더를 갖춘 조건부 변분 자동인코더(CVAE) 프레임워크를 채택.
  • 음소 수준의 사전을 프레임 수준의 사전 네트워크로 대체하여, 길이 조절기(Length Regulator)를 사용해 음성 특징의 프레임별 평균과 분산을 모델링.
  • 프레임 사전 네트워크를 지도하기 위해 F0 예측기를 도입하여 음정 안정성 향상과 피치 오류 감소.
  • 지속 시간 예측기를 수정하여 음소-노트 지속 시간 비율을 예측함으로써 더 나은 가요 음표 정규화와 리듬 정확도 향상.
  • 사전 인코더에 정규화 흐름(Normalizing Flows)을 사용하고 디코더에서 적대적 학습을 적용하여 웨이브폼 품질 향상과 분포 일치 개선.
  • 적대적 손실, VAE 재구성 손실, 플로우 기반 가능도 최적화를 통해 전체 모델을 엔드 투 엔드로 학습.
Fig. 1 : Architecture of VISinger
Fig. 1 : Architecture of VISinger

실험 결과

연구 질문

  • RQ1VITS 기반 엔드 투 엔드 프레임워크는 말보다 더 풍부한 음성 변형을 갖춘 고음질 가요 음성 합성에 효과적으로 적응할 수 있는가?
  • RQ2음소 수준의 분포가 아닌 프레임 수준의 사전 분포를 모델링함으로써 가요 음성 품질과 안정성이 향상되는가?
  • RQ3F0 지도 프레임 사전 네트워크가 음정 오류를 얼마나 줄이고 자연스러운 음성 품질을 향상시키는가?
  • RQ4노트 정규화 지속 시간 예측기는 리듬 정확도 향상과 지속 시간 일관성 향상에 얼마나 효과적인가?
  • RQ5변분 추론과 적대적 학습을 통한 엔드 투 엔드 학습이 두 단계 기반 시스템과 오라클 VITS보다 가요 합성에서 뛰어난 성능을 내는가?

주요 결과

  • VISinger는 음질에 대해 평균 평가 점수(MOS) 3.93, 자연스러움에 대해 3.76을 기록하여 두 단계 기반 기준선인 FastSpeech+WaveRNN을 뛰어넘었다.
  • VISinger의 F0 평균 절대 오차(F0 MAE)는 18.7 Hz로, FastSpeech+WaveRNN의 22.1 Hz보다 낮아 더 높은 피치 정확도를 보였다.
  • VISinger의 지속 시간 평균 절대 오차(Dur MAE)는 12.3 ms로, 두 단계 시스템의 15.6 ms보다 낮아 리듬 정밀도 향상을 보였다.
  • 절단 실험 결과, 프레임 사전 네트워크를 제거하면 MOS가 음질 3.30, 자연스러움 2.78로 감소하여, 단순히 플로우 레이어를 늘리는 것보다 필수적임을 입증.
  • 노트 정규화 전략은 지속 시간 편차 분산을 줄였으며, 더 많은 예측값이 0에 집중되어 있어 지속 시간 모델링에서 효과적임을 확인.
  • VISinger는 스펙트로그램에서 더 선명한 고주파 조화 성분을 생성하여 두 단계 시스템보다 실제 값에 더 가까운 시각적 특징을 보였다.
Fig. 2 : Spectrogram of a testing clip, generated by the ground truth, FastSpeech+WaveRNN, and VISinger.
Fig. 2 : Spectrogram of a testing clip, generated by the ground truth, FastSpeech+WaveRNN, and VISinger.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.