[논문 리뷰] HiFiSinger: Towards High-Fidelity Neural Singing Voice Synthesis
HiFiSinger는 FastSpeech 음향 모델링과 Parallel WaveGAN 보코딩을 다중 스케일 적대 학습(SF-GAN 및 ML-GAN)으로 수행하여 고충실도 48kHz 합창 보컬 합성을 달성하고 이전 SVS 시스템을 능가한다.
High-fidelity singing voices usually require higher sampling rate (e.g., 48kHz) to convey expression and emotion. However, higher sampling rate causes the wider frequency band and longer waveform sequences and throws challenges for singing voice synthesis (SVS) in both frequency and time domains. Conventional SVS systems that adopt small sampling rate cannot well address the above challenges. In this paper, we develop HiFiSinger, an SVS system towards high-fidelity singing voice. HiFiSinger consists of a FastSpeech based acoustic model and a Parallel WaveGAN based vocoder to ensure fast training and inference and also high voice quality. To tackle the difficulty of singing modeling caused by high sampling rate (wider frequency band and longer waveform), we introduce multi-scale adversarial training in both the acoustic model and vocoder to improve singing modeling. Specifically, 1) To handle the larger range of frequencies caused by higher sampling rate, we propose a novel sub-frequency GAN (SF-GAN) on mel-spectrogram generation, which splits the full 80-dimensional mel-frequency into multiple sub-bands and models each sub-band with a separate discriminator. 2) To model longer waveform sequences caused by higher sampling rate, we propose a multi-length GAN (ML-GAN) for waveform generation to model different lengths of waveform sequences with separate discriminators. 3) We also introduce several additional designs and findings in HiFiSinger that are crucial for high-fidelity voices, such as adding F0 (pitch) and V/UV (voiced/unvoiced flag) as acoustic features, choosing an appropriate window/hop size for mel-spectrogram, and increasing the receptive field in vocoder for long vowel modeling. Experiment results show that HiFiSinger synthesizes high-fidelity singing voices with much higher quality: 0.32/0.44 MOS gain over 48kHz/24kHz baseline and 0.83 MOS gain over previous SVS systems.
연구 동기 및 목표
- 48kHz에서의 고충실도 합창 보이스 합성의 도전을 확장된 주파수 커버리지와 시간적 모델링으로 해결한다.
- 폭 넓은 주파수 대역과 긴 파형 시퀀스를 모델링하기 위한 적대적 학습 규칙을 제안한다.
- 피치와 발성/무발성 특성을 포함하여 보컬 품질과 제어 가능성을 향상시킨다.
- 고주파 합창 보이스 합성에 영향을 주는 설계 선택(윈도우 크기, 수용 필드)을 조사한다.
- 24kHz 기준 및 이전 SVS 시스템 대비 품질 향상을 입증한다.
제안 방법
- FastSpeech 기반 음향 모델과 Parallel WaveGAN 보코더를 채택해 빠른 학습과 추론을 가능하게 한다.
- SF-GAN을 도입해 80개의 멜-스펙트로그램 빈을 저주파/중주파/고주파 서브밴드로 나누고 각 판별기를 두어 넓은 주파수 대역을 더 잘 모델링한다.
- ML-GAN을 도입해 서로 다른 파형 길이(0.25s, 0.5s, 0.75s, 1.0s)에 대한 다중 판별기를 사용하여 더 긴 시퀀스를 처리한다.
- 피치(F0)와 V/UV를 추가 음향 특징으로 도입하고 악보 피치를 잔차 학습의 지름길 입력으로 사용한다.
- 멜-스펙트로그램의 20ms 창과 5ms 홉을 선택하고 보코더의 수용 필드를 확장해 긴 모음을 모델링한다.
- 음향 모델과 보코더를 각각 학습하고 초기화 기간 이후에 판별기를 적용하며 학습 중에는 실측 길이를, 추론 시에는 예측 길이를 사용한다.
실험 결과
연구 질문
- RQ148kHz SVS가 24kHz SVS 및 기존 SVS 시스템에 비해 현저히 더 높은 품질을 제공하는가?
- RQ2다중 밴드(SF-GAN) 및 다중 길이(ML-GAN) 적대 설계가 고샘플링 속 합창의 멜-스펙트로그램과 파형 생성을 향상시키는가?
- RQ3추가 음향 특징(F0, V/UV) 및 세심한 특징/윈도우 선택이 최종 보컬 품질에 어떤 영향을 미치는가?
- RQ4보코더의 수용 필드가 합창 보컬의 긴 모음에 어떤 영향을 주는가?
주요 결과
- HiFiSinger는 48kHz에서 24kHz 기준 및 이전 SVS 시스템보다 더 높은 MOS를 달성하며, XiaoiceSing보다 0.83 MOS 증가를 포함한다.
- HiFiSinger는 24kHz에서 48kHz로 업그레이드할 때 0.29 MOS 증가를 보였고, 기준선의 증가율인 0.12 MOS를 능가한다.
- 세 개의 주파수 대역 판별기를 가진 SF-GAN이 더 적거나 더 많은 판별기를 가진 구성보다 우수하며 밴드 간 모델링에 적합한 최적 지점을 시사한다.
- 다중 파형 길이 판별기를 가진 ML-GAN이 단일 길이 판별기에 비해 긴 모음에서 글리치와 바람 소리를 줄인다.
- 피치 및 V/UV 입력은 보코더 품질을 크게 향상시키며, 제거 시 CMOS가 −0.28에서 −0.34로 감소하는 등 중요성을 보여준다.
- 적절한 20ms/5ms 멜-스펙트로그램 창과 더 큰 보코더 수용 필드가 고충실도 합창 합성에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.