[논문 리뷰] HooliGAN: Robust, High Quality Neural Vocoding
HooliGAN은 다양한 신호 처리(DSP) 기반 기법과 신경 소스-필터( NSF) 기법을 적대적 학습과 융합하여 자연스러운 음성 합성 성능을 달성하는 강력하고 고품질의 신경 보이스 모델이다. 이는 빠른 추론(GPU 기준 2.2MHz), 소규모 데이터셋(<30분)에서도 뛰어난 일반화 능력, 청취 테스트에서 뛰어난 청각적 품질을 보이며 최신 기술 수준의 성능을 달성한다.
Recent developments in generative models have shown that deep learning combined with traditional digital signal processing (DSP) techniques could successfully generate convincing violin samples [1], that source-excitation combined with WaveNet yields high-quality vocoders [2, 3] and that generative adversarial network (GAN) training can improve naturalness [4, 5]. By combining the ideas in these models we introduce HooliGAN, a robust vocoder that has state of the art results, finetunes very well to smaller datasets (<30 minutes of speechdata) and generates audio at 2.2MHz on GPU and 35kHz on CPU. We also show a simple modification to Tacotron-basedmodels that allows seamless integration with HooliGAN. Results from our listening tests show the proposed model's ability to consistently output high-quality audio with a variety of datasets, big and small. We provide samples at the following demo page: https://resemble-ai.github.io/hooligan_demo/
연구 동기 및 목표
- 고품질의 청각적 성능을 유지하면서도 빠른 추론 속도를 확보하는 신경 보이스 모델을 개발하는 것.
- 소규모 음성 데이터셋(<30분)에서의 강건성과 일반화 능력을 향상시키는 것.
- Tacotron 기반 텍스트-음성 변환 시스템과 원활하게 통합되는 것.
- 소스--excitations 모델링을 활용하여 위상 모호성과 웨이브폼 이산화로 인한 잡음 문제를 줄이는 것.
- DDSP(DSP 기반 신호 모델링)와 NSF(신경 필터링)의 장점을 융합하여 음성 품질을 향상시키는 것.
제안 방법
- 입력으로 로그 멜 스펙트로그램, F0 피치, 비음성/음성(UV) 시퀀스를 사용하며, 이는 음성 특징에서 추출된다.
- 두 개의 1D 컨볼루션 레이어와 완전 연결 레이어를 갖춘 인코더가 입력을 처리하여 오실레이터 및 노이즈 제어 파라미터를 생성한다.
- 선형 보간을 통해 프레임 단위 파라미터를 샘플 단위로 업샘플링하여 조화 성분을 생성하는 덧셈형 오실레이터를 사용한다.
- NSF를 영감으로 삼은 신경 필터 블록이 확장된 인과적 컨볼루션을 사용하여 흥분 신호를 처리하고 스펙트럼 은폐 동적 특성을 모델링한다.
- 디스크리미네이터는 MelGAN에서처럼 큰 커널과 스트라이드 컨볼루션을 사용하여 위상에 민감하지 않은 학습을 가능하게 하고 청각적 품질을 향상시킨다.
- GAN 목적함수를 활용한 적대적 학습이 자연스러운 음성 품질을 향상시키고 자동회귀 모델에서 흔히 발생하는 잡음을 줄인다.
실험 결과
연구 질문
- RQ1DDSP 스타일의 소스-흥분과 NSF 스타일의 신경 필터링을 융합한 하이브리드 접근 방식이 종래의 엔드 투 엔드 웨이브폼 모델보다 더 높은 음성 품질을 낼 수 있는가?
- RQ2제안된 모델이 매우 소규모 음성 데이터셋(<30분)에서 어떻게 성능을 발휘하는가?
- RQ3고품질의 청각적 성능을 유지하면서도 높은 추론 속도를 달성할 수 있는가?
- RQ4F0와 UV 상태를 명시적으로 모델링함으로써 멜 스펙트로그램에서 조밀한 조화 성분을 보이는 남성 음성의 경우 강건성이 향상되는가?
- RQ5모델이 Tacotron 기반 텍스트-음성 변환 파이프라인과 원활하게 통합될 수 있는가?
주요 결과
- 청취 테스트에서 HooliGAN은 LJSpeech 전체 테스트 데이터에서 평균 관점 평가 점수(MOS) 4.07을 기록하여 WaveRNN, MelGAN, WaveGlow를 모두 초월했다.
- 소규모 데이터셋에서 뛰어난 강건성을 보였으며, 특히 남성 음성에서 30분의 데이터로도 미세조정을 거친 후 성능 향상이 두드러졌다.
- HooliGAN은 GPU 기준 2.2MHz, CPU 기준 35kHz의 빠른 추론 속도를 기록했으며, 높은 품질을 유지하면서도 WaveRNN과 WaveGlow를 뛰어넘는 성능을 보였다.
- WaveRNN과 WaveGlow는 직접 웨이브폼 학습으로 인해 위상 관련 왜곡에 취약한 반면, HooliGAN의 출력은 더 적은 '흩어진' 잡음 왜곡을 보였다.
- HooliGAN의 MOS는 텍스트-음성 합성에서 실제 음성에 근접하여 Tacotron2와의 뛰어난 호환성과 높은 청각 정밀도를 보였다.
- 명시적인 소스-흥진과 DSP 구성 요소를 갖춘 모델 아키텍처는 복잡도를 감소시키고, 특히 데이터가 적은 환경에서의 일반화 능력을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.