Skip to main content
QUICK REVIEW

[논문 리뷰] GAN Vocoder: Multi-Resolution Discriminator Is All You Need

Jaeseong You, Dal-Hyun Kim|arXiv (Cornell University)|2021. 03. 09.
Speech Recognition and Synthesis참고 문헌 23인용 수 5
한 줄 요약

이 논문은 GAN 보이서의 다중 해상도 디스crimิน레이터가 그들의 높은 성능을 이끌고 있는 주요 요인임을 입증한다. 이는 아키텍처적 세부 사항이나 손실 함수가 아니라 다중 해상도 디스crimิน레이터의 존재 덕분이다. 여섯 가지 다양한 생성기와 하나의 HiFi-GAN 기반 다중 해상도 디스crimิน레이터를 조합하여 실험한 결과, MOS 또는 MCD 점수에 통계적으로 유의미한 차이가 없음을 확인했으며, 이는 디스crimิน레이터 프레임워크가 다양한 생성기 설계에서 고음질 음성 합성의 핵심 요소임을 증명한다.

ABSTRACT

Several of the latest GAN-based vocoders show remarkable achievements, outperforming autoregressive and flow-based competitors in both qualitative and quantitative measures while synthesizing orders of magnitude faster. In this work, we hypothesize that the common factor underlying their success is the multi-resolution discriminating framework, not the minute details in architecture, loss function, or training strategy. We experimentally test the hypothesis by evaluating six different generators paired with one shared multi-resolution discriminating framework. For all evaluative measures with respect to text-to-speech syntheses and for all perceptual metrics, their performances are not distinguishable from one another, which supports our hypothesis.

연구 동기 및 목표

  • 최근 GAN 보이서의 성공이 아키텍처적 혁신에서 비롯되는지, 아니면 공통된 기반 메커니즘에서 비롯되는지 조사하기.
  • 다중 해상도 디스crimิน레이터 프레임워크가 고성능 음성 합성 구현의 주요 요인임을 가설 검증하기.
  • 통일된 강력한 디스crimิน레이터와 조합될 경우 다양한 생성기 아키텍처가 동일한 성능을 내는지 평가하기.
  • 다양한 유형의 입력 표현(예: 원시 파형, 스펙트로그램, 중간 특징)에 대해 다중 해상도 디스crimิน레이터가 일반화되는지 평가하기.
  • 생성기 용량을 증가시키는 것이 MelGAN 수준의 모델이 달성한 성능을 넘어선 성능 향상에 기여하는지 평가하기.

제안 방법

  • 연구는 여섯 가지 다른 GAN 보이서 생성기 전부에 동일한 HiFi-GAN 기반 다중 해상도 디스crimิน레이터를 고정된 공통 구성요소로 사용한다.
  • 각 생성기는 동일한 디스crimิน레이터를 사용하여 훈련 및 평가되며, 성능 차이가 생성기 설계에서 비롯되며 디스crimิน레이터의 변동이 원인이 되지 않도록 보장한다.
  • 평가에는 지정된 참조(ground-truth, GT) 재구성 및 텍스트-음성(TTS) 합성 작업이 포함되며, MOS 및 MCD 지표를 사용한다.
  • 다중 해상도 디스crimิน레이터는 생성된 파형을 여러 척도에서 평가하여 국소적 및 전반적인 음성 특징을 모두 포착한다.
  • 실험에는 MRF 기반(HeFi-GAN), 축 방향 잔차 블록(제안 모델), GAU 블록(UMGAN) 등 다양한 아키텍처를 가진 생성기와 함께, 다른 업샘플링 전략 및 조건부 메커니즘을 사용한 모델들이 포함된다.
  • 음성 샘플은 공개되어 있어 정성 평가를 지원하고, MOS 테스트 과정을 보다 신뢰할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다중 해상도 디스crimิน레이터 프레임워크가 생성기 아키텍처와 무관하게 최근 GAN 보이서의 뛰어난 성능을 이끌고 있는가?
  • RQ2경량에서 대규모에 이르기까지 다양한 생성기들이 동일한 다중 해상도 디스crimิน레이터와 조합될 경우 유사한 성능을 내는가?
  • RQ3다양한 유형의 타겟 표현(예: 원시 파형, 스펙트로그램, 중간 특징)에 대해 다중 해상도 디스crimิน레이터가 효과적인가?
  • RQ4생성기 용량을 증가시키는 것이 MelGAN 또는 유사 모델이 달성한 수준을 넘어선 성능 향상에 어느 정도 영향을 미치는가?
  • RQ5어텐션 모듈이나 복잡한 잔차 블록 등의 아키텍처 혁신이 고음질 보이서 제작에 필수적인가, 아니면 디스crimิน레이터가 결정적 요소인가?

주요 결과

  • 여섯 개의 GAN 보이서는 생성기 아키텍처에 상당한 차이가 있음에도 불구하고, GT 및 TTS 합성 작업 모두에서 MOS 및 MCD 지표에서 통계적으로 구분되지 않는 성능을 보였다.
  • 원래의 HiFi-GAN 생성기가 동일한 디스crimิน레이터와 조합되었을 때 경량 또는 경량 모델보다 뛰어난 성능을 내지 못했으며, 이는 아키텍처 자체가 유리한 요소가 되지 못한다는 것을 시사한다.
  • HiFi-GAN, PWGAN, 제안 모델 등의 경량 생성기들이 VocGAN 및 UMGAN 등의 대규모 모델과 동일한 성능을 내었으며, 이는 용량 증가가 성능 향상에 크게 기여하지 않는다는 것을 시사한다.
  • MelGAN 생성기는 이전에 간단한 설계를 가졌음에도 불구하고 동일한 디스crimิน레이터와 조합되었을 때 현대적이고 복잡한 아키텍처와 동일한 성능을 보였다.
  • 다중 해상도 디스crimิน레이터 프레임워크는 원시 파형, 스펙트로그램, 중간 특징 등 다양한 타겟 표현에 대해 효과적으로 일반화되었으며, 이는 그 강건성과 유연성을 확인한다.
  • 결과적으로, GAN 보이서의 핵심 과제는 디스crimิน레이터 프레임워크에 의해 해결되었으며, 향후 성능 향상은 생성기 아키텍처나 손실 함수의 혁신을 넘어선 접근이 필요할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.