Skip to main content
QUICK REVIEW

[논문 리뷰] Fre-GAN: Adversarial Frequency-consistent Audio Synthesis

Ji-Hoon Kim, Sanghoon Lee|arXiv (Cornell University)|2021. 06. 04.
Music and Audio Processing참고 문헌 32인용 수 7
한 줄 요약

Fre-GAN은 이산 웨이블릿 변환(DWT)을 사용한 손실 없는 다운샘플링과 해상도 간 연결된 생성자 및 해상도별 판별자로 주파수 일관성을 유지하는 신경음성기(네ural vocoder)를 제안한다. 이로 인해 인간 수준에 가까운 음질을 달성하며, 참조 음성과의 MOS 차이가 0.03에 불과하여 기존 GAN 기반 음성기보다 품질과 스펙트럼 일관성에서 뛰어난 성능을 발휘한다.

ABSTRACT

Although recent works on neural vocoder have improved the quality of synthesized audio, there still exists a gap between generated and ground-truth audio in frequency space. This difference leads to spectral artifacts such as hissing noise or reverberation, and thus degrades the sample quality. In this paper, we propose Fre-GAN which achieves frequency-consistent audio synthesis with highly improved generation quality. Specifically, we first present resolution-connected generator and resolution-wise discriminators, which help learn various scales of spectral distributions over multiple frequency bands. Additionally, to reproduce high-frequency components accurately, we leverage discrete wavelet transform in the discriminators. From our experiments, Fre-GAN achieves high-fidelity waveform generation with a gap of only 0.03 MOS compared to ground-truth audio while outperforming standard models in quality.

연구 동기 및 목표

  • 생성된 음성과 참조 음성 간 주파수 영역의 일관성 부족으로 인한 흐느적거림 및 반향 등의 스펙트럼 잡음 문제를 해결한다.
  • 파형 생성 과정에서 여러 주파수 대역 간 일관된 스펙트럼 분포를 확보하여 음성 품질을 향상시킨다.
  • 점진적 학습과 해상도별 판별자를 통해 생성자 간의 대비 학습을 안정화시킨다.
  • 평균 풀링을 대체하여 이산 웨이블릿 변환(DWT)을 사용해 다운샘플링 시 고주파 성분을 유지한다.
  • 주관적 및 객관적 지표에서 최고 수준의 성능을 입증한다. 지표로는 MOS, MCD, FDSD를 포함한다.

제안 방법

  • 근접 이웃 보간과 스킵 연결을 사용해 다중 해상도 레이어에서 생성된 파형을 업샘플링하고 합산하는 해상도 간 연결된 생성자(RCG)를 활용한다.
  • 다양한 스케일에서 생성된 파형을 평가하는 해상도별 판별자(RPD 및 RSD)를 사용하며, 각 판별자는 DWT를 통해 다운샘플된 음성을 입력받아 다중 스케일의 스펙트럼 일관성을 확보한다.
  • 이산 웨이블릿 변환(DWT)을 판별기의 다운샘플링 방법으로 통합하여, 이중직교성과 에너지 보존 성질 덕분에 고주파 성분을 유지한다.
  • 각 해상도 레이어에서 입력 멜-스펙트로그램을 조건으로 설정하여 다중 스케일 간 주파수 일관성을 보장한다.
  • RCG에 대해 점진적 학습을 적용하여 저해상도 출력부터 시작해 점차 고해상도 구성 요소를 추가함으로써 학습 안정성을 향상시킨다.
  • 판별기 내부에 다중 주기 판별자(MPD)와 다중 스케일 판별자(MSD)를 통합하여 주기적 패턴과 장기적 의존성을 포착한다.

실험 결과

연구 질문

  • RQ1다운샘플링 과정에서 고주파 성분을 유지하기 위해 DWT를 사용함으로써 GAN 기반 음성기에서 주파수 일관성 있는 음성 합성을 달성할 수 있는가?
  • RQ2평균 풀링을 이산 웨이블릿 변환(DWT)으로 대체할 경우 신경 음성 생성에서 스펙트럼 정밀도와 청취 품질에 어떤 영향을 미치는가?
  • RQ3해상도 간 연결된 생성자(RCG)가 다중 스케일 스펙트럼 학습과 학습 안정성에 얼마나 기여하는가?
  • RQ4각 아키텍처 구성 요소—RCG, DWT, MPD/MSD, 멜-스펙트로그램 조건화—가 종합적인 음성 품질에 기여하는 정도는 어떠한가?
  • RQ5제안된 방법이 참조 음성과의 비교에서 MOS 측정치로 거의 완벽한 청취 품질을 달성할 수 있는가?

주요 결과

  • Fre-GAN은 주관적 MOS 4.25 ± 0.04를 기록하며, 참조 음성(4.39 ± 0.03)과의 격차가 0.03에 불과하여 거의 인간 수준의 청취 품질을 확보한다.
  • MOS 4.08 ± 0.05와 MCD 13이 1.383, FDSD가 0.209인 HiFi-GAN V2 및 WaveNet보다 MOS와 객관적 지표 모두에서 뛰어난 성능을 보였다.
  • DWT를 평균 풀링(AP)으로 대체하면 MOS가 4.12 ± 0.05로 급격히 하락하고 MCD 13이 1.592로 증가하여 DWT가 고주파 성분 유지에 핵심적인 역할을 함을 확인한다.
  • 제거 실험 결과 RCG 아키텍처를 제거할 경우 MCD 13가 1.602로 가장 악화되어 다중 스케일 스펙트럼 학습에서 RCG의 중요성을 입증한다.
  • RCG를 통한 점진적 학습은 안정적인 학습을 가능하게 하며, 시간이 지남에 따라 저해상도에서 고해상도로 주의가 이동하고, DWT는 고주파 성분이 유지됨을 보장한다.
  • 멜-스펙트로그램 차이의 시각적 분석(Fig. 3)은 Fre-GAN이 참조 음성과 비교해 주파수 일관성이 뛰어나며 픽셀 단위 오차가 최소화된 음성을 생성함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.