Skip to main content
QUICK REVIEW

[논문 리뷰] TFGAN: Time and Frequency Domain Based Generative Adversarial Network for High-fidelity Speech Synthesis

Qiao Tian, Yi Chen|arXiv (Cornell University)|2020. 11. 24.
Speech Recognition and Synthesis참고 문헌 20인용 수 22
한 줄 요약

TFGAN은 고해상도 음성 합성용 시간 도메인 및 주파수 도메인 적대적 생성 모델을 제안하며, MelGAN을 개선하기 위해 ResNet18 기반 주파수 도메인 판별기와 다중 시간 도메인 웨이브폼 손실을 도입하여 금속성 잔상과 위상 일致성 향상을 도모한다. 이 모델는 MelGAN 수준의 인fer 속도를 유지하면서도 WaveRNN 수준의 품질을 달성하며, MOS 4.35 ± 0.04를 기록하여 MelGAN을 초월하고 WaveRNN에 근접한 성능을 보였다.

ABSTRACT

Recently, GAN based speech synthesis methods, such as MelGAN, have become very popular. Compared to conventional autoregressive based methods, parallel structures based generators make waveform generation process fast and stable. However, the quality of generated speech by autoregressive based neural vocoders, such as WaveRNN, is still higher than GAN. To address this issue, we propose a novel vocoder model: TFGAN, which is adversarially learned both in time and frequency domain. On one hand, we propose to discriminate ground-truth waveform from synthetic one in frequency domain for offering more consistency guarantees instead of only in time domain. On the other hand, in contrast to the conventionally frequency-domain STFT loss approach or feature map loss by discriminator to learn waveform, we propose a set of time-domain loss that encourage the generator to capture the waveform directly. TFGAN has nearly same synthesis speed as MelGAN, but the fidelity is significantly improved by our novel learning method. In our experiments, TFGAN shows the ability to achieve comparable mean opinion score (MOS) than autoregressive vocoder under speech synthesis context.

연구 동기 및 목표

  • MelGAN과 같은 비자기적 GAN 기반 보이스코더에서 지속적인 금속성 및 위상 관련 잔상 문제를 해결하기 위해.
  • 시간 도메인과 주파수 도메인 양측에서 적대적 학습을 가능하게 하여 음성 품질을 향상시키고 청취 품질을 개선하기 위해.
  • STFT 손실에만 의존하는 것을 줄이기 위해 직접적인 시간 도메인 웨이브폼 손실을 도입하여 생성기의 감독을 향상시키기 위해.
  • MelGAN 수준의 빠른 인fer 속도를 유지하면서도 WaveRNN과 같은 자기적 모델 수준의 품질을 달성하기 위해.
  • 위상 및 스펙트럼 일치성을 더 잘 포착할 수 있는 보다 강력한 판별기 아키텍처를 설계하기 위해.

제안 방법

  • STFT 크기 및 위상 도메인에서 실제 음성과 생성 음성을 평가하는 ResNet18 기반 주파수 도메인 판별기를 도입하여 위상 일치성을 향상시킨다.
  • 원시 음성 신호에 직접적으로 감독하는 다중 시간 도메인 웨이브폼 손실(L1, L2 등)을 제안하여 STFT 기반 손실에 대한 과도한 의존도를 감소시킨다.
  • 순환 컨볼루션 업샘플링 레이어를 수정하여 이웃 최소 거리 보간법을 통합함으로써, 음성의 공명 영역에서 주기적 잔상을 억제한다.
  • Multi-band MelGAN과 유사한 다중 척도 시간 도메인 판별기를 도입하여, 다양한 척도에서 스트라이드 컨볼루션을 적용해 국소적 및 전반적 음성 구조를 포착한다.
  • 적대적 손실, 피처 매칭, 다중 해상도 STFT 손실을 조합하여 학습 안정성과 스펙트럼 정밀도를 향상시킨다.
  • 시간 도메인과 주파수 도메인의 이중 판별기 구조를 도입하며, 생성기와 함께 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1시간 도메인과 주파수 도메인 양측에서의 적대적 학습이 비자기적 음성 보이스코더의 청취 품질을 크게 향상시킬 수 있는가?
  • RQ2직접적인 시간 도메인 웨이브폼 손실을 도입할 경우, STFT 손실에만 의존하는 것보다 금속성 잔상 감소와 위상 일치성 향상이 이루어지는가?
  • RQ3ResNet18 기반 주파수 도메인 판별기가 시간 도메인 전용 판별기보다 스펙트럼 및 위상 특성을 더 잘 포착할 수 있는가?
  • RQ4수정된 업샘플링 메커니즘이 특히 공명 영역에서 주기적 잔상을 얼마나 효과적으로 감소시킬 수 있는가?
  • RQ5GAN 기반 보이스코더가 MelGAN 수준의 인fer 속도를 유지하면서도 WaveRNN과 유사한 MOS를 달성할 수 있는가?

주요 결과

  • TFGAN은 평균 의견 점수(MOS) 4.35 ± 0.04를 기록하여 MelGAN(3.95 ± 0.05)을 초월하고, 자기적 Multi-band WaveRNN(4.34 ± 0.04) 수준의 품질을 달성했다.
  • 제거 실험 결과, 시간 도메인 손실과 개선된 업샘플링의 조합으로 PESQ가 2.77(기준)에서 3.24로 향상되었으며, WaveRNN의 3.02를 초월했다.
  • 주파수 도메인 판별기는 위상 일치성 향상에 기여하여 금속성 및 인위적인 청취 잔상 감소에 기여했다.
  • 수정된 업샘플링 메커니즘은 객관적 지표를 통해 숨결과 공명 영역에서 주기적 잔상을 효과적으로 감소시켰다.
  • TFGAN는 MelGAN과 동일한 인fer 속도를 유지하여 단일 GPU에서 실시간 요인(RTF) 약 0.01을 달성했다.
  • 모델은 STOI 0.95와 PESQ 3.24를 기록하여 MelGAN 및 WaveRNN 모두를 초월하는 객관적 지표 성능을 보였으며, PESQ는 WaveRNN을 0.22점 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.