[논문 리뷰] Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech
이 논문은 수신장역할을 확장하고, 특징 매칭 손실을 다중해상도 STFT 손실로 대체하며, 다중대역 웨이브포맷 생성을 도입하여 더 빠르고 고품질의 신경 음성합성기(Multi-band MelGAN, MB-MelGAN)를 제안한다. 모델은 음성합성에서 4.34의 MOS를 기록하고 TTS에서 4.22의 MOS를 기록하며, 파rameter 수가 1.91M이고 GFLOPS가 0.95로 매우 낮아 CPU에서 실시간 요인(RTF)이 0.03에 불과하여 원래 MelGAN 대비 7배 빠르며 고음질을 유지한다.
In this paper, we propose multi-band MelGAN, a much faster waveform generation model targeting to high-quality text-to-speech. Specifically, we improve the original MelGAN by the following aspects. First, we increase the receptive field of the generator, which is proven to be beneficial to speech generation. Second, we substitute the feature matching loss with the multi-resolution STFT loss to better measure the difference between fake and real speech. Together with pre-training, this improvement leads to both better quality and better training stability. More importantly, we extend MelGAN with multi-band processing: the generator takes mel-spectrograms as input and produces sub-band signals which are subsequently summed back to full-band signals as discriminator input. The proposed multi-band MelGAN has achieved high MOS of 4.34 and 4.22 in waveform generation and TTS, respectively. With only 1.91M parameters, our model effectively reduces the total computational complexity of the original MelGAN from 5.85 to 0.95 GFLOPS. Our Pytorch implementation, which will be open-resourced shortly, can achieve a real-time factor of 0.03 on CPU without hardware specific optimization.
연구 동기 및 목표
- 고음질 음성합성을 위한 MelGAN의 품질과 학습 안정성을 향상시키기 위해.
- 음질을 손상시키지 않고 계산 복잡도를 줄이고 추론 속도를 가속화하기 위해.
- 기존 MelGAN에서 발생하는 진동과 금속성 소리와 같은 청취 가능한 잡음 문제를 해결하기 위해.
- 실제 TTS 구현을 위한 자원이 제한된 환경에서 효율적이고 실시간으로 추론할 수 있도록 하기 위해.
- 다중대역 처리의 효과를 검증하여 모델 복잡도를 줄이면서도 청취 품질을 유지할 수 있는지 확인하기 위해.
제안 방법
- 장기적인 음성 의존성 모델링을 향상시키기 위해 MelGAN 생성기의 수신장역할을 확장한다.
- 실제 음성과 생성된 음성 간의 스펙트럼적·시간적 차이를 더 잘 포착하기 위해 원래의 특징 매칭 손실을 다중해상도 STFT 손실로 대체한다.
- 생성기가 하위대역 웨이브포맷을 예측하고 이를 합쳐 전체대역 출력을 만드는 다중대역 처리 프레임워크를 도입한다.
- 하위대역 및 전체대역 웨이브포맷 모두에 다중해상도 STFT 손실을 적용하여 청취 품질과 학습 안정성을 향상시킨다.
- 대부분의 학습 수렴과 음질 향상을 위해 사전학습을 적용한다.
- 모든 하위대역에 공통된 단일 생성기 네트워크를 사용하여 파rameter 수와 계산 비용을 감소시킨다.
실험 결과
연구 질문
- RQ1MelGAN의 수신장역할을 확장함으로써 음성 품질과 학습 안정성이 크게 향상될 수 있는가?
- RQ2특징 매칭 손실을 다중해상도 STFT 손실로 대체하면 청취 품질이 향상되고 수렴 속도가 빨라지는가?
- RQ3다중대역 처리 방식은 고음질 음성합성을 유지하면서 계산 복잡도를 줄일 수 있는가?
- RQ4하위대역과 전체대역의 다중해상도 STFT 손실을 병합하면 음성 품질과 학습 역학에 어떤 영향을 미치는가?
- RQ5MB-MelGAN은 최소한의 파rameter와 낮은 실시간 요인을 통해 실시간 TTS 응용에서 높은 MOS를 달성할 수 있는가?
주요 결과
- MB-MelGAN은 음성합성에서 평균의견점수(MOS)가 4.34를 기록하여 원래 MelGAN의 3.98보다 뚜렷한 향상이 이루어졌다.
- 텍스트-to-음성 작업에서 MB-MelGAN은 MOS 4.22를 기록하여 원래 MelGAN(3.87)과 FB-MelGAN(4.18)을 모두 초월했다.
- 계산 복잡도는 원래 MelGAN의 5.85 GFLOPS에서 0.95 GFLOPS로 감소하여 CPU에서 실시간 요인이 0.03이 되었다.
- 다중대역 설계 덕분에 전체대역 모델 대비 학습 시간이 약 50% 감소했으며, 음성 품질은 유지되거나 향상되었다.
- 하위대역과 전체대역의 다중해상도 STFT 손실을 병합함으로써 음성 품질과 학습 안정성이 향상되어 수렴 속도가 빨라졌다.
- 다만 191만 개의 파rameter만으로도 고품질 음성합성을 달성하여 자원이 제한된 장치에 배포하기에 매우 효율적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.