[논문 리뷰] WaveCycleGAN2: Time-domain Neural Post-filter for Speech Waveform Generation
WaveCycleGAN2는 다운샘플링/업샘플링 모듈을 제거하고 파형 및 음향 파rameter 판별자들을 결합함으로써 에이리어징을 제거하는 시간 도메인 신경 후행 필터를 제안한다. 단일 GPU에서 150 kHz 이상의 속도로 오디오를 처리하면서 WaveNet 및 WaveGlow 수준의 자연스러움 점수를 달성한다.
WaveCycleGAN has recently been proposed to bridge the gap between natural and synthesized speech waveforms in statistical parametric speech synthesis and provides fast inference with a moving average model rather than an autoregressive model and high-quality speech synthesis with the adversarial training. However, the human ear can still distinguish the processed speech waveforms from natural ones. One possible cause of this distinguishability is the aliasing observed in the processed speech waveform via down/up-sampling modules. To solve the aliasing and provide higher quality speech synthesis, we propose WaveCycleGAN2, which 1) uses generators without down/up-sampling modules and 2) combines discriminators of the waveform domain and acoustic parameter domain. The results show that the proposed method 1) alleviates the aliasing well, 2) is useful for both speech waveforms generated by analysis-and-synthesis and statistical parametric speech synthesis, and 3) achieves a mean opinion score comparable to those of natural speech and speech synthesized by WaveNet (open WaveNet) and WaveGlow while processing speech samples at a rate of more than 150 kHz on an NVIDIA Tesla P100.
연구 동기 및 목표
- 음성 파형 간의 자연스러움과 합성 파형 간의 지속적인 격차를 해소하기 위해, 특히 복소도파그램 오차와 위상 모호성으로 인한 문제를 해결한다.
- 이전 WaveCycleGAN 모델에서 다운샘플링/업샘플링 모듈로 인한 에이리어징 왜곡을 극복한다.
- 분석-합성 및 통계적 매개변수 기반 음성 합성 파ip라인 모두에서 음성 품질을 향상시킨다.
- 최첨단 순차적 및 플로우 기반 복소도파그램과 동등한 청취 품질을 유지하면서도 초고속 추론(>150 kHz)을 가능하게 한다.
- 쌍체 학습 데이터가 필요 없이 사이클 일관성 있는 적대적 학습을 시간 도메인에서 활용하여 고해상도 음성 변환을 달성한다.
제안 방법
- 다운샘플링 또는 업샘플링 계층이 전혀 없는 완전 컨볼루션 생성자 아키텍처를 제안하여 에이리어징 잔여물 없애기.
- 이중 판별자 설정을 도입: 하나는 원시 파형에서 작동하고, 다른 하나는 음향 매개변수(Mel-spectrogram, Mel-cepstrum, 위상 스펙트럼)에서 작동.
- 쌍체 학습 기반 적대적 학습을 통해 쌍체가 없는 훈련 데이터로도 합성된 파형에서 자연스러운 파형으로의 매핑을 학습.
- 파형 도메인 판별자를 활용해 세밀한 시간적 세부 정보를 유지하고, 음향 매개변수 판별자를 활용해 스펙트럼 특성의 일치를 도모.
- 모델을 쌍체(V2msp paired) 및 비쌍체(V2msp unpaired) 설정 모두에서 훈련하여 다양한 입력 조건에서의 일반화 능력을 향상.
- 사이클 일관성 학습의 위상 모호성에 대한 불변성을 활용하여, 훈련 중 침묵 또는 손상된 출력을 방지.
실험 결과
연구 질문
- RQ1생성자 아키텍처에서 다운/업샘플링 모듈을 제거하면 후행 필터링된 음성 파형에서의 에이리어징이 크게 감소하는가?
- RQ2파형 도메인과 음향 매개변수 도메인의 판별자를 결합하면 청취 품질과 일반화 능력이 향상되는가?
- RQ3제안된 방법은 고속 추론을 유지하면서도 WaveNet 및 WaveGlow 수준의 자연스러움 점수를 달성하는가?
- RQ4분석-합성 및 통계적 매개변수 기반 합성 파이프라인 모두에서 모델 성능은 어떠한가?
- RQ5쌍체 데이터가 없는 비쌍체 훈련 설정이 음성 품질과 내구성 측면에서 쌍체 설정과 유사한 성능을 내는가?
주요 결과
- WaveCycleGAN2는 생성자 아키텍처에서 다운/업샘플링 모듈을 제거함으로써 에이리어징 잔여물이 크게 감소한다.
- LJSpeech 데이터셋에서 쌍체 설정에서 평균 평가 점수(MOS)는 4.023 ± 0.124를 기록하여 오픈 소스 WaveNet(3.657 ± 0.162)과 WaveGlow(3.443 ± 0.164)를 모두 초월한다.
- LJSpeech 데이터셋에서 V2msp(paired)는 로그 스펙트럼 왜곡(LSD) 4.318 dB를 기록하여 WaveGlow(4.540 dB)와 오픈 소스 WaveNet(4.971 dB)를 모두 앞선다.
- 비쌍체 훈련 버전(V2msp unpaired)은 MOS 3.833 ± 0.127을 기록하여 병렬 데이터 없이도 뛰어난 일반화 능력을 입증한다.
- 모델는 NVIDIA Tesla P100에서 150 kHz 이상의 속도로 오디오를 처리하여 실시간 추론이 가능하며, 배포에 적합하다.
- 주관적 평가 결과, WaveCycleGAN2는 WaveGlow에서 흔히 볼 수 있는 전에코(예: pre-echoes)와 오픈 소스 WaveNet에서의 파라미터 붕괴 현상(예: collapse)을 감소시키지만, WORLD 복소도파그램의 음성 감지 오류로 일부 잔여 오차는 존재한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.