[논문 리뷰] WaveCycleGAN: Synthetic-to-natural speech waveform conversion using cycle-consistent adversarial networks
이 논문은 음성 특성 또는 보코더에 의존하지 않고 합성 음성 웨이브포맷을 자연스러운 음성으로 직접 변환하는 순환 일致성 있는 적대적 네트워크인 WaveCycleGAN을 제안한다. 완전 컨volutional 게이팅 CNN 아키텍처를 사용해 웨이브포맷 수준에서 작동함으로써 과도하게 매끄럽게 만드는 현상과 보코딩 아티팩트를 효과적으로 줄여 주어 주관적 평가에서 음성 자연성에 크게 기여한다.
We propose a learning-based filter that allows us to directly modify a synthetic speech waveform into a natural speech waveform. Speech-processing systems using a vocoder framework such as statistical parametric speech synthesis and voice conversion are convenient especially for a limited number of data because it is possible to represent and process interpretable acoustic features over a compact space, such as the fundamental frequency (F0) and mel-cepstrum. However, a well-known problem that leads to the quality degradation of generated speech is an over-smoothing effect that eliminates some detailed structure of generated/converted acoustic features. To address this issue, we propose a synthetic-to-natural speech waveform conversion technique that uses cycle-consistent adversarial networks and which does not require any explicit assumption about speech waveform in adversarial learning. In contrast to current techniques, since our modification is performed at the waveform level, we expect that the proposed method will also make it possible to generate `vocoder-less' sounding speech even if the input speech is synthesized using a vocoder framework. The experimental results demonstrate that our proposed method can 1) alleviate the over-smoothing effect of the acoustic features despite the direct modification method used for the waveform and 2) greatly improve the naturalness of the generated speech sounds.
연구 동기 및 목표
- 음성 자연성에 악영향을 주는 통계적 매개변수 기반 음성 합성에서의 과도하게 매끄럽게 만드는 현상과 보코딩 오류를 해결하기 위해.
- 음성 특성 대신 웨이브포맷에 직접 작용하는 보코더가 없는 후처리 방법을 개발하기 위해.
- 합성 및 자연 음성 웨이브포맷 간의 프레임 수준 정렬이 필요 없이 적대적 훈련을 활용해 음성 품질을 향상시키기 위해.
- 세부적인 스펙트럼 및 타임스탬프 구조를 유지하는 학습 기반 필터를 사용해 합성 음성을 종단 간 향상시키기 위해.
제안 방법
- 이 방법은 합성 및 자연 음성 웨이브포맷 간의 매핑을 프레임 수준의 쌍화된 훈련 데이터가 없이도 학습하기 위해 순환 일치하는 적대적 네트워크(CycleGAN)를 사용한다.
- 모든 입력 길이를 처리할 수 있도록 인스턴스 정규화와 픽셀 셔플러 레이어를 갖춘 완전 컨볼루션 게이팅 CNN 아키텍처를 생성자 및 판별자 네트워크 모두에 사용한다.
- 모델은 최소 제곱 GAN 손실과 하이퍼파라미터 λ_cyc = 10을 사용해 순환 일관성을 강제하는 순환 일관성 손실을 사용해 훈련된다.
- 초기 20,000 반복 동안 정체성 손실(λ_id)이 적용되며 선형적으로 0으로 감쇠되어 훈련 안정성 향상과 입력 특성 유지에 기여한다.
- 생성자는 잔차 블록을 사용하고 청각적 손실 및 적대적 손실 최소화를 통해 자연 음성 웨이브포맷을 재구성하도록 학습한다.
- 웨이브포맷 입력은 훈련 세트의 통계를 사용해 평균 0, 분산 1로 정규화되어 훈련 안정성 향상에 기여한다.
실험 결과
연구 질문
- RQ1음성 특성이나 보코더에 의존하지 않고 학습 기반 필터가 합성 음성 웨이브포맷의 자연성을 향상시킬 수 있는가?
- RQ2순환 일치하는 적대적 네트워크가 통계적 매개변수 기반 음성 합성으로 생성된 음성 웨이브포맷에서의 과도하게 매끄럽게 만드는 현상을 어느 정도 줄일 수 있는가?
- RQ3직접 웨이브포맷 수준에서 수정하는 것이 음성 품질 향상에서 특성 수준의 후처리보다 우월한가?
- RQ4제안된 방법이 동시에 과도하게 매끄럽게 만드는 현상과 보코딩 아티팩트를 완화할 수 있는가?
주요 결과
- 제안된 WaveCycleGAN 방법은 주관적 평균의견점수(MOS) 테스트에서 음성 자연성을 크게 향상시켜 MOS 3.87을 기록했으며, 이는 기준 모델(3.21)과 GANv(3.52)보다 상당히 높은 성능을 보였다.
- 조절 스펙트럼 분석 결과, 제안된 방법은 자연 음성과 유사하게 고주파 성분을 잘 유지했으며, 기준 모델은 강한 과도하게 매끄럽게 만드는 현상이 두드러졌다.
- 청취자들은 제안된 방법에서 보코더 음성에서 흔히 듣는 '지저귐' 소리가 크게 감소한 것으로 보고하여 보코딩 아티팩트가 효과적으로 완화되었음을 시사했다.
- 개선에도 불구하고 일부 발화에서 '갈라지는' 톤이 남아 있어 자연 음성과의 잔여 청각적 격차가 여전히 존재함을 시사했다.
- 조절 스펙트럼 비교를 통해 제안된 방법이 멜-세프트럴 계수에서의 과도하게 매끄럽게 만드는 현상을 효과적으로 완화했음을 입증했다.
- 완전 컨볼루션 아키텍처는 임의의 길이의 음성 입력에 대한 추론을 가능하게 하여 강건성과 확장성의 우수함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.