[논문 리뷰] Efficient Non-Autoregressive GAN Voice Conversion using VQWav2vec Features and Dynamic Convolution
이 논문은 비자기적 GAN 기반 음성 변환 모델인 DYGAN-VC를 제안한다. 이 모델은 효율적인 음성 표현을 위해 VQWav2vec 임베딩을 활용하고, 경량이면서 고성능인 콘텐츠 모델링을 위해 동적 컨볼루션을 사용한다. 700만 파라미터로 SOTA 수준의 성능을 달성하며, 캐스케이드 ASR-TTS 모델의 절반 크기이며, 복원 속도가 최대 8배 빠르며, VCC2020에서 3.86 MOS를 기록했고, CER는 4.3%에 불과하다.
It was shown recently that a combination of ASR and TTS models yield highly competitive performance on standard voice conversion tasks such as the Voice Conversion Challenge 2020 (VCC2020). To obtain good performance both models require pretraining on large amounts of data, thereby obtaining large models that are potentially inefficient in use. In this work we present a model that is significantly smaller and thereby faster in processing while obtaining equivalent performance. To achieve this the proposed model, Dynamic-GAN-VC (DYGAN-VC), uses a non-autoregressive structure and makes use of vector quantised embeddings obtained from a VQWav2vec model. Furthermore dynamic convolution is introduced to improve speech content modeling while requiring a small number of parameters. Objective and subjective evaluation was performed using the VCC2020 task, yielding MOS scores of up to 3.86, and character error rates as low as 4.3\%. This was achieved with approximately half the number of model parameters, and up to 8 times faster decoding speed.
연구 동기 및 목표
- 음성 변환에서 대규모 자기적 ASR-TTS 모델의 비효율성, 즉 높은 메모리 및 계산 자원 소모 문제를 해결하기 위해.
- 음성 품질이나 변환 정확도를 희생시키지 않고 모델 효율성을 향상시키기 위해.
- 자기학습 기반 VQWav2vec 특징과 동적 컨볼루션을 GAN 기반 VC 프레임워크에 통합해 볼 수 있는지 탐색하기 위해.
- 파rameter 수를 줄이고 추론 속도를 높여 다수 대 다수 음성 변환을 가능하게 하기 위해.
제안 방법
- 원시 오디오에서 경량적이고 화자에 관계없는 임베딩을 추출하기 위해 자기학습 기반 음성 표현 모델인 VQWav2vec를 사용한다.
- 빠른 병렬 추론을 가능하게 하기 위해 비자기적 생성망 네트워크를 적용하여 디코딩 시간을 크게 감소시킨다.
- 자기주도 어텐션의 파라미터 효율적인 대안으로서 입력 특징에서 커널 가중치를 생성하는 동적 컨볼루션을 도입한다.
- 스타일 조절을 위해 WadaIN(가중치가 부여된 AdaIN)을 적용하여 효과적인 화자 임베딩 조절을 실현한다.
- 생성된 웨이브폼의 음성 품질과 현실감을 향상시키기 위해 GAN 생성기 분류기를 사용한다.
- 멜스펙트로그램에서 고해상도 웨이브폼을 복원하기 위해 Parallel WaveGAN을 보 vocoder로 활용한다.
실험 결과
연구 질문
- RQ1자기적 ASR-TTS 모델에 비해 훨씬 적은 파라미터와 더 빠른 추론 속도를 확보하면서도 경쟁력 있는 성능을 내는 비자기적 GAN 기반 음성 변환 모델이 가능한가?
- RQ2콘텐츠 및 화자 표현 측면에서 ASR 모델을 대체하기 위해 VQWav2vec 임베딩이 얼마나 효과적인가?
- RQ3표준 또는 자기주도 어텐션 레이어에 비해 음성 변환에서 동적 컨볼루션은 모델링 효율성과 성능 향상에 얼마나 기여하는가?
- RQ4VQWav2vec와 동적 컨볼루션의 조합이 최소한의 파라미터 오 overhead로 고품질의 다수 대 다수 음성 변환을 가능하게 할 수 있는가?
주요 결과
- DYGAN-VC는 VCC2020 벤치마크에서 평균 관점 평가 점수(MOS)를 3.86로 기록하여 SOTA 캐스케이드 ASR-TTS 모델(3.81)과 매우 유사한 성능을 달성했다.
- 모델은 문자 오류율(CER)을 최소 4.3%까지 낮춰 변환 과정에서 강력한 언어적 충실도를 입증했다.
- CPU에서 디코딩 속도가 5.4 RTF에 도달하여 기준 캐스케이드 ASR-TTS 모델(46.1 RTF) 대비 약 8.5배 빠른 속도를 기록했다.
- 생성망에 대해 오직 700만 파라미터만을 사용하여 총 모델 크기를 1억 500만 파라미터의 캐스케이드 ASR-TTS 모델의 약 절반으로 줄였다.
- 제거 실험을 통해 동적 컨볼루션과 WadaIN의 조합이 MCD, CER, WER 지표 전반에서 최고의 성능을 내는 것으로 확인되었다.
- 주관적 평가 결과, DYGAN-VC는 F-M 제외 전반적인 방향에서 기준 모델 대비 화자 유사도에서 뛰어난 성능을 보였으며, 자연스러움 점수는 거의 동일하게 유지되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.