[논문 리뷰] QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion
QuickVC는 HuBERT-Soft를 활용해 발화자 독립적인 콘텐츠 특징을 추출하고, VITS의 계산 비용이 높은 보코더를 대체하기 위해 iSTFT 기반 디코더를 사용하는 경량이며 종단 간 음성 변환 모델을 제안한다. 이로 인해 RTX 3090 GPU에서 5000 KHz 이상, i9-10900K CPU에서 280 KHz 이상의 추론 속도를 달성하면서도 높은 음성 자연스러움(N-MOS: 4.28)과 유사성(S-MOS: 3.58)을 유지한다.
With the development of automatic speech recognition (ASR) and text-to-speech (TTS) technology, high-quality voice conversion (VC) can be achieved by extracting source content information and target speaker information to reconstruct waveforms. However, current methods still require improvement in terms of inference speed. In this study, we propose a lightweight VITS-based VC model that uses the HuBERT-Soft model to extract content information features without speaker information. Through subjective and objective experiments on synthesized speech, the proposed model demonstrates competitive results in terms of naturalness and similarity. Importantly, unlike the original VITS model, we use the inverse short-time Fourier transform (iSTFT) to replace the most computationally expensive part. Experimental results show that our model can generate samples at over 5000 kHz on the 3090 GPU and over 250 kHz on the i9-10900K CPU, achieving competitive speed for the same hardware configuration.
연구 동기 및 목표
- 빠른 추론 속도를 갖는 실시간 고품질 음성 변환 모델의 부족을 해결한다.
- 음성 자연스러움과 발화자 유사성을 훼손하지 않으면서 추론 속도를 향상시킨다.
- VITS 디코더의 계산 중복을 줄여 음성 변환의 온디바이스 배포를 가능하게 한다.
- 자기학습된 음성 표현(HuBERT-Soft)을 활용해 발화자 신원에 독립적인 콘텐츠 특징을 추출한다.
- 최소한의 지연으로 비자율적 종단 간 추론을 위한 VITS 기반 아키텍처를 최적화한다.
제안 방법
- 고품질 웨이브폼 합성을 위해 적대적 훈련과 정규화 플로우를 활용하는 VITS를 종단 간 음성 변환의 기반으로 채택한다.
- VITS의 원래 Hifi-GAN 보코더를 역단기 푸리에 변환(iSTFT) 디코더로 대체하여 계산 비용을 감소시킨다.
- 원시 웨이브폼에서 발화자 독립적인 콘텐츠 특징을 추출하기 위해 HuBERT-Soft를 사용하여 텍스트 레이블이 필요 없도록 한다.
- iSTFT 디코더에 다중 대역 병렬 전략을 도입하여 웨이브폼 복원 속도를 향상시키고 중복을 줄인다.
- 훈련 중 데이터 증강을 적용하여 콘텐츠 특징의 분리도를 향상시키고 음성 자연스러움과 유사성을 향상시킨다.
- 다양한 발화자 간 음성 변환을 가능하게 하기 위해 발화자 인코더를 학습하여 임베딩을 추출한다.
실험 결과
연구 질문
- RQ1VITS 기반 음성 변환 모델은 높은 청취 품질을 유지하면서도 빠른 추론 속도를 달성할 수 있는가?
- RQ2iSTFT 기반 디코더는 더 빠른 웨이브폼 생성을 위해 Hifi-GAN 보코더를 효과적으로 대체할 수 있는가?
- RQ3콘텐츠 특징 추출에 HuBERT-Soft를 사용할 경우 음성 변환에서 분리도와 일반화 능력이 얼마나 향상되는가?
- RQ4훈련 중 데이터 증강이 언어적 콘텐츠와 발화자 정체성을 유지하는 데 모델의 능력을 향상시키는가?
- RQ5제안된 모델은 품질을 훼손하지 않고 소비자용 하드웨어(CPU/GPU)에서 실시간 추론을 달성할 수 있는가?
주요 결과
- QuickVC-sr는 모든 모델 중 가장 높은 자연스러움 점수(N-MOS: 4.28 ± 0.15)를 기록하여 Diff-VCTK(3.46 ± 0.21)와 BNE-PPG-VC(3.83 ± 0.17)를 압도했다.
- QuickVC-sr는 최고의 발화자 유사성(S-MOS: 3.58 ± 0.20)과 Resemblyzer 점수(85.68%)를 기록하여 모든 기준 모델을 뛰어넘었다.
- LibriSpeech에서 단어 오류율(WER)은 2.43%, 문자 오류율(CER)은 0.86%로 나타나 언어적 콘텐츠 유지 능력이 뛰어났다.
- RTX 3090 GPU에서 QuickVC는 5320.78 KHz의 추론 속도를 기록하여 Diff-VCTK(63.34 KHz)와 VQMIVC(148.27 KHz)보다 크게 빨랐다.
- i9-10900K CPU에서 QuickVC는 280.00 KHz의 추론 속도를 기록하여 모든 기준 모델을 뛰어넘었으며, 실시간 온디바이스 배포를 가능하게 했다.
- t-SNE 시각화 결과 발화자 임베딩이 잘 분리되어 있고 발화자 특이성이 높다는 것을 확인하여 발화자 인코더의 효과성을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.