[논문 리뷰] FreeVC: Towards High-Quality Text-Free One-Shot Voice Conversion
FreeVC는 텍스트 애너테이션 없이 한 번의 입력으로도 고음질 웨이브폼 재구성과 함께 음성 정보를 분리하는 텍스트 없는 일회성 음성 변환 시스템을 제안한다. 이는 VITS를 활용해 고음질 음성 재구성을 구현하고, 자율학습된 WavLM 특징 블로킹을 통해 말하기 정보를 내용 정보에서 분리한다. 스펙트로그램 리사이징 데이터 증강 기법을 도입함으로써 내용의 순수성을 향상시켜, 자연스러움과 언어적 일관성 측면에서 텍스트 기반 모델을 능가하면서도 저품질 입력에 대해서도 강건성을 유지한다.
Voice conversion (VC) can be achieved by first extracting source content information and target speaker information, and then reconstructing waveform with these information. However, current approaches normally either extract dirty content information with speaker information leaked in, or demand a large amount of annotated data for training. Besides, the quality of reconstructed waveform can be degraded by the mismatch between conversion model and vocoder. In this paper, we adopt the end-to-end framework of VITS for high-quality waveform reconstruction, and propose strategies for clean content information extraction without text annotation. We disentangle content information by imposing an information bottleneck to WavLM features, and propose the spectrogram-resize based data augmentation to improve the purity of extracted content information. Experimental results show that the proposed method outperforms the latest VC models trained with annotated data and has greater robustness.
연구 동기 및 목표
- 텍스트 애너테이션이나 대규모 레이블링된 데이터가 필요 없는 텍스트 없는 일회성 음성 변환 시스템을 개발하는 것.
- 자율학습된 표현에서 내용과 화자 정보를 더 잘 분리하여 내용 특징에서 화자 유출을 줄이는 것.
- 일괄적 VITS 프레임워크를 통해 변환 모델과 보코더를 정렬함으로써 웨이브폼 재구성 품질을 향상시키는 것.
- 데이터 증강 및 모델 설계를 통해 저품질의 원본 음성과 예측 불가능한 대상 화자에 대해 강건성을 높이는 것.
- 텍스트 감독 없이도 주관적 및 객관적 지표에서 텍스트 기반 모델과 동등하거나 그 이상의 성능을 달성하는 것.
제안 방법
- 일괄적 엔드 투 엔드 모델로 VITS 프레임워크를 채택하여 내용과 화자 정보를 동시에 모델링함으로써 고품질의 웨이브폼 생성을 가능하게 한다.
- 원시 웨이브폼에서 자율학습된 음성 표현을 추출하기 위해 WavLM를 사용하며, 이를 블로킹 추출기로 전달하여 내용 정보를 분리한다.
- WavLM 특징에 정보 블로킹을 적용하여 저차원 공간으로 압축함으로써 모델이 화자 특유의 세부 정보를 기각하도록 유도한다.
- 화자 특징을 왜곡하면서 내용을 유지하는 스펙트로그램 리사이징(SR) 데이터 증강 기법을 도입하여 학습 중 분리도를 향상시킨다.
- 단일 기준 음성 문장에서의 목표 화자 임베딩을 추출하기 위해 화자 인코더(사전학습 또는 비사전학습)를 사용하여 일회성 변환을 수행한다.
- 모델 전체를 적대적 손실과 VAE 기반 재구성 손실을 사용해 훈련함으로써 청각적 품질 향상과 특징 분포 정렬을 개선한다.
실험 결과
연구 질문
- RQ1텍스트 애너테이션이 없이도 텍스트 기반 모델과 유사한 높은 청각적 품질을 달성할 수 있는 텍스트 없는 음성 변환 시스템은 가능한가?
- RQ2WavLM 특징에 정보 블로킹을 적용하는 것이 화자 정체성과 내용을 얼마나 효과적으로 분리하는가?
- RQ3스펙트로그램 리사이징 데이터 증강 기법이 일회성 음성 변환에서 추출된 내용 표현의 순수성을 향상시키는가?
- RQ4비사전학습된 화자 인코더가 일회성 음성 변환에서 사전학습된 인코더와 동등한 성능을 낼 수 있는가?
- RQ5기존 기준 대비 제안된 방법은 예측 불가능한 화자와 저품질의 원본 입력에서 어떻게 성능을 발휘하는가?
주요 결과
- FreeVC는 미리보지 않은 화자 간 변환 시나리오에서 MOS 4.35와 SMOS 4.12를 기록하여 자연스러움과 화자 유사도 측면에서 모든 기준 모델을 능가한다.
- 제안된 방법은 WER 4.35%와 CER 1.53%를 기록하여 텍스트 기반 기준 모델보다 유의미하게 낮게, 강력한 언어적 내용 보존 능력을 보여준다.
- F0-PCC 0.778은 FreeVC가 모든 기준 모델보다 원본 음성의 억양 변화를 더 잘 유지하고 있음을 시사한다.
- FreeVC (w/o SR)는 성능 저하를 보이며(MOS: 4.18, WER: 4.92%), 이는 SR 기반 증강이 분리도와 품질 향상에 기여함을 입증한다.
- 비사전학습된 화자 인코더를 사용하는 FreeVC-s는 사전학습된 인코더를 사용한 FreeVC와 유사한 성능을 기록하여 화자 인코더 선택에 대한 강건성을 보여준다.
- 저품질의 원본 음성에 대해서도 모델은 높은 성능을 유지하며, 기준 모델이 심하게 성능 저하를 보이는 상황에서도 유사한 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.