[논문 리뷰] VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion
이 논문은 벡터 양자화(VQCPC)와 상호정보량(MI) 최소화를 통해 내용, 화자, 톤 요소 간의 상호의존성을 줄이는 비지도 일회성 음성 변환 방법인 VQMIVC를 제안한다. 재구성, VQCPC, MI 손실을 함께 최적화함으로써 모델은 언어적 내용과 억양을 유지하면서도 뛰어난 음성 자연스러움과 화자 유사도를 달성하며, 객관적 및 주관적 평가에서 최신 기법들을 능가한다.
One-shot voice conversion (VC), which performs conversion across arbitrary speakers with only a single target-speaker utterance for reference, can be effectively achieved by speech representation disentanglement. Existing work generally ignores the correlation between different speech representations during training, which causes leakage of content information into the speaker representation and thus degrades VC performance. To alleviate this issue, we employ vector quantization (VQ) for content encoding and introduce mutual information (MI) as the correlation metric during training, to achieve proper disentanglement of content, speaker and pitch representations, by reducing their inter-dependencies in an unsupervised manner. Experimental results reflect the superiority of the proposed method in learning effective disentangled speech representations for retaining source linguistic content and intonation variations, while capturing target speaker characteristics. In doing so, the proposed approach achieves higher speech naturalness and speaker similarity than current state-of-the-art one-shot VC systems. Our code, pre-trained models and demo are available at https://github.com/Wendison/VQMIVC.
연구 동기 및 목표
- 일회성 음성 변환에서 내용 정보가 화자 임베딩에 오염되는 정보 泄漏 문제를 해결하기 위해.
- 텍스트 번역이나 화자 레이블과 같은 어떤 지도 정보 없이도 내용, 화자, 톤 요소를 효과적으로 분리하기 위해.
- 학습 중에 분리된 표현 간의 상호정보량을 최소화하여 음성 변환 품질을 향상시키기 위해.
- 원본 언어적 내용과 소스 억양을 유지하면서도 목표 화자 특성을 정확히 전달함으로써 고음질의 일회성 음성 변환을 달성하기 위해.
제안 방법
- 프레임 단위의 언어적 내용 표현을 추출하기 위해 대비 예측 코딩을 통한 벡터 양자화(VQCPC) 기반의 내용 인코더를 사용한다.
- 원시 음성 특징에서 고정된 차원의 벡터 표현을 생성함으로써 화자 신원을 포착하는 화자 인코더를 구현한다.
- 발화 수준에서 정규화된 기본 주파수(F₀)를 계산하여 억양 변화를 유지한다.
- 분리된 내용, 화자, 톤 표현에서 멜스펙트로그램을 재구성하기 위한 디코더를 설계한다.
- 세 가지 손실 성분으로 구성된 모델을 학습한다: 재구성 손실, 국소 음성 구조를 모델링하기 위한 VQCPC 손실, 표현 간 의존성을 최소화하기 위한 상호정보량(MI) 손실.
- 비모수적 대비 로그비 상한을 이용한 변동형 대비 로그비 상한(vCLUB)을 사용해 상호정보량을 최소화함으로써 비지도 방식으로 분리성을 강제한다.
실험 결과
연구 질문
- RQ1상호정보량 최소화가 일회성 음성 변환에서 내용, 화자, 톤 표현 간의 상호의존성을 효과적으로 줄일 수 있는가?
- RQ2VQCPC와 MI를 통한 비지도 분리가 일회성 VC에서 내용 보존과 억양 일관성에 어떻게 기여하는가?
- RQ3기존의 비지도 분리 기법에 비해 MI 기반 정규화는 정보 泄漏를 어느 정도 완화하는가?
- RQ4톤 표현의 포함이 변환 과정에서 원본 억양 보존에 기여하는가?
- RQ5음성 자연스러움과 화자 유사도 측면에서 제안된 방법은 최신 일회성 VC 시스템과 비교해 어떻게 성능을 내는가?
주요 결과
- 제안된 VQMIVC 방법은 변환된 음성에서 29.3%의 최저 단어 오류율(WER)과 14.9%의 최저 문자 오류율(CER)을 달성하여 AutoVC, AdaIN-VC, VQVC+를 크게 앞서며 성능을 뛰어나게 한다.
- 원본과 변환된 F₀ 곡선 간 피어슨 상관계수(PCC)는 0.781로, 억양 변화의 강력한 보존을 나타낸다.
- 상호정보량 정규화 없이 학습할 경우(W/o MI), WER는 62.1%로 증가하고 CER는 38.0%로 상승하여 MI 최소화가 내용 유출을 방지하기 위해 필수적임을 입증한다.
- 주관적 MOS 평가 결과, 제안된 방법은 평균 점수 4.2로 음성 자연스러움, 평균 점수 4.3으로 화자 유사도에서 AutoVC와 VQVC+를 능가하며 오라클 성능에 가까워진다.
- 제거 실험을 통해 MI 정규화가 표현 간 상관관계를 감소시켜 더 정확한 분리와 향상된 VC 품질을 이끌어낸다는 것이 확인되었다.
- 다양한 화자 쌍에 걸쳐 높은 성능을 유지함으로써, 화자 레이블이나 번역 없이도 제로샷 및 일회성 설정에서 뛰어난 강건성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.