Skip to main content
QUICK REVIEW

[논문 리뷰] One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization

Ju-Chieh Chou, Cheng-chieh Yeh|arXiv (Cornell University)|2019. 04. 10.
Speech Recognition and Synthesis참고 문헌 35인용 수 19
한 줄 요약

이 논문은 원샷 음성 변환 방법을 제안하며, 인스턴스 정규화(IN)를 사용해 화자와 내용 표현을 분리함으로써, 단일 소스 및 타겟 음성 문장만으로도 훈련 데이터에 포함되지 않은 화자에게도 변환할 수 있도록 한다. 이 방법은 평행 데이터나 화자 레이블 없이도 높은 품질의, 화자 유사도가 높은 출력을 생성하며, 의미 있는 비지도 화자 임베딩을 학습한다.

ABSTRACT

Recently, voice conversion (VC) without parallel data has been successfully adapted to multi-target scenario in which a single model is trained to convert the input voice to many different speakers. However, such model suffers from the limitation that it can only convert the voice to the speakers in the training data, which narrows down the applicable scenario of VC. In this paper, we proposed a novel one-shot VC approach which is able to perform VC by only an example utterance from source and target speaker respectively, and the source and target speaker do not even need to be seen during training. This is achieved by disentangling speaker and content representations with instance normalization (IN). Objective and subjective evaluation shows that our model is able to generate the voice similar to target speaker. In addition to the performance measurement, we also demonstrate that this model is able to learn meaningful speaker representations without any supervision.

연구 동기 및 목표

  • 추론 시 훈련 데이터에 포함되지 않은 화자에게 일반화되지 않는 기존의 비지도 음성 변환 모델의 한계를 해결하기 위해.
  • 훈련 데이터에 포함되지 않은 소스 및 타겟 화자의 단일 참조 문장만으로도 원샷 음성 변환을 가능하게 하여, 훈련 데이터에 포함되지 않은 참조 문장을 요구하지 않도록 하기 위해.
  • 딥 페어지니티 모델에서 화자 신원과 언어적 내용 표현을 분리하여 일반화 능력과 제어 능력을 향상시키기 위해.
  • 대비 학습 없이도 인스턴스 정규화가 내용 표현에서 화자 정보를 효과적으로 억제할 수 있음을 보여주기 위해.
  • 화자 레이블이나 어떤 형태의 지도 학습 없이도 의미 있는, 분리된 화자 임베딩을 학습할 수 있음을 보여주기 위해.

제안 방법

  • 화자 인코더, 내용 인코더, 디코더로 구성된 변동형 오토인코더(VAE) 프레임워크를 사용한다.
  • 내용 인코더에 애드티브 인스턴스 정규화(AdaIN)를 적용하여 채널 통계를 정규화하고 전반적인 화자 관련 정보를 제거한다.
  • 디코더에서 애드티브 인스턴스 정규화(AdaIN)를 사용하며, 애드티브 파라미터는 화자 인코더가 예측하여 화자 특성 정보를 주입한다.
  • 모델을 엔드 투 엔드로 훈련하며, 평행 데이터나 프레임 수준의 정렬 정보가 전혀 없는 비평행 음성 데이터만 사용한다.
  • 글로벌 평균 풀링의 시간 평균 성질과 함께 인스턴스 정규화(IN)를 활용하여 내용 인코더가 화자 정보를 기각하도록 유도한다.
  • 학습된 화자 임베딩의 품질 평가를 위해 t-SNE 시각화와 화자 분류 정확도를 활용한다.

실험 결과

연구 질문

  • RQ1대비 학습 없이도 인스턴스 정규화가 음성 변환 모델에서 화자와 내용 표현을 효과적으로 분리할 수 있는가?
  • RQ2추론 시 각 화자에 대해 단일 참조 문장만으로도 새로운 화자에게 일반화되는 음성 변환 모델이 가능한가?
  • RQ3제시된 방법이 화자 레이블이나 명시적 지도 학습 없이도 의미 있는, 분리된 화자 임베딩을 학습할 수 있는가?
  • RQ4원샷 설정에서 타겟 화자와 비교해 화자 유사도와 스펙트럼 정밀도 측면에서 모델의 성능은 어떠한가?
  • RQ5평행 훈련 데이터나 프레임 수준의 정렬 정보 없이도 높은 품질의 음성 변환을 달성할 수 있는가?

주요 결과

  • 모델은 훈련 데이터에 포함되지 않은 화자에게도 단일 소스 및 타겟 음성 문장만으로도 높은 품질의 음성 변환을 수행하며, 해당 화자들이 훈련 데이터에 포함되어 있지 않아도 된다.
  • 객관적 평가 결과, 변환된 음성의 전반적인 분산 분포가 타겟 화자와 유사하게 나타나, 정확한 화자 특성 전이가 이루어졌음을 시사한다.
  • 스펙트로그램 시각화 결과, 모델은 발음 내용을 유지하면서도 기저 주파수(F0)와 스펙트럼 은폐를 타겟 화자와 일치시키는 데 성공했다.
  • IN을 적용한 내용 인코더의 출력에 대해 화자 신원 분류 정확도는 0.375로 낮아지며 잔여 화자 정보가 최소화되었고, IN 없이 사용할 경우 0.658로 상대적으로 높았다.
  • 화자 인코더는 지도 학습 없이도 의미 있는, 분리된 화자 임베딩을 학습한다: 새로운 화자에 대해 화자 신원 분류 정확도가 99.98%에 도달했다.
  • 주관적 평가 결과, 인간 청취자들이 변환된 음성의 유사도를 높게 평가하였으며, 4단계 척도에서 강한 청각적 일치를 나타내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.