Skip to main content
QUICK REVIEW

[논문 리뷰] From Speaker Verification to Multispeaker Speech Synthesis, Deep Transfer with Feedback Constraint

Zexin Cai, Chuxiong Zhang|arXiv (Cornell University)|2020. 05. 10.
Speech Recognition and Synthesis참고 문헌 27인용 수 5
한 줄 요약

이 논문은 화자 정체성 클로닝을 향상시키기 위해 사전 학습된 화자 확인 네트워크를 피드백 제약 조건으로 통합함으로써 다화자 텍스트-음성 합성 시스템을 제안한다. 합성 음성 임베딩과 기준 화자 임베딩을 일치시키는 손실 항목을 추가함으로써, 모델은 화자 유사도를 크게 향상시켰으며, 이는 낮아진 EER과 임베딩 공간 시각화에서 더욱 조밀한 클러스터링을 통해 확인된다.

ABSTRACT

High-fidelity speech can be synthesized by end-to-end text-to-speech models in recent years. However, accessing and controlling speech attributes such as speaker identity, prosody, and emotion in a text-to-speech system remains a challenge. This paper presents a system involving feedback constraint for multispeaker speech synthesis. We manage to enhance the knowledge transfer from the speaker verification to the speech synthesis by engaging the speaker verification network. The constraint is taken by an added loss related to the speaker identity, which is centralized to improve the speaker similarity between the synthesized speech and its natural reference audio. The model is trained and evaluated on publicly available datasets. Experimental results, including visualization on speaker embedding space, show significant improvement in terms of speaker identity cloning in the spectrogram level. Synthesized samples are available online for listening. (https://caizexin.github.io/mlspk-syn-samples/index.html)

연구 동기 및 목표

  • 엔드 투 엔드 다화자 TTS 시스템에서 화자 정체성 클로닝을 향상시키기 위해.
  • 특히 새로운 화자에 대해 합성된 음성과 자연 음성 간의 화자 유사도 격차를 해소하기 위해.
  • 사전 학습된 확인 모델에서의 분류적 화자 표현을 전이함으로써 더 강력한 오픈 세트 음성 클로닝을 가능하게 하기 위해.
  • 합성 음성과 자연 음성의 임베딩 간의 분포 차이를 줄이기 위해.
  • 데이터 증강 및 화자 확인에 대한 화이트박스 위조 공격 응용을 탐색하기 위해.

제안 방법

  • TTS 학습 중에 사전 학습된 화자 확인 네트워크를 피드백 제약 조건으로 통합한다.
  • 확인 네트워크 점수를 기반으로 한 화자 유사도 손실 항목을 추가하여 합성 음성 임베딩을 기준 화자 임베딩과 일치시킨다.
  • 합성 손실과 피드백 제약 조건 손실 양쪽을 최적화하는 공동 학습 프레임워크를 사용한다.
  • 피드백 제약 조건을 적용하여 합성 음성 임베딩이 동일한 화자 클래스 내에서 자연 기준 임베딩과 가까이 클러스터링하도록 유도한다.
  • 학습 안정성을 높이기 위해 TTS 아키텍처에 잔차 연결 및 정규화 레이어를 활용한다.
  • 음성 클로닝을 위한 조건 벡터로 확인 네트워크의 화자 임베딩을 사용한다.
Figure 1: The overall training framework of deep speaker verification systems
Figure 1: The overall training framework of deep speaker verification systems

실험 결과

연구 질문

  • RQ1화자 확인 시스템의 피드백 제약 조건이 다화자 TTS에서 화자 정체성 클로닝을 향상시킬 수 있는가?
  • RQ2제안된 방법이 합성 음성과 자연 음성의 임베딩 간 분포 격차를 줄이는가?
  • RQ3피드백 제약 조건은 볼 수 있는 화자와 볼 수 없는 화자 조건에서 화자 유사도에 어떤 영향을 미치는가?
  • RQ4기준 TTS 시스템에 비해 오픈 세트 음성 클로닝에서 더 나은 성능을 달성할 수 있는가?
  • RQ5피드백 제약 조건은 EER 및 코사인 유사도와 같은 목적적 지표에 어떤 영향을 미치는가?

주요 결과

  • 제안된 피드백 제약 조건(FC) 시스템은 VCTK 테스트 세트에서 텍스트 종속 조건에서 SV-EER을 50.8% 상대적으로 감소시켰다(14.72%에서 8.22%로).
  • Librispeech 세트에서는 텍스트 종속 합성에서 EER이 기준값 26.84%에서 16.54%로 감소하여 화자 분류 성능 향상을 보였다.
  • VCTK 테스트 세트(텍스트 종속)에서 합성 임베딩과 기준 임베딩 간 코사인 유사도는 0.403에서 0.764로 증가하여 더 강한 화자 정체성 일치를 나타낸다.
  • t-SNE 시각화 결과, FC 방법을 사용한 합성 음성의 임베딩은 자연 음성의 임베딩과 밀집하게 클러스터링되는 것으로 확인되었으며, 기준 모델은 분포 이격 현상을 보였다.
  • 주관적 평가 결과, VCTK 테스트 세트에서는 65.8%의 쌍에서 FC 시스템을 선호했고, Librispeech 세트에서는 73.7%에서 선호되었으며, 이는 더 나은 화자 유사도 인식을 의미한다.
  • 모델은 새로운 화자에 대해 높은 품질의 음성 클로닝을 가능하게 하며, 더 강력한 내성성을 보이며, 데이터 증강 및 화이트박스 위조 공격 응용 가능성을 시사한다.
Figure 2: Proposed multi-speaker speech synthesis model
Figure 2: Proposed multi-speaker speech synthesis model

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.