Skip to main content
QUICK REVIEW

[논문 리뷰] Voice Conversion by Cascading Automatic Speech Recognition and Text-to-Speech Synthesis with Prosody Transfer

Jingxuan Zhang, Lijuan Liu|arXiv (Cornell University)|2020. 09. 03.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 음성 인식(ASR)과 음성 합성(TTS)을 이용한 자동 음성 변환(VC) 시스템을 제안하며, 음성 톤 전달 기능을 포함한다. 음성 텍스트 변환을 위해 iFLYTEK ASR를 사용하고, 학습된 음성 톤 코드를 조건으로 삼는 Transformer TTS 모델을 활용하여 원본 화자 음성 톤을 전달함으로써, 음성 변환 챌린지 2020에서 자연스러움과 유사도 측면에서 최고 성능을 달성하였다.

ABSTRACT

With the development of automatic speech recognition (ASR) and text-to-speech synthesis (TTS) technique, it's intuitive to construct a voice conversion system by cascading an ASR and TTS system. In this paper, we present a ASR-TTS method for voice conversion, which used iFLYTEK ASR engine to transcribe the source speech into text and a Transformer TTS model with WaveNet vocoder to synthesize the converted speech from the decoded text. For the TTS model, we proposed to use a prosody code to describe the prosody information other than text and speaker information contained in speech. A prosody encoder is used to extract the prosody code. During conversion, the source prosody is transferred to converted speech by conditioning the Transformer TTS model with its code. Experiments were conducted to demonstrate the effectiveness of our proposed method. Our system also obtained the best naturalness and similarity in the mono-lingual task of Voice Conversion Challenge 2020.

연구 동기 및 목표

  • ASR와 TTS를 활용하여 병렬 데이터가 필요 없는 비병렬 음성 변환 시스템을 개발함.
  • 학습된 음성 톤 코드를 통해 음성 톤을 명시적으로 모델링하여 음성 변환의 자연스러움과 화자 유사도를 향상시키고자 함.
  • 이전의 인식-합성 방법에서 사용된 프레임 수준 특징(예: PPGs)의 한계를 보완하기 위해, 전역 음성 톤 조건부의 시퀀스-투-시퀀스 TTS를 사용함.
  • 다국어 조건이 아닌 단일 언어 조건에서 대규모 벤치마크인 음성 변환 챌린지 2020을 대상으로 시스템을 평가함.

제안 방법

  • 시스템은 원본 음성을 텍스트로 변환하기 위해 iFLYTEK ASR 엔진을 사용하여 언어적 내용과 화자 특성 정보를 분리함.
  • Transformer TTS 모델은 텍스트와 화자 임베딩을 기반으로 타겟 화자에 대해 미세조정되어 타겟 음성을 생성함.
  • 음성 톤 인코더는 원본 발화에서 전역 음성 톤 코드를 추출하여 음고, 에너지, 시간 패턴을 캡처함.
  • 음성 톤 코드는 전달되어 타겟 TTS 모델의 조건부 입력으로 사용되어 합성 과정에서 음성 톤 전달이 가능하도록 함.
  • TTS 모델은 멀티헤드 어텐션, 잔차 연결, 레이어 정규화를 활용하고, WaveNet 보이스코더를 사용하여 고해상도 음성 생성을 구현함.
  • 전체적으로 다중 화자 사전학습 및 화자별 미세조정 전략을 통해 엔드 투 엔드로 학습됨.

실험 결과

연구 질문

  • RQ1병렬 학습 데이터가 필요 없이 계단식 ASR-TTS 파이프라인으로 경쟁 가능한 음성 변환 성능을 달성할 수 있는가?
  • RQ2학습된 음성 톤 코드를 TTS 모델에 조건부로 적용하면 음성 변환 결과의 자연스러움과 유사도가 향상되는가?
  • RQ3제안된 방법은 최신 기술과 비교해 화자 유사도와 자연스러움 측면에서 어떻게 성능을 내는가?
  • RQ4음성 톤 코드는 화자 독립적인가? 다양한 화자 간에 효과적인 음성 톤 전달이 가능한가?

주요 결과

  • 제안된 방법은 음성 변환 챌린지 2020의 단일 언어 트랙에서 가장 높은 종합 성능을 기록하였으며, 자연스러움과 유사도 점수 모두 모든 팀을 압도함.
  • 자연스러움에 대한 평균 관점 점수(MOS)는 3.733, 유사도 점수는 3.704를 기록하였으며, 자연스러운 타겟 음성과 통계적으로 유의미한 차이가 없음.
  • 음성 톤 코드를 포함한 결과는 TEF2 타겟 화자에 대해 자연스러움과 유사도에 약간의 향상 효과를 보였지만, 모든 화자에 대해 일관된 이점은 관찰되지 않음.
  • t-SNE 시각화 결과, 다양한 화자에서 유도된 음성 톤 코드가 잠재 공간에서 잘 분리되어 있음을 확인하여 음성 톤 코드의 화자 독립성을 확인함.
  • 음성 톤 전달 기능을 갖춘 방법은 VCC2018+ 베이스라인과 유사한 성능을 기록했지만, 종합 순위에서 더 높은 성과를 달성함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.