Skip to main content
QUICK REVIEW

[논문 리뷰] The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS

Wen-Chin Huang, Tomoki Hayashi|arXiv (Cornell University)|2020. 10. 06.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 Voice Conversion Challenge 2020를 위한 시퀀스 투 시퀀스(seq2seq) 베이스라인 시스템을 제시한다. 이 시스템은 ESPnet과 사전 학습 모델을 활용한 계단식 ASR 및 TTS 파이프라인을 사용한다. 단순한 구조임에도 불구하고 변환 유사도에서 전체 2위를 기록하며, 비병렬 데이터와 제한된 피니팅 데이터 조건에서도 시퀀스 투 시퀀스 모델링이 발화자 신원 변환에 매우 강력한 잠재력을 지닌다는 것을 입증한다.

ABSTRACT

This paper presents the sequence-to-sequence (seq2seq) baseline system for the voice conversion challenge (VCC) 2020. We consider a naive approach for voice conversion (VC), which is to first transcribe the input speech with an automatic speech recognition (ASR) model, followed using the transcriptions to generate the voice of the target with a text-to-speech (TTS) model. We revisit this method under a sequence-to-sequence (seq2seq) framework by utilizing ESPnet, an open-source end-to-end speech processing toolkit, and the many well-configured pretrained models provided by the community. Official evaluation results show that our system comes out top among the participating systems in terms of conversion similarity, demonstrating the promising ability of seq2seq models to convert speaker identity. The implementation is made open-source at: https://github.com/espnet/espnet/tree/master/egs/vcc20.

연구 동기 및 목표

  • 계단식 ASR 및 TTS 파이프라인을 사용하여 단순하고 오픈소스이며 경쟁력 있는 음성 변환 베이스라인을 확립하기 위해.
  • 특히 비병렬 학습 데이터 조건에서 시퀀스 투 시퀀스 모델의 효과성을 평가하기 위해.
  • 특히 이종어 음성 변환 환경에서의 자원이 제한된 상황에서 사전 학습된 ASR 및 TTS 모델의 성능을 조사하기 위해.
  • 제한된 피니팅 데이터를 사용하는 계단식 시스템에서 음성 품질과 이해 가능성에 미치는 주요 제약을 규명하기 위해.
  • 특히 이 분야의 초보자들을 위해 향후 연구를 위한 기준을 제공하기 위해.

제안 방법

  • 소스 음성의 언어적 내용을 보존하면서 발음 및 억양 정보를 유지하는, 발화자 독립형 seq2seq ASR 모델을 사용하여 음성을 텍스트로 변환한다.
  • 각 타겟 발화자에 대한 제한된 데이터(70개 발화)를 기반으로 발화자 독립형 seq2seq TTS 모델을 피니팅하여 타겟 발화자의 음성으로 음성을 합성한다.
  • 타겟 특화 데이터에 대한 피니팅 이전에 대규모 다국어 TTS 데이터셋을 기반으로 사전 학습을 수행하여 TTS 모델을 초기화한다.
  • 최종 음성 웨이브폼을 생성하기 위해 자동회귀가 아닌 신경망 보이서를 사용하며, 추론 속도를 우선시한다.
  • 모든 구성 요소는 ESPnet에 구현되어 있으며, 커뮤니티에서 제공하는 사전 학습 모델과 표준화된 학습 프로토콜을 활용한다.
  • 시스템은 VCC2020의 두 가지 과제에서 평가된다: 비병렬 내어음성 음성 변환과 이종어 음성 변환이며, 주관적 및 객관적 지표가 적용된다.

실험 결과

연구 질문

  • RQ1비종속형 엔드 투 엔드 접근 방식임에도 불구하고, 계단식 seq2seq ASR+TTS 파이프라인이 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2자원이 제한된 비병렬 음성 변환 환경에서 사전 학습된 ASR 및 TTS 모델의 활용은 얼마나 효과적인가?
  • RQ3특히 음성 품질과 이해 가능성 측면에서 계단식 시스템의 주요 성능 저하 요인은 무엇인가?
  • RQ4시퀀스 투 시퀀스 모델링은 음성 변환 과정에서 높이, 지속시간, 말하기 속도와 같은 억양 특징을 얼마나 잘 유지하는가?
  • RQ5특히 낯선 타겟 언어를 사용하는 이종어 설정에서, 다양한 언어 조합 간의 성능은 어떠한가?

주요 결과

  • 시스템은 약 90%의 변환 유사도 점수를 기록하여 VCC2020 도전 대회에서 28개 팀 중 2위를 기록하며 강력한 발화자 신원 전달 능력을 입증했다.
  • 과제 1(비병렬 내어음성)에서 자연스러움 MOS는 3.0을 기록하고, 유사도 점수는 90%를 기록하여 고품질 출력을 달성했다.
  • 과제 2(이종어)에서는 자연스러움 MOS가 2.0으로 하락하여 28개 팀 중 21위를 기록하며 품질 저하가 심각하게 나타났다.
  • 과제 2에서의 유사도 점수는 28개 팀 중 9위를 기록하여, 언어와 데이터의 차이가 있음에도 불구하고 발화자 특징을 효과적으로 유지하고 있음을 보여주었다.
  • 변환된 음성에서의 ASR 오류율은 원본 음성보다 유의미하게 높아, TTS 모델의 완성도 부족이 이해 가능성 저하의 주요 원인임을 시사했다.
  • 최고 팀과의 성능 격차는 주로 타겟 발화자당 70개 발화의 제한된 피니팅 데이터에서 기인하며, 데이터 부족이 핵심 과제임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.