Skip to main content
QUICK REVIEW

[논문 리뷰] Transfer Learning from Monolingual ASR to Transcription-free Cross-lingual Voice Conversion

Che‐Jui Chang|arXiv (Cornell University)|2020. 09. 30.
Speech Recognition and Synthesis참고 문헌 28인용 수 4
한 줄 요약

이 논문은 원어민 ASR 모델에서의 전이 학습을 활용하여 번역 없이 언어 간 음성 변환을 수행하는 방법을 제안한다. 원어민 ASR 모델을 통해 원본 언어 음성에서 음소 특징을 추출하고, Seq2Seq 모델을 사용해 목표 멜-스펙트로그램을 예측함으로써, 평행 데이터나 번역 없이도 화자 의존적인 음성 변환을 구현한다. 이 방법은 VCC 2020 데이터셋에서 음성 품질에 대해 3.83점, 유사성에 대해 3.54점의 MOS 점수를 기록한다.

ABSTRACT

Cross-lingual voice conversion (VC) is a task that aims to synthesize target voices with the same content while source and target speakers speak in different languages. Its challenge lies in the fact that the source and target data are naturally non-parallel, and it is even difficult to bridge the gaps between languages with no transcriptions provided. In this paper, we focus on knowledge transfer from monolin-gual ASR to cross-lingual VC, in order to address the con-tent mismatch problem. To achieve this, we first train a monolingual acoustic model for the source language, use it to extract phonetic features for all the speech in the VC dataset, and then train a Seq2Seq conversion model to pre-dict the mel-spectrograms. We successfully address cross-lingual VC without any transcription or language-specific knowledge for foreign speech. We experiment this on Voice Conversion Challenge 2020 datasets and show that our speaker-dependent conversion model outperforms the zero-shot baseline, achieving MOS of 3.83 and 3.54 in speech quality and speaker similarity for cross-lingual conversion. When compared to Cascade ASR-TTS method, our proposed one significantly reduces the MOS drop be-tween intra- and cross-lingual conversion.

연구 동기 및 목표

  • 원본 언어와 목표 언어가 평행이 아니며, 번역이 제공되지 않을 경우 음성 변환에서의 내용 불일치 문제를 해결하기 위해.
  • 원어민 ASR 모델에서의 지식 전이를 탐구하여, 영어 기반의 음성 변환에서의 정렬 및 합성 성능을 향상시키기 위해.
  • 언어별 또는 번역 기반의 감독 없이도 내부 및 언어 간 음성 변환 간 성능 격차를 줄이기 위해.
  • 언어 간 일반화가 가능한 화자 의존 음성 변환 시스템을 개발하기 위해, 원본 언어 ASR 모델의 음성 특징만을 사용한다.

제안 방법

  • 모든 음성 데이터셋에서 음소 임베딩을 추출하기 위해 원본 언어에서 원어민 ASR 모델을 훈련한다.
  • 훈련된 ASR 모델을 사용해 원본 및 목표 언어 음성에 대해 내용 정렬된 음소 표현을 생성함으로써 언어 간 정렬을 가능하게 한다.
  • 추출된 음소 특징을 Seq2Seq 아키텍처에 입력하여 원본 음성에서 직접 목표 화자의 멜-스펙트로그램을 예측한다.
  • 번역이나 언어별 모델이 필요 없이 음성 특징과 목표 화자 임베딩만을 사용하여 Seq2Seq 모델을 종단 간으로 훈련한다.
  • 추론 중에 화자 의존 조건을 적용하여 합성 음성에서 목표 화자 정체성을 유지한다.
  • 평가를 위해 VCC 2020 데이터셋을 사용하며, 영어 기반 및 캐스케이드 ASR-TTS 기반 베이스라인과 성능을 비교한다.

실험 결과

연구 질문

  • RQ1번역 없이도 원어민 ASR 모델이 언어 간 음성 변환에서 내용 표현을 효과적으로 전이할 수 있는가?
  • RQ2ASR에서의 지식 전이가 영어 기반 또는 캐스케이드 방법에 비해 언어 간 음성 변환 성능을 얼마나 향상시키는가?
  • RQ3원본 언어 ASR 모델에서 추출된 음소 특징이 목표 언어에서 내용을 유지하는 음성 변환을 얼마나 잘 가능하게 하는가?
  • RQ4제안된 방법이 기존 접근 방식에 비해 내부 및 언어 간 변환 간 MOS 감소를 얼마나 줄이는가?

주요 결과

  • 제안된 방법은 VCC 2020 데이터셋에서 음성 품질에 대해 평균 관점 점수(MOS) 3.83점, 화자 유사성에 대해 3.54점의 점수를 기록한다.
  • 모델은 음성 품질과 화자 유사성 양 측면에서 영어 기반 베이스라인을 능가하며, 원어민 ASR 전이의 효과성을 입증한다.
  • 캐스케이드 ASR-TTS 방법에 비해 내부 및 언어 간 변환 간 MOS 감소가 크게 줄어들어 더 나은 일반화 성능을 보인다.
  • 이 방법은 평행 데이터, 번역, 언어별 모델이 모두 필요 없이도 화자 의존 음성 변환을 성공적으로 수행한다.
  • 원본 언어 ASR 모델에서 추출된 음소 특징은 언어 간 정렬을 위한 충분한 내용 표현을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.