Skip to main content
QUICK REVIEW

[논문 리뷰] Linear networks based speaker adaptation for speech synthesis

Zhiying Huang, Heng Lu|arXiv (Cornell University)|2018. 03. 05.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 신경 음성 합성에서 선형 네트워크(LN) 기반의 화자 적응 방법을 제안하며, 여러 레이어에 LN을 삽입하고 출력 레이어와 함께 미세조정한다. 저랭크 더블리(_LRPD)_분해를 통해 파라미터 효율성을 확보함으로써, 단 200개의 적응 음성만으로도 1,000개의 음성으로 훈련된 화자에 종속된 모델과 유사한 화자 적응 품질을 달성하며, 저자료 환경에서 표준 미세조정 및 전체 LN보다 뛰어난 성능을 보인다.

ABSTRACT

Speaker adaptation methods aim to create fair quality synthesis speech voice font for target speakers while only limited resources available. Recently, as deep neural networks based statistical parametric speech synthesis (SPSS) methods become dominant in SPSS TTS back-end modeling, speaker adaptation under the neural network based SPSS framework has also became an important task. In this paper, linear networks (LN) is inserted in multiple neural network layers and fine-tuned together with output layer for best speaker adaptation performance. When adaptation data is extremely small, the low-rank plus diagonal(LRPD) decomposition for LN is employed to make the adapted voice more stable. Speaker adaptation experiments are conducted under a range of adaptation utterances numbers. Moreover, speaker adaptation from 1) female to female, 2) male to female and 3) female to male are investigated. Objective measurement and subjective tests show that LN with LRPD decomposition performs most stable when adaptation data is extremely limited, and our best speaker adaptation (SA) model with only 200 adaptation utterances achieves comparable quality with speaker dependent (SD) model trained with 1000 utterances, in both naturalness and similarity to target speaker.

연구 동기 및 목표

  • 제한된 대상 화자 데이터만 존재할 때 고품질의 화자 특화 음성 합성 음성 모델을 구축하는 데 도전하는 것.
  • 다중 레이어에 선형 네트워크(LN)를 도입하여 딥 네트워크 기반 음성 합성에서 화자 적응 성능을 향상시키는 것.
  • 저랭크 더블리(LRPD) 분해를 적용하여 화자 특화 파라미터의 과적합을 줄이고 극도로 낮은 데이터 가용성 하에서도 적응의 안정성을 확보하는 것.
  • 여성-여성, 남성-여성, 여성-남성 등 다양한 화자 적응 방향에서 성능을 평가하는 것.
  • 표준 미세조정 및 전체 LN과 비교해, 최소한의 적응 데이터로도 LRPD-LN 기반 적응이 더 자연스럽고 화자 유사성이 높은 성능을 낼 수 있음을 입증하는 것.

제안 방법

  • 다중 작업 DNN-BLSTM 음성 합성 모델의 다수의 은닉 레이어에 선형 네트워크(LN)를 통합한다.
  • 적응 과정에서 LN 파라미터를 출력 레이어와 함께 공동으로 미세조정함으로써, 전체 네트워크를 재학습하지 않고도 화자 특화 변환을 가능하게 한다.
  • LN 레이어에 저랭크 더블리(LRPD) 분해를 적용하여 자유 매개변수의 수를 줄이고, 적응 데이터가 부족한 상황에서도 안정성을 향상시킨다.
  • LRPD 분해를 통해 선형 변환 행렬의 랭크를 제약함으로써, 낮은 데이터 환경에서 표현력과 일반화 능력의 균형을 맞춘다.
  • 언어적 특징과 멜-세프트럼 계수, 로그 F0, 밴드 비정규성, 음성 상태를 다중 출력 헤드로 사용하여 다중 화자 DNN-BLSTM 기본 모델을 훈련시킨다.
  • 공유 인코더 레이어를 수정하지 않고, 소수의 대상 화자 음성만을 사용하여 LN 레이어와 출력 레이어를 미세조정함으로써 화자 적응을 수행한다.

실험 결과

연구 질문

  • RQ1DNN-BLSTM TTS 모델의 다수 레이어에 선형 네트워크(LN)를 삽입하면, 표준 출력 레이어 전용 미세조정보다 화자 적응 성능이 향상되는가?
  • RQ2소수의 적응 음성만 존재할 경우, LN 레이어에 저랭크 더블리(LRPD) 분해를 적용하면 적응의 안정성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3200개의 적응 음성만으로도, 1,000개의 음성으로 훈련된 화자에 종속된(SD) 모델과 유사한 자연스러움과 화자 유사성을 달성할 수 있는가?
  • RQ4남성-여성, 여성-남성 등 도전적인 크로스보이스 적응 방향에서 이 방법은 어떻게 성능을 보이는가?
  • RQ5과적합이 줄어들어 더 안정적인 성능을 보이는 LRPD-LN 버전이, 저자료 환경에서 전체 LN보다 더 견고한가?

주요 결과

  • LRPD-LN 적응 방법은 200개의 적응 음성만으로도 1,000개의 음성으로 훈련된 화자에 종속된(SD) 모델과 유사한 주관적 품질(자연스러움과 화자 유사성)을 달성한다.
  • 200개의 적응 음성으로도 LRPD-LN은 객관적 평가와 주관적 평가 모두에서 표준 출력 레이어 미세조정 및 전체 LN을 모두 능가하며, 특히 저자료 환경에서 뛰어난 성능을 보인다.
  • 적응 데이터가 제한적일 경우(50개 미만), 전체 LN은 과도한 화자 특화 파라미터로 인해 LRPD-LN보다 성능이 열 劣하다.
  • 적응 데이터가 증가하면(100개 이상), 전체 LN이 LRPD-LN을 앞서며, 충분한 데이터가 존재할 경우 LRPD 제약이 최적의 성능을 내지 못함을 시사한다.
  • 주관적 테스트 결과, 데이터가 부족할 경우 LRPD-LN이 SD 및 전체 LN 모델보다 더 안정적인 성능을 보이며, SD 모델은 음성 수가 감소함에 따라 급격히 성능이 떨어진다.
  • 이 방법은 남성-여성, 여성-남성 등 다양한 크로스보이스 적응 과제에서 잘 일반화되며, LRPD-LN은 동일한 낮은 데이터 양으로 훈련된 SD 모델을 항상 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.