Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Neural Network Postfilters for Statistical Parametric Speech Synthesis

Prasanna Kumar Muthukumar, Alan W. Black|arXiv (Cornell University)|2016. 01. 26.
Speech Recognition and Synthesis참고 문헌 15인용 수 4
한 줄 요약

이 논문은 통계적 파arametric 음성 합성에서 분류 및 회귀 트리(CART)에 의한 멜-세프트럴 계수(MCEP) 예측 오류를 수정하기 위해 순환 신경망(RNN) 후처리 필터를 제안한다. RNN은 음성 신호의 시간적 의존성을 활용할 수 있으며, 어휘 정보와 같은 새로운 특징을 쉽게 통합할 수 있다. 보조좌표 방법(MAC)을 통한 공동 학습은 MCD에 미미한 향상을 보였지만, 전반적으로는 제한된 성과를 보였다.

ABSTRACT

In the last two years, there have been numerous papers that have looked into using Deep Neural Networks to replace the acoustic model in traditional statistical parametric speech synthesis. However, far less attention has been paid to approaches like DNN-based postfiltering where DNNs work in conjunction with traditional acoustic models. In this paper, we investigate the use of Recurrent Neural Networks as a potential postfilter for synthesis. We explore the possibility of replacing existing postfilters, as well as highlight the ease with which arbitrary new features can be added as input to the postfilter. We also tried a novel approach of jointly training the Classification And Regression Tree and the postfilter, rather than the traditional approach of training them independently.

연구 동기 및 목표

  • 통계적 파arametric 음성 합성에서 CART에 의해 예측된 MCEP의 오류를 보정하기 위한 RNN 기반 후처리 필터를 조사하는 것.
  • 파형 웨이브릿, 어휘 특징 등 임의의 새로운 특징을 후처리 과정에 민첩하게 통합할 수 있도록 하는 것.
  • 보조좌표 방법(MAC)을 사용해 CART와 RNN 후처리 필터를 별도 학습이 아닌 공동으로 학습하는 것의 탐색.
  • RNN 후처리 필터가 기존의 MLPG와 같은 전통적 후처리 필터를 능가하거나 보완할 수 있는지 평가하는 것.

제안 방법

  • 학습 데이터에서 MCEP 예측을 생성하기 위해 표준 Clustergen 시스템을 학습하고, 이를 RNN 후처리 필터의 입력으로 사용한다.
  • 순차적인 MCEP 평균과 델타를 처리할 수 있도록, 순환 연결을 활용해 시간적 의존성을 모델링하는 RNN 아키텍처를 설계한다.
  • 어휘 특징(예: 음소 및 상태 정보)을 RNN 후처리 필터의 추가 입력으로 도입하여 맥락 인식 보정을 향상시킨다.
  • 보조좌표 방법(MAC)을 적용하여 중간 표현 Z를 보조 변수로 도입함으로써 CART와 RNN 후처리 필터를 공동 최적화한다.
  • 목적 함수를 복합 손실로 설정: E(W,Z;μ) = ||f₂(Z;W) - Y||² + μ||f₁(X;W) - Z||²이며, W와 Z를 번갈아 최소화한다.
  • 스티어티식 경사 하강법을 사용해 번갈아 최적화를 수행하며, 점차 μ를 무한대에 가까이 설정함으로써 제약 조건을 강제한다.

실험 결과

연구 질문

  • RQ1CART에 의한 MCEP 예측에서 RNN 후처리 필터가 스펙트럼 왜곡을 효과적으로 줄일 수 있는가?
  • RQ2RNN 후처리 필터에 어휘 특징을 포함시킬 경우 음성 품질 향상이 측정 가능한가?
  • RQ3MAC를 통한 CART와 RNN 후처리 필터의 공동 학습이 별도 학습보다 더 나은 성능을 낼 수 있는가?
  • RQ4RNN 후처리 필터는 MLPG와 같은 전통적 후처리 필터보다 성능이 뛰어나거나 보완적인가?
  • RQ5RNN 후처리 필터가 기존 후처리 필터(예: MLPG)의 중복된 기능을 어느 정도 학습하는가?

주요 결과

  • RNN 후처리 필터만으로도 기준 CART보다 MCD를 크게 감소시켜 스펙트럼 오류 보정의 효과성을 입증한다.
  • MLPG와 조합했을 때 RNN 후처리 필터는 오직 미미한 향상만을 보이며, 기능적 중복성 또는 최적화되지 않은 상호작용을 시사한다.
  • MAC를 통한 공동 학습은 MCD 감소가 극히 미미하여, SLT의 경우 4.89, RMS의 경우 4.91로 두 번째 반복 후에도 여전히 제한된 성과를 보였다.
  • MAC 알고리즘은 수렴 속도가 느리며, 첫 번째 반복 이후에 더 이상 유의미한 향상이 없어, 과적합 또는 최적화되지 않은 하이퍼파라미터 설정을 시사한다.
  • RNN 후처리 필터는 아키텍처의 대대적인 수정 없이도 어휘 정보와 같은 새로운 특징을 성공적으로 통합할 수 있어 유연성을 입증한다.
  • 초기 결과에 따르면, 과적합 또는 최적 파rameter의 탐색 공간이 너무 넓기 때문에 MAC가 이 프레임워크에서 효과적이지 않을 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.