[논문 리뷰] A Deep Learning Approach to Data-driven Parameterizations for Statistical Parametric Speech Synthesis
이 논문은 Mel Log 스펙트럼의 가역적이고 저차원적이며 노이즈에 강건한 표현을 학습하기 위해 테이퍼링된 스택드 디노이징 오토에인커(SDA)를 사용하는 데이터 기반 딥러닝 기반 파arameterization을 제안한다. SDA는 다층퍼셉트론(MLP)을 통해 언래핑되고 미세조정되며, 이후 별도의 인코딩 및 디코딩 네트워크로 분리된다. 이 방법은 경쟁적인 MCD 점수(3.827)를 달성하고, 학습된 표현이 보간 가능한 공간에 위치해 있음을 입증하여 합성 파arameterization의 모든 핵심 요구사항을 충족시킨다.
Nearly all Statistical Parametric Speech Synthesizers today use Mel Cepstral coefficients as the vocal tract parameterization of the speech signal. Mel Cepstral coefficients were never intended to work in a parametric speech synthesis framework, but as yet, there has been little success in creating a better parameterization that is more suited to synthesis. In this paper, we use deep learning algorithms to investigate a data-driven parameterization technique that is designed for the specific requirements of synthesis. We create an invertible, low-dimensional, noise-robust encoding of the Mel Log Spectrum by training a tapered Stacked Denoising Autoencoder (SDA). This SDA is then unwrapped and used as the initialization for a Multi-Layer Perceptron (MLP). The MLP is fine-tuned by training it to reconstruct the input at the output layer. This MLP is then split down the middle to form encoding and decoding networks. These networks produce a parameterization of the Mel Log Spectrum that is intended to better fulfill the requirements of synthesis. Results are reported for experiments conducted using this resulting parameterization with the ClusterGen speech synthesizer.
연구 동기 및 목표
- 멜 페스트럴 계수(MCEPs)가 알려진 한계가 있음에도 불구하고 오랫동안 표준으로 남아 있는 통계적 파arametric 음성 합성의 장기적 한계를 해결하기 위해.
- 가장 핵심적인 네 가지 요구사항인 가역성, 노이즈에 대한 강건성, 저차원성, 보간 가능성 모두를 충족하는 데이터 기반 파arameterization을 개발하기 위해.
- 딥러닝이 수작업으로 설계된 파arameterization인 MCEPs보다 열등한 스펙트럼 표현을 발견할 수 있는지 탐색하기 위해.
- 실제 합성기(ClusterGen)에서 제안된 방법을 평가하고, MCEP 기반 베이스라인과 정량적·정성적으로 비교하기 위해.
제안 방법
- 입력에 노이즈 주입을 통해 손상된 복원을 학습하는 방식으로, Mel Log 스펙트럼 특징에 대해 스택드 디노이징 오토에인커(SDA)를 훈련한다.
- 사전 훈련된 SDA 가중치를 초기화로 사용하여, 출력층에서 원본 입력을 복원하도록 미세조정되는 다층퍼셉트론(MLP)을 학습한다.
- 훈련된 MLP를 언래핑하여 인코더(입력에서 저차원 코드로 매핑)와 디코더(코드에서 스펙트럼으로 복원)로 분리된 두 개의 별도의 하위망으로 나눈다.
- 결과적으로 얻어진 인코딩은 가역성, 저차원성, 노이즈에 강건성, 보간 가능성 등 합성에 핵심적인 성질을 갖도록 설계된다.
- SLT 음성으로 ClusterGen 합성기를 사용하여 MCD와 주관적 품질을 MCEP 기반 베이스라인과 비교해 평가한다.
- 층수와 너비의 영향을 조사하기 위해 다양한 층 차원을 가진 여러 SDA 아키텍처를 훈련한다.
실험 결과
연구 질문
- RQ1딥러닝 모델이 가역성, 노이즈에 대한 강건성, 저차원성, 보간 가능성라는 합성에 핵심적인 네 가지 요구사항을 모두 충족하는 데이터 기반 파arameterization을 학습할 수 있는가?
- RQ2DNN 기반 파arameterization의 성능은 MCEP 표준 표현에 비해 스펙트럼 복원(MCD)과 주관적 품질 측면에서 어떻게 비교되는가?
- RQ3네트워크의 깊이와 너비는 학습된 파arameterization의 품질에 어떤 영향을 미치는가?
- RQ4학습된 표현이 클러스터링 기반 합성 시스템(예: ClusterGen)에 필수적인 보간 기능을 효과적으로 지원할 수 있는가?
- RQ5좋은 MCD 점수에도 불구하고 DNN 기반 접근법이 주관적으로 성능이 열 劣한 이유는 무엇이며, 목적 함수의 선택이 어떤 역할을 하는가?
주요 결과
- 제안된 DNN 기반 파arameterization은 SLT 음성에서 멜-페스트럴 왜곡(MCD) 점수 3.827을 기록하여 MCEP 기반 베이스라인과 경쟁 가능하다.
- 이 방법은 성공적으로 가역적이고 노이즈에 강건한 표현을 생성하였으며, SDA의 사전 훈련 덕분에 저차원 특징을 안정적으로 학습할 수 있었다.
- 학습된 인코딩은 보간 가능한 공간에 위치해 있음을 입증하였으며, 이는 ClusterGen 합성기가 클러스터링 기반 접근법에서 이를 효과적으로 활용할 수 있음을 시사한다.
- 더 깊은 네트워크(예: 200x175x125x75x50)가 얕은 네트워크보다 성능이 뛰어나며, 깊이가 증가함에 따라 MCD는 4.315에서 3.827로 감소하여 깊이의 강력한 이점이 있음을 보여준다.
- 좋은 MCD에도 불구하고 주관적 품질은 MCEPs보다 약간 열 劣했으며, 이는 훈련 중에 합성 최적화 목적 함수가 부재했기 때문일 수 있다.
- 사전 훈련 중 가우시안 노이즈를 사용한 경우 기존의 제로 마스킹 노이즈보다 성능이 열 劣했으며, 이는 노이즈 모델이 학습에 상당한 영향을 미친다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.