[논문 리뷰] Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet
이 논문은 다중 소스 Tacotron과 이중 주의 메커니즘, WaveNet을 사용한 공동 학습 프레임워크를 제안하여 단일 공유 모델 내에서 텍스트-to-음성(TTS)과 음성 변환(VC)을 통합한다. 모델은 텍스트 또는 소스 발화자 스펙트로그램을 입력으로 받아 WaveNet을 통해 고품질 음성을 생성하며, 두 작업 모두에서 경쟁적인 성능을 달성하고, 독립형 모델보다 VC 성능이 향상되었다.
We investigated the training of a shared model for both text-to-speech (TTS) and voice conversion (VC) tasks. We propose using an extended model architecture of Tacotron, that is a multi-source sequence-to-sequence model with a dual attention mechanism as the shared model for both the TTS and VC tasks. This model can accomplish these two different tasks respectively according to the type of input. An end-to-end speech synthesis task is conducted when the model is given text as the input while a sequence-to-sequence voice conversion task is conducted when it is given the speech of a source speaker as the input. Waveform signals are generated by using WaveNet, which is conditioned by using a predicted mel-spectrogram. We propose jointly training a shared model as a decoder for a target speaker that supports multiple sources. Listening experiments show that our proposed multi-source encoder-decoder model can efficiently achieve both the TTS and VC tasks.
연구 동기 및 목표
- 텍스트-to-음성(TTS)과 음성 변환(VC)을 단일 공유 딥 러닝 모델로 통합하기.
- 일련의 작업 전용 모델 설계 및 재학습이 필요로 하는 것을 줄이기 위해 단일 아키텍처가 TTS와 VC 모두를 수행할 수 있도록 하기.
- 공동 학습을 통한 공유 표현 학습과 자료 효율성으로 VC 성능 향상시키기.
- 공유된 아키텍처 및 특징 공학 트렌드로 인해 TTS와 VC 간 이론적 차이가 줄어들었는지 조사하기.
제안 방법
- 두 개의 인코더가 텍스트 또는 소스 발화자 스펙트로그램을 처리하고, 공유 디코더가 멜-스펙트로그램을 예측하는 다중 소스 시퀀스-투-시퀀스 모델을 사용하며, 이중 주의 메커니즘을 적용한다.
- Tacotron 아키텍처를 기반으로 한 공유 디코더를 사용하며, 사전 네트워크, CBHG 모듈, 주의 기반 RNN을 활용해 시퀀스 모델링을 수행한다.
- WaveNet을 보 vocoder로 사용하며, 예측된 멜-스펙트로그램을 조건으로 하여 16kHz에서 μ-law 양자화를 적용한 원시 음성 웨이브포맷을 생성한다.
- TTS 및 VC 데이터의 혼합을 사용해 공동 학습을 수행하며, 학습 중에 적절한 입력 소스를 선택하기 위해 마스킹 메커니즘을 도입한다.
- 제한된 데이터로도 TTS 성능을 향상시키기 위해 사전 학습된 TTS 모델을 타겟 발화자 적응을 위해 미세조정한다.
- 고음질 웨이브포맷을 모델링하기 위해 지수적 확장(dilation)을 가진 30개의 확장 컨볼루션 계층과 스킵 연결을 사용하는 WaveNet 보 vocoder를 적용한다.
실험 결과
연구 질문
- RQ1단일 딥 러닝 모델이 텍스트-to-음성 합성과 음성 변환 작업을 효과적으로 동시에 수행할 수 있는가?
- RQ2TTS와 VC를 함께 학습하면 별도로 학습하는 것보다 두 작업 모두의 성능이 향상되는가?
- RQ3이중 주의 메커니즘을 갖춘 다중 소스 인코더-디코더 아키텍처가 TTS 및 VC 입력 간의 일반화 능력에 어떤 영향을 미치는가?
- RQ4공유 표현 학습이 비병렬 데이터를 사용할 때 VC 품질에 어떤 영향을 미치는가?
- RQ5공유 모델이 경쟁적인 TTS 품질을 달성하면서도 VC 성능 향상을 이룰 수 있는가?
주요 결과
- 제안된 공동 모델은 동일한 아키텍처를 사용해 입력 유형에 따라 TTS 및 VC 작업을 성공적으로 수행한다.
- 하이브리드 VC 시스템은 MOS 측정 기준으로 음성 품질과 발화자 유사도 측면에서 독립형 VC 모델을 능가했다.
- 하이브리드 시스템의 발화자 유사도에 대한 MOS 평가는 독립형 VC 모델보다 유의미하게 높아, 발화자 전달 성능 향상이 확인되었다.
- 하이브리드 모델의 TTS 성능는 독립형 TTS 시스템보다 낮아, VC에 과적합되거나 TTS에 필요한 능력이 부족할 수 있음을 시사한다.
- 결과적으로 공동 학습은 VC 성능 향상에 기여하지만, TTS와 VC 성능를 균형 있게 유지하기 위해 추가적인 아키텍처 조정이 필요하다는 점을 시사한다.
- 제한된 데이터로도 TTS 품질을 향상시키기 위해 사전 학습된 TTS 모델을 타겟 발화자 적응에 활용함으로써 성능 향상이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.