[논문 리뷰] Review of end-to-end speech synthesis technology based on deep learning
이 논문은 엔드 투 엔드 딥 러닝 기반 텍스트 투 스피치(TTS) 시스템을 검토하며, 텍스트 프론트엔드, 음성 모델, 보코더라는 세 핵심 구성요소를 분석하고 설계 초점을 기준으로 방법을 비교한다. 인간과 유사한 음성에 가까운 최첨단 성능을 강조하며, 세밀한 스타일 제어, 비지도 표현 학습, 완전한 엔드 투 엔드 훈련, 이미지 생성 및 ASR/NMT에서의 교차 작업 전이 등 향후 방향성을 밝힌다.
As an indispensable part of modern human-computer interaction system, speech synthesis technology helps users get the output of intelligent machine more easily and intuitively, thus has attracted more and more attention. Due to the limitations of high complexity and low efficiency of traditional speech synthesis technology, the current research focus is the deep learning-based end-to-end speech synthesis technology, which has more powerful modeling ability and a simpler pipeline. It mainly consists of three modules: text front-end, acoustic model, and vocoder. This paper reviews the research status of these three parts, and classifies and compares various methods according to their emphasis. Moreover, this paper also summarizes the open-source speech corpus of English, Chinese and other languages that can be used for speech synthesis tasks, and introduces some commonly used subjective and objective speech quality evaluation method. Finally, some attractive future research directions are pointed out.
연구 동기 및 목표
- 최근 모델링, 훈련 및 추론 분야의 발전에 중점을 두어 엔드 투 엔드 딥 러닝 기반 TTS 기술에 대한 체계적인 리뷰를 제공하는 것.
- 설계 및 성능 기준으로 텍스트 프론트엔드, 음성 모델, 보코더라는 TTS의 세 주요 구성요소 간의 방법을 분석하고 비교하는 것.
- TTS 연구를 위한 공개된 多어휘 음성 코퍼스와 표준 평가 지표를 요약하는 것.
- 스타일 제어, 표현 학습, 완전한 엔드 투 엔드 프레임워크 등 TTS 분야의 주요 과제와 향후 연구 방향을 규명하는 것.
- 이미지 생성, 기계 번역, 자동 음성 인식 등 관련 분야의 기술을 전이하여 TTS 성능과 데이터 효율성을 향상시킬 수 있는 잠재력을 탐색하는 것.
제안 방법
- 텍스트 프론트엔드(예: 음소 기반, 서브워드, 엔드 투 엔드 토큰화), 음성 모델링(예: Tacotron, FastSpeech, ClariNet), 보코더 설계(예: WaveNet, WaveGlow, WaveNet 기반 순차적 또는 플로우 기반 모델)에 중점을 두어 TTS 방법을 분류하고 비교한다.
- 긴 범위의 의존성을 모델링하기 위해 RNN, Transformer 및 자기주의 주의 메커니즘을 포함한 딥 네트워크의 사용을 검토한다.
- 보코더의 조건 입력으로서의 중간 표현(예: 멜 스펙트로그램, 원시 웨이브폼, 언어적 특징)의 역할을 분석한다.
- 자기순차적 및 플로우 기반 생성 모델을 포함한 보코더에서의 정규화 플로우와 적대적 훈련의 역할을 검토하여 고해상도 음성 생성을 가능하게 한다.
- TTS와 ASR, 스피커 임베딩, 감정 인식 모델을 통합하여 다중 작업 학습 및 지식 정복을 수행하는 방법을 분석한다.
- 대규모 수동으로 태깅된 음성-텍스트 쌍에 대한 의존도를 줄이기 위해 비지도 표현 학습 및 메타학습을 활용하는 것을 제안한다. 특히 저자원 언어에 대해 유용하다.
실험 결과
연구 질문
- RQ1텍스트 프론트엔드, 음성 모델, 보코더의 다양한 아키텍처가 엔드 투 엔드 TTS 시스템의 품질과 효율성에 어떻게 기여하는가?
- RQ2현재 TTS 시스템이 단어 또는 어구 수준에서 감정, 억양, 리듬과 같은 세밀한 음성 스타일을 모델링하는 데 겪는 주요 한계는 무엇인가?
- RQ3비지도 또는 자기지도 표현 학습이 대규모 수동 태깅된 음성-텍스트 데이터셋이 필요한 정도를 어느 정도 줄일 수 있는가?
- RQ4직접 원시 웨이브폼으로 매핑하는 완전한 엔드 투 엔드 TTS 모델이 중간 음성 특징을 포함하는 모듈식 파이프라인을 능가할 수 있는가?
- RQ5이미지 생성, 기계 번역, 자동 음성 인식 분야의 기술을 어떻게 변형하여 TTS 성능과 데이터 효율성을 향상시킬 수 있는가?
주요 결과
- 딥 러닝 기반 최첨단 엔드 투 엔드 TTS 모델은 자연스러움과 이해 가능성 측면에서 인간의 음성과 거의 구분되지 않는 음성을 합성할 수 있다.
- Tacotron 2 및 WaveNet 등의 모델은 표준 벤치마크에서 인간 수준의 성능에 가까운 MOS(Mean Opinion Score) 값을 기록하여 높은 청취적 품질을 달성한다.
- Transformer 기반 TTS 모델에서 주의 메커니즘과 잔차 연결을 통합함으로써 RNN 기반 모델 대비 정렬 성능 향상과 훈련 불안정성 감소를 달성한다.
- 정규화 플로우 기반 보코더(예: WaveGlow)와 자기순차적 모델(예: WaveNet)은 높은 추론 속도를 유지하면서도 음성 품질을 크게 향상시킨다.
- 진전이 있었음에도 불구하고, 현재 시스템은 훈련 데이터의 제한과 부족한 태깅으로 인해 감정 및 억양과 같은 세밀한 음성 스타일 제어에 여전히 어려움을 겪고 있다.
- 저자원 언어에 대해 충분한 텍스트-음성 쌍 데이터가 부족하여 대부분의 최첨단 시스템이 영어 및 중국어에 국한되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.