Skip to main content
QUICK REVIEW

[논문 리뷰] SyntaSpeech: Syntax-Aware Generative Adversarial Text-to-Speech

Zhenhui Ye, Zhou Zhao|arXiv (Cornell University)|2022. 04. 25.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

SyntaSpeech는 문법적 구조 인식 기능을 갖춘 비자기적 텍스트-to-음성 모델로, 의존성 기반 그래프 인코더를 통해 트리 구조적 문법 정보를 통합하여 발화 모델링을 향상시킨다. PortaSpeech의 지속시간 및 톤 예측을 문법적 특징으로 향상시키고, 플로우 기반 포스트넷을 다중 길이 적대적 훈련으로 대체함으로써 영어, 중국어 및 다중 화자 데이터셋에서 음성 자연성과 발화 표현력 측면에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

The recent progress in non-autoregressive text-to-speech (NAR-TTS) has made fast and high-quality speech synthesis possible. However, current NAR-TTS models usually use phoneme sequence as input and thus cannot understand the tree-structured syntactic information of the input sequence, which hurts the prosody modeling. To this end, we propose SyntaSpeech, a syntax-aware and light-weight NAR-TTS model, which integrates tree-structured syntactic information into the prosody modeling modules in PortaSpeech \cite{ren2021portaspeech}. Specifically, 1) We build a syntactic graph based on the dependency tree of the input sentence, then process the text encoding with a syntactic graph encoder to extract the syntactic information. 2) We incorporate the extracted syntactic encoding with PortaSpeech to improve the prosody prediction. 3) We introduce a multi-length discriminator to replace the flow-based post-net in PortaSpeech, which simplifies the training pipeline and improves the inference speed, while keeping the naturalness of the generated audio. Experiments on three datasets not only show that the tree-structured syntactic information grants SyntaSpeech the ability to synthesize better audio with expressive prosody, but also demonstrate the generalization ability of SyntaSpeech to adapt to multiple languages and multi-speaker text-to-speech. Ablation studies demonstrate the necessity of each component in SyntaSpeech. Source code and audio samples are available at https://syntaspeech.github.io

연구 동기 및 목표

  • 비자기적 TTS 모델이 문법적 구조 인식 부족으로 인해 표현적인 발화를 모델링하는 데 한계를 가진다는 문제를 해결하기 위해.
  • 의존성 분석을 통해 트리 구조적 문법 정보를 비자기적 TTS 프레임워크의 발화 모델링 파이프라인에 통합하기 위해.
  • 플로우 기반 포스트넷을 다중 길이 적대적 훈련으로 대체하여 훈련 파이프라인을 단순화하고 추론 속도를 향상시키기 위해.
  • 다양한 언어와 화자 조건에서 텍스트-to-음성 합성에 대한 일반화 성능을 입증하기 위해.

제안 방법

  • 입력 문장의 의존성 트리에서 문법 그래프를 구성하여 단어를 노드로, 문법 관계를 간선으로 표현하기 위해.
  • 그래프 신경망(GCN 기반 인코더)을 사용해 그래프에서 문법적 특징을 집계하여 단어 수준의 문법 인코딩을 생성하기 위해.
  • PortaSpeech의 지속시간 예측기와 변동성 생성기의 입력에 문법 인코딩을 통합하여 발화 예측 성능을 향상시키기 위해.
  • PortaSpeech의 플로우 기반 포스트넷을 다중 길이 적대적 디스커미너로 대체하여 음성의 현실감을 향상시키고 추론 속도를 높이기 위해.
  • 다양한 수신 영역 크기에서 적대적 손실을 사용해 훈련하여 웨이브폼 품질과 일반화 능력을 향상시키기 위해.
  • 지속시간, 톤, 에너지 예측을 분리하여 발화를 분리함으로써, 문법적 맥락이 강화된 분리된 발화 모델링을 활용하기 위해.

실험 결과

연구 질문

  • RQ1트리 구조적 문법 정보는 비자기적 텍스트-to-음성 시스템의 발화 모델링을 향상시키는가?
  • RQ2문법 그래프 인코딩을 통합함으로써 합성 음성의 품질과 표현력은 어떻게 영향을 받는가?
  • RQ3플로우 기반 포스트넷을 다중 길이 적대적 훈련으로 대체하면 음성 품질은 향상되고, 훈련은 단순화되며 추론 속도는 빨라지는가?
  • RQ4제안된 모델은 다양한 언어와 다중 화자 설정에서 일반화 가능한가?

주요 결과

  • LJSpeech 데이터셋에서 SyntaSpeech는 주관적 평가에서 MOS 4.13 ± 0.08을 기록하여 FastSpeech2(3.94 ± 0.09)와 PortaSpeech(4.02 ± 0.08)를 모두 초월한다.
  • 비영어, 음운어인 Biaobei 중국어 데이터셋에서 SyntaSpeech는 MOS 4.19 ± 0.07을 기록하여 뛰어난 성능을 입증한다.
  • 다중 화자 LibriTTS 벤치마크에서 SyntaSpeech는 MOS 4.10 ± 0.08을 기록하여 화자 간 변동성에 대한 강건성을 보였다.
  • 제거 실험 결과, 문법 그래프 인코더를 제거하면 CMOS-P가 최대 0.188점 감소함을 확인하여, 이가 발화 모델링에서 핵심적인 역할을 한다는 것을 입증한다.
  • 다중 길이 적대적 훈련은 플로우 기반 포스트넷 대비 LJSpeech에서 CMOS-Q를 0.071점 향상시켰으며, 발화 품질에 유의미한 하락이 없었다.
  • 완전 그래프를 문법 그래프로 대체할 경우 LJSpeech에서 CMOS-P가 0.160점 감소함을 확인하여, 문법적 구조는 단순한 그래프 연결성 이상의 중요성을 지닌다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.