Skip to main content
QUICK REVIEW

[논문 리뷰] GraphSpeech: Syntax-Aware Graph Attention Network For Neural Speech Synthesis

Rui Liu, Berrak Şişman|arXiv (Cornell University)|2020. 10. 23.
Natural Language Processing Techniques참고 문헌 31인용 수 13
한 줄 요약

GraphSpeech는 문장 수준의 문법적 의존 관계를 모델링하기 위해 문법 인식 그래프 어텐션 네트워크를 사용하는 신경 음성합성 기반의 접근법을 제안한다. 그래프 신경망 프레임워크를 활용해 단어 간 문법적 의존 관계를 그래프 구조화된 표현으로 인코딩하고, 이를 어텐션 메커니즘에 통합함으로써, Transformer TTS보다 뛰어난 스펙트럼 및 억양 품질을 달성한다. MCD는 6.821 dB, RMSE는 1.625 Hz를 기록하여 객관적 평가와 주관적 평가에서 모두 기준 모델을 능가한다.

ABSTRACT

Attention-based end-to-end text-to-speech synthesis (TTS) is superior to conventional statistical methods in many ways. Transformer-based TTS is one of such successful implementations. While Transformer TTS models the speech frame sequence well with a self-attention mechanism, it does not associate input text with output utterances from a syntactic point of view at sentence level. We propose a novel neural TTS model, denoted as GraphSpeech, that is formulated under graph neural network framework. GraphSpeech encodes explicitly the syntactic relation of input lexical tokens in a sentence, and incorporates such information to derive syntactically motivated character embeddings for TTS attention mechanism. Experiments show that GraphSpeech consistently outperforms the Transformer TTS baseline in terms of spectrum and prosody rendering of utterances.

연구 동기 및 목표

  • Transformer TTS가 문장 수준의 문법적 의존 관계를 모델링하는 데에 한계를 보이며, 이로 인해 억양과 스펙트럼 렌더링에 영향을 미친다는 문제를 해결하기 위해.
  • 입력 텍스트를 문법적 그래프로 재구성함으로써 언어학적 문법적 구조를 신경 TTS에 통합하기 위해.
  • 토큰 간의 문법적 관계를 통합하여 어텐션 성능을 향상시키는 문법 인식 그래프 어텐션 메커니즘을 개발하기 위해.
  • 스펙트럼 및 억양 모델링에서 문법 지식을 활용하여 음성 합성 품질을 향상시키기 위해.
  • 기존의 자기 어텐션과 비교했을 때 그래프 기반의 문법 인코딩이 더 자연스럽고 정확한 음성 합성으로 이어지는지 입증하기 위해.

제안 방법

  • 모델은 입력 텍스트에서 의존 구문 분석 트리를 추출하고, 이를 간선 임베딩이 문법적 관계를 나타내는 그래프 구조로 변환하는 Relation Encoder를 사용한다.
  • 그래프 인코더는 다중 헤드 어텐션을 사용하여 토큰 뿐 아니라 그들의 문법적 관계까지도 고려함으로써, 문법 인식 기반의 컨텍스트 모델링을 가능하게 한다.
  • 그래프 인코더는 노드 특징으로 256차원의 문자 임베딩을 사용하고, 6개의 블록과 블록당 4개의 어텐션 헤드를 적용하여 장거리 의존성을 문법적 인도적 편향을 통해 포착한다.
  • 인코더-디코더 아키텍처는 80채널의 멜스펙트로그램 특징을 생성하며, 추론 시 웨이브폼 복원에 Griffin-Lim을 사용한다.
  • 모델은 Adam 옵timizer를 사용하여 학습되며, 학습률 스케줄링은 Transformer와 유사하고, 배치 내 모든 서로 다른 최단 경로를 인코딩하여 계산 효율성을 높인다.
  • 어텐션 메커니즘에 문법 정보를 통합하기 위해 쿼리-키 상호작용을 수정하여 토큰 간의 의미적 및 문법적 가까움을 반영한다.

실험 결과

연구 질문

  • RQ1문장 내 단어 간의 문법적 의존 관계를 모델링하면 신경 음성합성의 품질이 향상되는가?
  • RQ2그래프 신경망 프레임워크를 통해 문법적 구조를 통합하면 TTS의 어텐션 메커니즘에 어떤 영향을 미치는가?
  • RQ3문법 인식 그래프 어텐션 메커니즘은 기존의 자기 어텐션과 비교해 스펙트럼 및 억양 렌더링 품질을 향상시키는가?
  • RQ4GraphSpeech는 인간 수준의 자연스러움에 얼마나 가까이 도달하거나 이를 초월하는가?
  • RQ5그래프 기반의 문법 인코딩은 음향 특징 복원에서 MCD와 RMSE를 감소시키는가?

주요 결과

  • GraphSpeech는 멜스펙트럼 왜곡(MCD)이 6.821 dB로 기준 모델인 Transformer TTS의 8.021 dB보다 유의미하게 낮아, 더 뛰어난 스펙트럼 정밀도를 보였다.
  • 억양 모델링의 평균제곱오차(RMSE)는 GraphSpeech가 1.625 Hz로, Transformer TTS 기준 모델의 1.782 Hz보다 낮아, 더 뛰어난 억양 정확도를 확보했다.
  • 주관적 听음 테스트에서 GraphSpeech는 평균 관점 점수(MOS)가 Transformer TTS를 뛰어나며, 자연스러운 인간 음성과 유사한 성능을 보였다.
  • AB 선호 테스트 결과, 청취자들이 GraphSpeech를 Transformer TTS보다 선호했으며, p-값은 약 2.0×10⁻²⁰로 통계적으로 매우 유의미했다.
  • 문법 인식 그래프 어텐션 메커니즘은 언어적 구조를 효과적으로 모델링하여 더 자연스럽고, 억양과 스펙트럼 품질이 향상된 음성 합성을 이끌었다.
  • GraphSpeech는 Transformer 기반 TTS에서 그래프 신경망 프레임워크를 활용한 문법 인식 어텐션 메커니즘을 처음으로 구현한 모델이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.