Skip to main content
QUICK REVIEW

[논문 리뷰] PnG BERT: Augmented BERT on Phonemes and Graphemes for Neural TTS

Jia Ye, Heiga Zen|arXiv (Cornell University)|2021. 03. 28.
Speech Recognition and Synthesis참고 문헌 29인용 수 5
한 줄 요약

이 논문은 신경 TTS의 자연스러움과 발음 정확도를 향상시키기 위해 음소와 문자 표현을 동시에 처리하고 단어 수준의 정렬을 수행하는 자기지도 학습 기반의 BERT 기반 인코더인 PnG BERT를 제안한다. 대규모 텍스트 코퍼스에서의 대규모 사전 훈련을 통해 프로소디와 발음 정확도를 향상시키며, 주관적 평가에서 인간 수준의 자연스러움을 달성했으며, 합성 음성과 전문가가 녹음한 녹음본 간에 유의미한 선호도 차이가 없었다.

ABSTRACT

This paper introduces PnG BERT, a new encoder model for neural TTS. This model is augmented from the original BERT model, by taking both phoneme and grapheme representations of text as input, as well as the word-level alignment between them. It can be pre-trained on a large text corpus in a self-supervised manner, and fine-tuned in a TTS task. Experimental results show that a neural TTS model using a pre-trained PnG BERT as its encoder yields more natural prosody and more accurate pronunciation than a baseline model using only phoneme input with no pre-training. Subjective side-by-side preference evaluations show that raters have no statistically significant preference between the speech synthesized using a PnG BERT and ground truth recordings from professional speakers.

연구 동기 및 목표

  • 음소 중심 또는 문자 중심의 인코더가 신경 TTS에서 프로소디와 발음 모호성 문제를 해결하는 데 한계를 보이는 것을 해결하기 위해.
  • 단어 수준의 정렬을 통해 음소와 문자 표현을 동시에 모델링하여 TTS에서 자연어 이해를 향상시키기 위해.
  • 대규모 텍스트 코퍼스에서 자기지도 학습 기반의 마스크된 언어 모델링을 통해 통합 인코더의 효과적인 사전 훈련을 가능하게 하기 위해.
  • 사전 훈련된 PnG BERT 인코더가 신경 TTS 시스템에서 음성의 자연스러움과 발음 정확도를 크게 향상시킨다는 것을 입증하기 위해.
  • 측정된 측면 비교 테스트를 통해 전문가가 녹음한 녹음본과 유사한 청취자 수준의 음성 품질을 달성하는 것을 목표로 하기 위해.

제안 방법

  • PnG BERT는 BERT를 확장하여 두 입력 세그먼트를 처리한다: IPA 음소의 시퀀스와 서브워드 유닛(문자)의 시퀀스로, 둘 다 동일한 임bedding 공간을 공유한다.
  • 모델은 사인파 함수에서 유도된 단어 위치 임베딩을 도입하여 음소와 문자 간의 단어 수준 정렬을 명시적으로 모델링한다.
  • 모델은 대규모 텍스트 코퍼스에서 마스크된 언어 모델링(MLM) 목적함수를 사용하여 사전 훈련되며, 사전 훈련 중 음소-문자 정렬을 유지하기 위해 새로운 전략인 단어 수준 일致성 마스킹을 도입한다.
  • 사전 훈련 중, 모델은 문맥 기반으로 마스킹된 음소와 문자를 예측하며, 양 모odal 간에 공유되는 임베딩을 사용한다.
  • 사전 훈련된 PnG BERT 인코더는 주어진 신경 TTS 파이프라인에서 엔드 투 엔드로 미세조정되며, 어텐션 기반 및 지속시간 기반 TTS 아키텍처 양쪽 모두와 호환된다.
  • 모델은 음소와 문자에 대해 동일한 토큰 ID 공간을 사용하여 양방향 표현 학습을 가능하게 하면서도 표준 BERT 아키텍처와의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1단어 수준의 정렬을 통해 음소와 문자 표현을 동시에 모델링하면 신경 TTS에서 프로소디와 발음 정확도가 향상되는가?
  • RQ2이중 모달 BERT 아키텍처를 사용해 대규모 텍스트 코퍼스에서 자기지도 학습을 수행하면 합성 음성의 일반화 능력과 자연스러움이 향상되는가?
  • RQ3음소 또는 문자 입력만을 사용하는 모델 대비 PnG BERT는 발음 오류를 어느 정도 감소시키는가?
  • RQ4PnG BERT 기반 TTS 시스템은 전문가가 녹음한 녹음본과 비슷한 청취자 평가 품질을 달성할 수 있는가?
  • RQ5사전 훈련 중 단어 수준의 정렬을 고려한 마스킹 전략이 무작위 또는 일관성 없는 마스킹 전략 대비 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 신경 TTS 모델에 사전 훈련된 PnG BERT를 사용함으로써 음성의 자연스러움이 크게 향상되었으며, 평균 평가 점수(MOS)는 4.47 ± 0.05로 전문가 녹음본과 동일한 성능을 보였다.
  • 주관적 측면 비교 평가에서 PnG BERT를 사용해 합성된 음성과 전문가가 녹음한 기준 녹음본 간에 통계적으로 유의미한 선호도 차이가 없었다.
  • 절단 실험 결과, 사전 훈련과 단어 수준 정렬이 핵심 요소임을 확인할 수 있었으며, 사전 훈련이 없는 모델은 긴 입력에 대해 베이스라인보다 성능이 열 劣한 것으로 나타나 일반화 능력이 열 劣한 것으로 나타났다.
  • 가장 우수한 성능을 보인 PnG BERT 버전은 단어 수준 일관성 마스킹을 사용했으며, 이는 사전 훈련 중 G2P 및 P2G 정확도가 가장 높았고, 이는 TTS 성능 향상과 관련이 있었다.
  • 평가자들의 피드백을 통해 프로소디와 발음 측면에서 베이스라인 모델보다 우수한 스트레스, 어조 제어 및 자연스럽지 않은 왜곡 감소를 확인할 수 있었다.
  • 놀랍게도, 사전 훈련 중 G2P/P2G 정확도가 가장 높았던 모델이 TTS 성능에서 가장 우수하지는 않았다. 이는 주로 G2P 변환 정확도가 아니라 언어 이해 능력 향상이 주요 이점임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.