[논문 리뷰] Feature reinforcement with word embedding and parsing information in neural TTS
이 논문은 신경 TTS에서 음소 시퀀스, 사전 훈련된 단어 임베딩, 문법 구문 분석 정보를 다수 수준의 입력으로 통합하여 모델의 일반화 능력과 견고성을 향상시키는 기능 강화 방법을 제안한다. 다중 입력 인코더를 통해 이러한 맥락 민감한 특징을 결합함으로써, 도메인 외 텍스트에 대해서도 기록 품질에 근접한 음성 성능을 달성하였으며, MOS는 4.33으로 상승하고 진단 테스트에서 자연스러움 비율이 최대 9.09% 향상되었다.
In this paper, we propose a feature reinforcement method under the sequence-to-sequence neural text-to-speech (TTS) synthesis framework. The proposed method utilizes the multiple input encoder to take three levels of text information, i.e., phoneme sequence, pre-trained word embedding, and grammatical structure of sentences from parser as the input feature for the neural TTS system. The added word and sentence level information can be viewed as the feature based pre-training strategy, which clearly enhances the model generalization ability. The proposed method not only improves the system robustness significantly but also improves the synthesized speech to near recording quality in our experiments for out-of-domain text.
연구 동기 및 목표
- 도메인 외 텍스트를 처리할 때 신경 TTS 시스템의 일반화 능력이 떨어지는 문제를 해결하기 위해.
- 알 수 없는 또는 도메인 불일치 텍스트 입력에 대해 음성의 자연스러움과 이해 가능성 향상을 위해.
- 사전 훈련된 언어학적 특징(단어 임베딩 및 구문 분석)이 성능 향상을 위해 특징 기반 사전 훈련의 형태로 기능할 수 있는지 탐색하기 위해.
- 단어 수준과 문장 수준의 언어학적 정보가 TTS의 견고성과 품질 향상에 어떻게 상호보완적인 역할을 하는지 평가하기 위해.
제안 방법
- 이 방법은 세 가지 수준의 입력을 처리하는 다중 입력 인코더를 사용한다: 음소 시퀀스, 사전 훈련된 단어 임베딩, 스탠포드 파서에서 유도된 문법 구문 트리.
- 단어 임베딩은 대규모 텍스트에서 사전 훈련된 NMT 모델에서 유도되며, 의미적 및 맥락 정보를 반영한다.
- 문법적 구조는 스탠포드 파서를 사용해 추출되며, 문법적 역할과 어구 경계 정보를 제공한다.
- 이러한 입력들은 별도의 서브넷을 통해 처리된 후 통합된 어텐션 메커니즘과 WaveNet 보이서를 갖춘 디코더를 공유한다.
- 모델은 시퀀스에서 시퀀스 프레임워크를 사용해 엔드 투 엔드로 훈련되며, 어텐션을 통해 텍스트와 멜 스펙트로그램 출력을 정렬한다.
- 이 접근법은 텍스트 토카트론2의 재현 구현을 기반으로 하며, 문자 수준 입력 대신 음소 수준 입력을 사용한다.
실험 결과
연구 질문
- RQ1단어 임베딩과 문법 구문 분석 정보의 통합이 도메인 외 텍스트에서 신경 TTS 성능 향상에 기여하는가?
- RQ2단어 수준과 문장 수준의 특징은 자연스러움과 이해 가능성 향상에 어떻게 비교되는가?
- RQ3이러한 특징들이 모델 일반화 향상에 특징 기반 사전 훈련의 형태로 얼마나 기여하는가?
- RQ4단어 임베딩과 구문 정보는 프로소디와 발음 정확도에 상호보완적인 효과를 가지는가?
주요 결과
- 제안된 방법은 도메인 외 텍스트에서 MOS 4.33을 달성하여 기준 모델(4.17)보다 유의미하게 향상되었고, 기록 품질(4.44)에 근접하였다.
- 단어 임베딩과 구문 정보를 모두 추가함으로써 진단 이해 가능성 테스트에서 자연스러움 비율이 9.09%p 상승하여 95.45%에 도달하였다.
- 구문 정보만을 사용할 경우 이해 가능한 비율이 7.46%p, 자연스러움 비율이 8.77%p 향상되어 단어 임베딩만 사용하는 것보다 뛰어난 성능을 보였다.
- 단어 임베딩과 구문 정보의 조합이 가장 높은 성능을 보였으며, 이는 프로소디와 발음에 대해 상호보완적인 이점을 제공함을 시사한다.
- 평가자들은 두 특징을 모두 사용했을 때 더 자연스러운 휴지와 향상된 프로소디를 가진 합성 음성을 보고했다.
- 결과적으로, 대규모 NLP 모델에서 유도된 사전 훈련된 언어학적 특징이 알 수 없는 도메인에 대해 신경 TTS의 견고성과 품질 향상에 효과적으로 기여할 수 있음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.