[논문 리뷰] Controllable neural text-to-speech synthesis using intuitive prosodic features
이 논문은 문장 수준의 음성 특징—주파수, 주파수 범위, 지속시간, 에너지, 스펙트럼 기울기—를 조건으로 삼아 순서에서 순서로 모델을 조절함으로써 음성 강조를 직관적이고 분리 가능한 방식으로 제어할 수 있는 통합형 엔드 투 엔드 신경 TTS 시스템을 제안한다. 이 모델은 자연스러움 수준이 기준 모델(4.26)과 유사한 수준(4.23)을 달성하면서도 직접적인 음성 강조 차원 조작을 통해 다양한 발화 스타일을 가능하게 한다.
Modern neural text-to-speech (TTS) synthesis can generate speech that is indistinguishable from natural speech. However, the prosody of generated utterances often represents the average prosodic style of the database instead of having wide prosodic variation. Moreover, the generated prosody is solely defined by the input text, which does not allow for different styles for the same sentence. In this work, we train a sequence-to-sequence neural network conditioned on acoustic speech features to learn a latent prosody space with intuitive and meaningful dimensions. Experiments show that a model conditioned on sentence-wise pitch, pitch range, phone duration, energy, and spectral tilt can effectively control each prosodic dimension and generate a wide variety of speaking styles, while maintaining similar mean opinion score (4.23) to our Tacotron baseline (4.26).
연구 동기 및 목표
- 엔드 투 엔드 신경 TTS 시스템에서 명시적인 음성 강조 제어의 부재로 인해 일반적으로 평균적인 음성 강조 스타일을 생성하는 문제를 해결하기 위해.
- 언어적 내용에서 음성 강조를 분리함으로써 동일한 텍스트에 대해 다양한 발화 스타일을 가능하게 하기 위해.
- 잠재 임베딩이 아닌 청각적으로 의미 있는 분리된 음성 특징 기반의 음성 강조 제어 메커니즘을 개발하기 위해.
- 비전문가가 직관적으로 음성 강조를 조절할 수 있도록 하여 음성 어시스턴트 응용 프로그램의 사용성을 향상시키기 위해.
- 기록 조건과 배경 잡음에 영향을 받지 않는 특징을 사용하여 강건성을 확보하기 위해.
제안 방법
- 입력 텍스트에서 유도된 예측된 음성 강조 특징(주파수, 주파수 범위, 음소 지속시간, 에너지, 스펙트럼 기울기)을 조건으로 삼아 타코트론 스타일의 인코더-디코더 모델을 조절한다.
- 모델이 인코더 출력에서 이러한 음성 강조 특징을 직접 예측하도록 훈련시켜 텍스트에서 음성 강조를 엔드 투 엔드로 학습할 수 있도록 한다.
- 각 특징이 독립적이고 제어 가능한 방식으로 예측되는 공유 잠재 공간을 음성 강조 모델링에 사용한다.
- 각 음성 강조 특징에 대해 [-1, 1] 범위의 바이어스 파rameter를 적용하여 발화 스타일에 대한 직관적 제어를 가능하게 한다.
- 텍스트와 음성 강조 특징이 정렬된 대규모 데이터셋(52시간 분량의 음성)을 사용하여 모델을 훈련시킨다.
- 목표값과 생성된 음성 강조 특징 간의 정렬을 장려하는 수정된 손실 함수를 사용하여 제어 정밀도를 향상시킨다.
실험 결과
연구 질문
- RQ1잠재 임베딩 대신 청각적으로 의미 있는 직관적인 음성 특징을 사용하여 음성 강조를 효과적으로 제어할 수 있는가?
- RQ2명시적인 특징을 통한 음성 강조 제어가 표준 타코트론 기준 모델과 비교해 음성 자연스러움을 유지하거나 향상시키는가?
- RQ3음성 전문 지식이 없는 사용자가 음성 강조를 위한 직관적인 제어 수단을 통해 더 표현적 또는 적절한 합성 음성을 생성할 수 있는 정도는 어느 정도인가?
- RQ4주파수, 지속시간, 에너지의 극단적 값에서도 음성 강조 제어의 강건성은 어느 정도인가?
- RQ5참고 음성 자료나 수동 레이블링 없이도 모델이 청각적으로 구분 가능하고 사용 가능한 다양한 발화 스타일을 생성할 수 있는가?
주요 결과
- 제안된 모델은 평균 평가 점수(MOS) 4.23을 달성하였으며, 이는 타코트론 기준 모델(4.26)과 거의 동일한 자연스러움 수준을 나타낸다.
- 객관적 분석 결과, 목표 음성 강조 특징 값과 합성 음성에서 측정된 값 간에 강한 상관관계가 확인되었다.
- 청취자들은 음성 강조가 수정된 합성 문장의 63%에서 선호했으며, 44%의 경우 원본 스튜디오 녹음본보다도 선호했다.
- 극단적인 음성 강조 설정(예: 주파수 바이어스 = 1.0 또는 낮은 에너지)은 지속적인 고주파 또는 속삭임 같은 음성으로 열악한 결과를 초래하여 음성 생성의 생리학적 한계를 보여주었다.
- 모델은 각 음성 강조 차원에 대해 분리되고 독립적인 제어를 가능하게 하여 발화 스타일을 직관적으로 조정할 수 있도록 했다.
- 비전문가가 더 표현적이고 맥락에 적절한 음성을 생성할 수 있도록 하여 음성 어시스턴트 응용 프로그램에서 실용적인 유용성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.