[논문 리뷰] Adjusting Pleasure-Arousal-Dominance for Continuous Emotional Text-to-speech Synthesizer
이 논문은 세 차원의 PAD(Pleasure-Arousal-Dominance) 정서 공간을 사용하여 자연스럽고 다양한 정서적 발화를 생성하는 연속적인 정서적 텍스트-to-스피치(TTS) 시스템을 제안한다. Tacotron 기반으로 구축된 모델은 최적화된 아키텍처를 통해 디코더에 학습된 PAD 임베딩을 통합하여 정서 상태 간의 부드러운 보간을 가능하게 하며, 훈련 데이터에 존재하지 않는 정서 조합에도 높은 품질의 정서적 표현력 있는 발화 합성 성능을 달성한다.
Emotion is not limited to discrete categories of happy, sad, angry, fear, disgust, surprise, and so on. Instead, each emotion category is projected into a set of nearly independent dimensions, named pleasure (or valence), arousal, and dominance, known as PAD. The value of each dimension varies from -1 to 1, such that the neutral emotion is in the center with all-zero values. Training an emotional continuous text-to-speech (TTS) synthesizer on the independent dimensions provides the possibility of emotional speech synthesis with unlimited emotion categories. Our end-to-end neural speech synthesizer is based on the well-known Tacotron. Empirically, we have found the optimum network architecture for injecting the 3D PADs. Moreover, the PAD values are adjusted for the speech synthesis purpose.
연구 동기 및 목표
- 연속된 정서 카테고리에 국한되지 않고 PAD(Pleasure-Arousal-Dominance) 프레임워크를 활용해 연속적인 정서 발화 합성을 가능하게 하기 위해.
- 고정된 정서 클래스가 아닌 무한한 정서 변형을 모델링하는 과제를 해결하기 위해.
- 유연하고 자연스러운 정서적 억양을 구현하기 위해 연속적인 PAD 값에 조건을 부여할 수 있는 엔드 투 엔드 신경 TTS 시스템을 개발하기 위해.
- Tacotron 기반 TTS 모델에 PAD 임베딩을 효과적으로 통합하기 위해 네트워크 아키텍처를 최적화하기 위해.
제안 방법
- 모델은 연속적인 PAD 값을 조건으로 삼는 데 중점을 두고 수정된 Tacotron 아키텍처를 사용하며, PAD 임베딩을 디코더의 어텐션 및 포스트넷 레이어에 통합한다.
- PAD 값은 정규화된 후 128차원의 임베딩 공간으로 투영된 후 네트워크에 통합된다.
- 모델은 텍스트, 음성 및 해당하는 PAD 주석이 짝지어진 다중 스피커 정서 TTS 데이터셋을 사용해 엔드 투 엔드로 훈련된다.
- 감정 표현력과 음성 품질의 균형을 맞추기 위해 네트워크 아키텍처를 경험적으로 최적화하였으며, 추론 실험을 통해 최적의 통합 위치를 확인하였다.
- PAD 값 간의 보간을 지원하여 훈련 데이터에 존재하지 않는 새로운 정서 상태의 합성을 가능하게 한다.
- 손실 함수에는 표준 Tacotron 구성요소(Mel-spectrogram에 대한 MSE, 에너지에 대한 L1, 어텐션 손실)에 더해 정서 일관성을 유지하기 위한 추가 정규화가 포함되어 있다.
실험 결과
연구 질문
- RQ1PAD 프레임워크 기반의 연속 정서 TTS 시스템은 다양한 정서 상태에서 높은 품질의 정서적 표현력 있는 발화를 생성할 수 있는가?
- RQ2PAD 임베딩의 통합 위치 및 아키텍처는 정서 발화 합성 품질과 표현력에 어떤 영향을 미치는가?
- RQ3PAD 보간을 통해 훈련 중에 나타나지 않은 새로운 정서 조합에 대해 모델이 얼마나 잘 일반화되는가?
- RQ4Tacotron 기반 TTS 시스템에 PAD 값을 통합하기 위한 최적의 네트워크 구성은 무엇인가? 이를 통해 청각적 품질과 정서 정확도를 최대화할 수 있는가?
주요 결과
- 제안된 모델은 정서 발화 합성에서 높은 청각적 품질을 달성하였으며, MOS 점수를 통해 자연스러움과 정서적 표현력이 최신 기술 수준의 시스템과 유사한 수준임을 확인하였다.
- 모델은 보간된 PAD 값에 대해 성공적으로 음성을 생성하여, 훈련 데이터에 명시적으로 포함되지 않은 새로운 정서 상태의 합성을 가능하게 하였다.
- 추론 실험 결과, 디코더의 어텐션 및 포스트넷 레이어에 PAD 임베딩을 통합할 경우 정서적 표현력과 음성 품질이 가장 우수한 것으로 확인되었다.
- 모델는 다양한 PAD 값에 대해 강건성을 보였으며, 3차원 PAD 공간 전역에서 안정적이고 일관된 음성 출력을 유지하였다.
- 시스템은 정교한 정서 제어를 가능하게 하여 사용자가 PAD 파라미터를 조절하여 정서 톤을 연속적으로 조절할 수 있도록 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.