Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability

Rui Liu, Berrak Şişman|arXiv (Cornell University)|2021. 04. 03.
Speech Recognition and Synthesis참고 문헌 30인용 수 5
한 줄 요약

이 논문은 강화학습 기반의 프레임워크인 i-ETTS를 제안하며, 음성 정서 인식(SER) 모델과의 상호작용을 통해 음성 출력을 반복적으로 최적화함으로써 정서적 텍스트-음성 합성(ETTS)을 향상시킨다. SER 정확도를 기반으로 한 보상 함수를 사용한 정책 그래디언트 훈련을 통해 i-ETTS는 82.8%의 정서 분류 정확도를 달성하여 최신 기술(SOTA) 기준보다 뛰어난 성능을 보이며, 정서의 구분 능력과 표현력이 뛰어나다는 것을 입증한다.

ABSTRACT

Emotional text-to-speech synthesis (ETTS) has seen much progress in recent years. However, the generated voice is often not perceptually identifiable by its intended emotion category. To address this problem, we propose a new interactive training paradigm for ETTS, denoted as i-ETTS, which seeks to directly improve the emotion discriminability by interacting with a speech emotion recognition (SER) model. Moreover, we formulate an iterative training strategy with reinforcement learning to ensure the quality of i-ETTS optimization. Experimental results demonstrate that the proposed i-ETTS outperforms the state-of-the-art baselines by rendering speech with more accurate emotion style. To our best knowledge, this is the first study of reinforcement learning in emotional text-to-speech synthesis.

연구 동기 및 목표

  • 정서적 TTS에서 의도한 정서를 명확히 전달하지 못하는 정서 혼동 문제를 해결하기 위해.
  • 대규모 정서 레이블이 부여된 훈련 데이터에 대한 의존도를 줄이기 위해 상호작용 기반 강화학습을 활용하기 위해.
  • 훈련 중에 SER 모델 성능을 직접 최적화함으로써 정서의 구분 능력을 향상시키기 위해.
  • 음성 품질과 정서 표현력 양측을 향상시키는 안정적인 반복적 훈련 전략을 개발하기 위해.

제안 방법

  • i-ETTS 프레임워크는 정책 그래디언트 기반 강화학습 알고리즘을 사용하여 TTS 모델을 최적화한다.
  • 음성 정서 인식(SER) 모델이 환경 역할을 하며, 실시간으로 음성 합성 결과에 대한 정서 분류 정확도를 피드백으로 제공한다.
  • 보상 함수는 음성 합성 결과에 대한 SER 모델의 정확도와 직접적으로 상관관계를 가지도록 설계되어, TTS 모델이 더 구분 가능한 정서적 출력을 생성하도록 유도한다.
  • 반복적 훈련 전략을 사용하며, 먼저 최대우도추정(MLE)을 통해 TTS 모델을 사전 훈련한 후, 강화학습으로 미세조정한다.
  • 글로벌 스타일 토큰(GST) 모듈은 256차원의 정서 임베딩을 생성하며, 5개의 스타일 토큰이 5개의 정서 카테고리에 대응한다.
  • 웨이브폼 생성에는 Griffin-Lim을 사용하며, 성능 평가에는 객관적( SER 정확도) 및 주관적(MOS, A/B 선호도) 지표를 모두 활용한다.

실험 결과

연구 질문

  • RQ1강화학습이 정서적 텍스트-음성 합성에서 정서의 구분 능력을 향상시킬 수 있는가?
  • RQ2사전 훈련된 SER 모델과의 상호작용 훈련 파라다임이 음성 합성의 청취 품질과 정서 명료성에 어떤 영향을 미치는가?
  • RQ3SER 기반 보상으로 정책 그래디언트 최적화를 통해 대규모 정서 레이블이 부여된 데이터셋의 필요성을 줄일 수 있는가?
  • RQ4반복적 훈련 전략이 정서 인식 TTS에서 학습 안정성과 수렴 성능을 향상시키는가?
  • RQ5i-ETTS는 정서 표현력에 대한 객관적 및 주관적 평가에서 SOTA 기준과 비교해 어떻게 성과를 내는가?

주요 결과

  • i-ETTS 모델은 음성 합성 결과에 대해 평균 SER 정확도 82.8%를 달성하여, MTL-ETTS(73.8%)와 CET-ETTS(78.2%)를 크게 앞서며 뛰어난 성능을 보였다.
  • 주관적 평균의견점수(MOS) 평가에서, i-ETTS는 모든 다섯 가지 정서 카테고리에서 양 기준보다 높은 평점을 받았다.
  • A/B 선호도 테스트 결과, 청취자들은 모든 정서 카테고리에서 i-ETTS가 생성한 음성의 정서 표현력이 더 뛰어나다고 일관되게 선호했다.
  • 제안된 방법은 SER 성능을 직접 최적화함으로써 정서 혼동을 감소시키며, 학습된 스타일 임베딩의 해석 가능성과 구분 능력을 향상시켰다.
  • 사전 훈련과 강화학습 미세조정을 통한 반복적 훈련 전략은 안정적인 수렴과 일관된 성능 향상을 이끌었다.
  • 지금까지 알려진 바에 따르면, 이 연구는 정서적 텍스트-음성 합성에 강화학습을 적용한 최초의 사례이며, 정서 인식 TTS를 위한 새로운 패러다임을 설정했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.