Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Text-to-Speech System via Joint Style Analysis

Yang Gao, Weiyi Zheng|arXiv (Cornell University)|2020. 02. 17.
Speech Recognition and Synthesis참고 문헌 27인용 수 6
한 줄 요약

이 논문은 스타일 추출 모델과 다중 스타일 TTS 시스템을 공동으로 훈련시켜 사용자 입력 쿼리의 발화 스타일과 일치하는 응답을 생성하는 상호작용형 텍스트투음성 시스템을 제안한다. 서로 다른 데이터셋 간의 스타일 레이블을 정렬하기 위해 반감독 학습 방식을 사용하여, 사용자 선호도가 향상된 스타일러닝 응답을 구현하였으며, 청취자 중 72%가 기본 모델 대비 스타일러닝 TTS를 선호하였다.

ABSTRACT

While modern TTS technologies have made significant advancements in audio quality, there is still a lack of behavior naturalness compared to conversing with people. We propose a style-embedded TTS system that generates styled responses based on the speech query style. To achieve this, the system includes a style extraction model that extracts a style embedding from the speech query, which is then used by the TTS to produce a matching response. We faced two main challenges: 1) only a small portion of the TTS training dataset has style labels, which is needed to train a multi-style TTS that respects different style embeddings during inference. 2) The TTS system and the style extraction model have disjoint training datasets. We need consistent style labels across these two datasets so that the TTS can learn to respect the labels produced by the style extraction model during inference. To solve these, we adopted a semi-supervised approach that uses the style extraction model to create style labels for the TTS dataset and applied transfer learning to learn the style embedding jointly. Our experiment results show user preference for the styled TTS responses and demonstrate the style-embedded TTS system's capability of mimicking the speech query style.

연구 동기 및 목표

  • 사용자 입력 쿼리의 스타일에 맞게 발화 스타일을 적응시키는 더 자연스럽고 상호작용적인 TTS 시스템을 개발하여 인간-기계 대화의 현실감을 향상시키는 것.
  • TTS 훈련 데이터셋과 스타일 추출 모델의 훈련 데이터 간에 일관되지 않은 스타일 레이블 문제를 해결하는 것 (예: IEMOCAP 대비 전문 TTS 데이터셋).
  • 실제 음성 쿼리에서 추출된 스타일 임베딩을 존중함으로써 표현력 있고 맥락에 적절한 응답을 생성할 수 있도록 TTS 시스템을 설계하는 것.
  • 주관적 평가를 통해 사용자 경험을 향상시키고, 기본 TTS 출력 대비 스타일러닝 응답이 더 선호됨을 입증하는 것.

제안 방법

  • 딥 네ural 네트워크 아키텍처를 사용하여 IEMOCAP 데이터셋에서 다중 모odal 스타일 분류기를 훈련시어 음성 입력으로부터 부드러운 스타일 임베딩을 추출한다.
  • 훈련된 스타일 분류기를 반감독 방식으로 비라벨 TTS 훈련 데이터에 적용하여 서로 다른 데이터셋 간에 일관된 스타일 임베딩을 생성한다.
  • 생성된 스타일 임베딩을 보조 제어 특징으로 사용하여 다중 스타일 TTS 모델을 훈련시켜 입력 스타일에 따라 조건부 합성을 가능하게 한다.
  • 스타일 임베딩는 스타일 분류기의 소프트맥스 레이어에서 유도되며, 여러 스타일(예: 기쁨, 슬픔, 중립)에 대한 확률 분포를 나타낸다.
  • 시스템은 스타일 추출과 TTS 합성의 폐쇄형 파이프라인으로 통합되어, 입력 음성은 스타일 분석을 거쳐 그 스타일과 일치하는 응답을 TTS가 생성한다.
  • 전이 학습과 공동 최적화를 통해 스타일 표현 공간을 추출 모델과 TTS 모델 간에 정렬한다.

실험 결과

연구 질문

  • RQ1TTS 시스템은 사용자 입력 쿼리의 발화 스타일을 실시간으로 일치시켜 대화의 자연스러움을 향상시킬 수 있는가?
  • RQ2다른 스타일 레이블링 체계를 가진 두 개의 분리된 데이터셋 간에 스타일 임베딩을 일관되게 예측하고 활용할 수 있는가?
  • RQ3자원이 풍부한 데이터셋(IEMOCAP)에서 작은 전문 녹음 TTS 데이터셋으로 스타일 레이블을 반감독 학습을 통해 얼마나 효과적으로 전이할 수 있는가?
  • RQ4기본 모델의 중립 스타일 TTS보다 스타일러닝 TTS 응답이 사용자 선호도를 더 높이는가?

주요 결과

  • 주관적 선호도 테스트에서 다중 스타일 TTS 시스템은 기준 TTS 모델 대비 72%의 사용자 선호도를 기록하여 스타일러닝 응답에 대한 강한 사용자 선호도를 보였다.
  • 청취자들은 중립 스타일을 가장 자주 선호하였으며, 이는 테스트 문장의 내용이 차분하고 중립적인 표현 방식에 가장 적합하기 때문이었다.
  • 시스템은 일반화 능력을 보였으며, 실제 보이지 않는 음성 쿼리에 대해 응답을 생성할 때 40% 이상의 테스트 쌍이 좋은 매칭으로 평가되었다.
  • 기쁨 스타일은 합성 음성에서 F0 평균이 유의미하게 높게 나타났으며, 이는 훈련 데이터 통계와 일치하여 효과적인 스타일 표현을 의미한다.
  • 슬픔 및 분노 스타일은 비교적 낮은 음질을 보였는데, 이는 이러한 감정에 해당하는 TTS 데이터셋 내 훈련 샘플 수가 부족하기 때문일 것이다.
  • ABX 테스트 결과, 다중 스타일 TTS는 인식 가능한 차이를 가진 스타일을 생성할 수 있었으며, 스타일 식별 작업에서 82.42%의 정확도를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.