Skip to main content
QUICK REVIEW

[논문 리뷰] Expressivity in TTS from Semantics and Pragmatics

Rodolfo Delmonte|arXiv (Cornell University)|2018. 03. 20.
Natural Language Processing Techniques참고 문헌 22인용 수 5
한 줄 요약

이 논문은 의미, 문법, 그리고 화용 분석을 통합하여 표현력을 향상시키는 텍스트-음성 합성(TTS) 시스템인 SPARSAR을 제시한다. 텍스트를 숨소리 단위와 연단으로 구성된 시와 유사한 구조로 모델링하고, 화용적으로 표시된 표현에 특수한 음성 어조를 적용함으로써, 시, 우화, 일반 텍스트에 적합한 세밀한 운율을 구현한다. 결과는 영어 단편 소설과 우화를 대상으로 검증되었으며, ToBI 기반이지만 파rameter 수가 두 배로 증가된 방식을 사용한다.

ABSTRACT

In this paper we present ongoing work to produce an expressive TTS reader that can be used both in text and dialogue applications. The system called SPARSAR has been used to read (English) poetry so far but it can now be applied to any text. The text is fully analyzed both at phonetic and phonological level, and at syntactic and semantic level. In addition, the system has access to a restricted list of typical pragmatically marked phrases and expressions that are used to convey specific discourse function and speech acts and need specialized intonational contours. The text is transformed into a poem-like structures, where each line corresponds to a Breath Group, semantically and syntactically consistent. Stanzas correspond to paragraph boundaries. Analogical parameters are related to ToBI theoretical indices but their number is doubled. In this paper, we concentrate on short stories and fables.

연구 동기 및 목표

  • 기본 텍스트 렌더링을 넘어서 맥락에 맞는 표현적인 발화를 생성할 수 있는 TTS 시스템을 개발하는 것.
  • 기존 TTS에서 운율의 다양성이 부족한 문제를 의미적 및 화용적 신호를 통합함으로써 해결하는 것.
  • 특수한 음성 어조 패턴을 사용하여 화용 기능과 발화 행위를 말하기 출력에 모델링하는 것.
  • 시에서 일반 서사 텍스트인 우화와 단편 소설까지의 적용 범위를 확장하는 것.
  • ToBI 기반의 이중 파라미터 시스템을 활용해 운율 구조를 체계화하는 것.

제안 방법

  • 시스템은 입력 텍스트에 대해 전체적으로 음소, 음운, 문법, 의미 분석을 수행한다.
  • 의미적 및 문법적 일관성에 기반해 텍스트를 숨소리 단위(줄)와 연단(단락 경계)으로 구조화한다.
  • 화용적으로 표시된 구어 표현을 식별하기 위해 제한된 어휘 체계를 사용한다. 이러한 표현은 특정 음성 어조 패턴이 필요로 한다.
  • ToBI 이론적 지표에서 유도된 유사 파라미터이지만, 더 세밀한 운율 제어를 가능하게 하기 위해 수치를 두 배로 늘였다.
  • 의미적 및 화용적 특징을 음성 실현에 매핑함으로써 맞춤형 음고 및 시간 패턴을 사용해 운율을 생성한다.
  • 텍스트에 계층적 구조를 적용하여 운율 단위를 문법적 및 의미적 경계와 일치시킨다.

실험 결과

연구 질문

  • RQ1의미적 및 화용적 특징을 TTS에서 운율 패턴에 체계적으로 매핑하는 방법은 무엇인가?
  • RQ2시와 유사한 표현 방식이 비시적 서사 텍스트의 표현력에 얼마나 기여하는가?
  • RQ3화용적으로 표시된 표현을 신뢰성 있게 탐지하고 적절한 음성 어조 패턴에 할당할 수 있는가?
  • RQ4ToBI 대비 두 배로 증가된 유사 파라미터 사용이 운율 표현력에 어떻게 기여하는가?
  • RQ5시 중심의 TTS 프레임워크를 일반 서사 및 대화 텍스트에 적용하는 데 실현 가능성이 있는가?

주요 결과

  • SPARSAR 시스템은 시와 서사 텍스트, 특히 우화와 단편 소설에 대해 표현력 있는 발화를 성공적으로 생성한다.
  • 의미적 및 화용적 분석의 통합으로 시스템은 화용 기능에 맥락에 맞는 음성 어조 패턴을 할당할 수 있다.
  • 의미적 및 문법적 경계에 기반한 숨소리 단위와 연단의 사용은 운율의 통일성과 자연스러움을 향상시킨다.
  • 기존 ToBI 기반 시스템보다 SPARSAR의 이중 파라미터 세트는 더 세밀한 운율 표현을 가능하게 한다.
  • 이 프레임워크는 시에서 비시적 텍스트로의 적용 가능성을 입증하여 표현력 있는 TTS의 적용 범위를 넓힌다.
  • 검증은 영어 우화와 단편 소설에 적용하여 수행되었으며, 이는 서사 맥락에서 방법의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.