Skip to main content
QUICK REVIEW

[논문 리뷰] A Bengali HMM Based Speech Synthesis System

Sankar Mukherjee, Shyamal Kumar Das Mandal|arXiv (Cornell University)|2014. 06. 16.
Speech Recognition and Synthesis참고 문헌 14인용 수 9
한 줄 요약

이 논문은 음성 매개변수 궤적을 모델링하기 위해 은닉 마르코프 모델(HMM)을 사용하는 벤갈리 HMM 기반의 텍스트-음성 합성(TTS) 시스템을 제시한다. 멜-세프스트럼 계수를 사용한 벤갈리 음성 데이터베이스를 기반으로, 자연스럽고 이해하기 쉬우며 억양이 정확한 음성을 생성하며, 벤갈리와 같이 자원이 적은 인도 언어에 대해 HMM 기반 TTS의 실현 가능성을 입증한다.

ABSTRACT

The paper presents the capability of an HMM-based TTS system to produce Bengali speech. In this synthesis method, trajectories of speech parameters are generated from the trained Hidden Markov Models. A final speech waveform is synthesized from those speech parameters. In our experiments, spectral properties were represented by Mel Cepstrum Coefficients. Both the training and synthesis issues are investigated in this paper using annotated Bengali speech database. Experimental evaluation depicts that the developed text-to-speech system is capable of producing adequately natural speech in terms of intelligibility and intonation for Bengali.

연구 동기 및 목표

  • 벤갈리어와 같은 자원이 적은 인도어를 위한 HMM 기반 음성 합성 기술 개발.
  • 벤갈리어 음성 합성에서 음성 매개변수 궤적을 포괄하는 HMM 모델링의 효과성 탐구.
  • 청각적 및 스펙트럼 분석을 통한 합성된 벤갈리어 음성의 이해도와 자연스러움 평가.
  • 벤갈리어 HMM 기반 TTS에서 스펙트럼 표현으로 멜-세프스트럼 계수의 활용 탐색.
  • 향후 자원이 제한된 인도어에 대한 HMM 기반 TTS 개발을 위한 기초 설정.

제안 방법

  • 시스템은 음성 매개변수의 시간적 궤적을 벤갈리 음소 단위에 대해 은닉 마르코프 모델(HMM)로 모델링한다.
  • 스펙트럼 특징은 훈련 음성 데이터베이스에서 추출된 멜-세프스트럼 계수로 표현된다.
  • 훈련 단계에서는 텍스트와 음성 데이터를 정렬하여 각 음소 단위에 대한 HMM을 구축하고, 상태 전이 확률과 방출 확률을 학습한다.
  • 합성 단계에서는 훈련된 HMM에서 샘플링을 통해 음성 매개변수 시퀀스를 생성하고, 이 매개변수들로부터 웨이브폼을 재구성한다.
  • 웨이브폼은 생성된 멜-세프스트럼 궤적에서 시간 도메인 신호를 재구성하는 보코더를 사용하여 합성된다.
  • 정확한 언어학적 표현과 음소 커버리지를 확보하기 위해, 주석이 달린 벤갈리 음성 데이터베이스를 훈련 및 평가에 모두 사용한다.

실험 결과

연구 질문

  • RQ1제한된 음성 데이터베이스를 사용하여 HMM 기반 TTS가 자연스러운 벤갈리어 음성을 효과적으로 모델링하고 합성할 수 있는가?
  • RQ2HMM 프레임워크 내에서 멜-세프스트럼 계수는 벤갈리어 음성의 스펙트럼 특징을 얼마나 잘 표현하는가?
  • RQ3합성된 음성은 벤갈리어에서 이해도와 자연스러운 억양을 어느 정도 유지하는가?
  • RQ4음소 단위 모델링 및 상태 전이 학습이 합성 음성 품질에 미치는 영향는 어떠한가?
  • RQ5HMM 기반 접근법은 언어 자원이 극히 제한된 인도어, 예를 들어 벤갈리어에 대해 최소한의 언어 자원으로도 적응 가능한가?

주요 결과

  • HMM 기반 TTS 시스템은 단일 화자 음성 데이터베이스만을 사용하여 이해 가능하고 자연스러운 억양을 가진 벤갈리어 음성을 성공적으로 생성하였다.
  • 멜-세프스트럼 계수는 HMM 프레임워크 내에서 음성 매개변수를 모델링하는 데 효과적인 스펙트럼 표현을 제공하였다.
  • 합성된 음성은 높은 이해도를 보였으며, 청각 평가 결과 자원이 적은 언어임에도 불구하고 자연스러운 수준으로 평가되었다.
  • 시스템은 특히 문장 수준의 억양과 강세 패턴을 모델링하는 데 있어 뛰어난 강건성을 보였다.
  • 결과적으로 HMM 기반 TTS는 제한된 훈련 데이터로도 벤갈리어에 대해 실현 가능하며, 향후 다른 인도어에 대한 개발을 위한 기반을 마련하였다.
  • 객관적 스펙트럼 분석과 주관적 听음 테스트를 모두 통해 시스템 성능이 검증되었으며, 평가 방법 간 일관된 결과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.