[논문 리뷰] Creating New Language and Voice Components for the Updated MaryTTS Text-to-Speech Synthesis Platform
이 논문은 Gradle 빌드 자동화와 클라우드 호스팅 인프라를 활용하여 업데이트된 MaryTTS 텍스트-음성 합성 플랫폼에서 맞춤형 언어 및 합성 음성 구성 요소를 생성하기 위한 새로운 간소화된 워크플로우를 제시한다. 이 방법은 HMM 기반 및 신경망 기반 합성 모두를 지원하는 다국어 TTS 시스템의 효율적이고 모듈식 개발을 가능하게 하여 연구자와 개발자의 기술적 부담을 크게 줄이고 확장성을 향상시킨다.
We present a new workflow to create components for the MaryTTS text-to-speech synthesis platform, which is popular with researchers and developers, extending it to support new languages and custom synthetic voices. This workflow replaces the previous toolkit with an efficient, flexible process that leverages modern build automation and cloud-hosted infrastructure. Moreover, it is compatible with the updated MaryTTS architecture, enabling new features and state-of-the-art paradigms such as synthesis based on deep neural networks (DNNs). Like MaryTTS itself, the new tools are free, open source software (FOSS), and promote the use of open data.
연구 동기 및 목표
- 기존 MaryTTS 시스템의 점점 증가하는 복잡성과 기술적 빚으로 인해 기여와 확장성이 저해되는 문제를 해결하기 위해.
- 노후화된 툴킷을 대체하여 확장성 있고 자동화된 워크플로우로 새로운 언어 및 음성 구성 요소 생성 과정을 현대화하기 위해.
- 딥 뉴럴 네트워크 기반 합성과 같은 최신 TTS 철학을 오픈소스 MaryTTS 플랫폼에 통합하기 위해.
- 의존성 관리, 모듈식 프로젝트 구조, 구성 요소의 클라우드 기반 배포를 통해 개발자 경험을 향상시키기 위해.
- 유닛 선택 및 매개변수 기반(HMM 기반) 음성 합성 모두를 일관되고 재사용 가능한 파이프라인으로 통합하기 위해.
제안 방법
- 기존 툴킷을 대체하여 확장 가능한 플러그인 기반 워크플로우를 가능하게 하는 중심 빌드 자동화 도구로 Gradle을 채택하기 위해.
- 어휘, 언어, 데이터, 음성 프로젝트가 별도로 관리되고 게시되는 모듈식이고 의존성 기반의 워크플로우 설계하기 위해.
- 클라우드 호스팅 리포지터리(Bintray, GitHub)를 활용해 아티팩트 및 데이터 배포를 하며, 큰 오디오 데이터셋에 대해서는 릴리스 자산을 사용하기 위해.
- 강제 정렬(kaldi-mfa-plugin), 특징 추출(nosep), 모델 훈련(hts-voicebuilding-plugin), 설정 생성을 위한 전용 Gradle 플러그인 통합하기 위해.
- HMM-GMM/DNN 및 Merlin 같은 프레임워크와 호환되는 매개변수 기반 모델과 WORLD 및 STRAIGHT 같은 보이스 코덱을 지원하는 다양한 합성 철학 지원하기 위해.
- 런타임 동작을 구성 요소 빌드 시 설정에서 분리하기 위해 3단계 설정 시스템(기본, 음성, 사용자)을 구현하기 위해.
실험 결과
연구 질문
- RQ1MaryTTS에서 새로운 언어 및 음성 구성 요소를 생성하는 과정을 연구자와 개발자가 더 스케일러블하고 유지보수 가능하며 접근하기 쉽게 만들 수 있는가?
- RQ2현대적인 빌드 자동화와 클라우드 인프라는 TTS 구성 요소 개발의 기술적 부담을 어떻게 줄일 수 있는가?
- RQ3유닛 선택과 매개변수 기반(HMM 기반) 합성 모두를 하나의 확장 가능한 워크플로우로 통합할 수 있는가?
- RQ4오픈소스, FOSS 기반 도구와 의존성 관리는 TTS 시스템의 확장성과 배포를 얼마나 간소화할 수 있는가?
- RQ5딥 러닝 기반 TTS 모델의 통합은 모듈식이고 확장 가능하며 이전 버전과의 호환성이 보장된 프레임워크 내에서 어떻게 지원될 수 있는가?
주요 결과
- 새로운 Gradle 기반 워크플로우 덕분에 기술적 부담 감소와 함께 효율적이고 모듈식이며 재현 가능한 새로운 언어 및 음성 구성 요소 생성이 가능해졌다.
- 클라우드 호스팅 리포지터리(Bintray, GitHub)의 사용으로 언어 모델, 음성 데이터, 훈련된 모델의 원활한 배포 및 의존성 해결이 가능해졌다.
- 강제 정렬, 특징 추출, 모델 훈련을 위한 전용 Gradle 플러그인 통합으로 전체 음성 생성 파이프라인이 간소화되었다.
- 새로운 시스템은 기존의 HMM 기반 합성과 현대적인 신경망 기반 TTS를 모두 지원하며, Merlin 같은 프레임워크와 WORLD 및 STRAIGHT 같은 보이스 코덱의 확장성도 제공한다.
- 3단계 설정 시스템(기본, 음성, 사용자) 덕분에 구성 요소 빌드를 변경하지 않고도 런타임에서의 탄력적인 커스터마이제이션이 가능해졌다.
- 이제 각 언어와 음성마다 별도의 GitHub 리포지터리를 가질 수 있어 유지보수성과 기여자 접근성이 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.