Skip to main content
QUICK REVIEW

[论文解读] Creating New Language and Voice Components for the Updated MaryTTS Text-to-Speech Synthesis Platform

Ingmar Steiner, Sébastien Le Maguer|arXiv (Cornell University)|Dec 13, 2017
Speech Recognition and Synthesis参考文献 17被引用 7
一句话总结

本文提出了一种新型、简化的工作流程,用于在更新后的MaryTTS文本到语音平台中创建自定义语言和合成语音组件,利用Gradle构建自动化和云托管基础设施。该方法实现了多语言TTS系统的高效、模块化开发,支持基于HMM和神经网络的合成,显著降低了技术负担,并提升了研究人员和开发人员的可扩展性。

ABSTRACT

We present a new workflow to create components for the MaryTTS text-to-speech synthesis platform, which is popular with researchers and developers, extending it to support new languages and custom synthetic voices. This workflow replaces the previous toolkit with an efficient, flexible process that leverages modern build automation and cloud-hosted infrastructure. Moreover, it is compatible with the updated MaryTTS architecture, enabling new features and state-of-the-art paradigms such as synthesis based on deep neural networks (DNNs). Like MaryTTS itself, the new tools are free, open source software (FOSS), and promote the use of open data.

研究动机与目标

  • 解决遗留MaryTTS系统日益增长的复杂性和技术债务,这些因素阻碍了贡献和可扩展性。
  • 通过用可扩展的自动化工作流替代过时的工具包,现代化创建新语言和语音组件的过程。
  • 将最先进的TTS范式(包括基于深度神经网络的合成)集成到开源MaryTTS平台中。
  • 通过支持依赖管理、模块化项目结构和组件的云分发,改善开发人员体验。
  • 为单元选择和参数化(基于HMM)语音合成提供一致且可重用的流水线。

提出的方法

  • 采用Gradle作为核心构建自动化工具,替代原有的工具包,支持可扩展的插件式工作流。
  • 设计一种模块化、基于依赖关系的工作流,使词典、语言、数据和语音项目能够独立管理并发布。
  • 使用云托管仓库(Bintray、GitHub)进行构件和数据分发,为大型音频数据集提供发布资产。
  • 集成专用Gradle插件,用于强制对齐(kaldi-mfa-plugin)、特征提取(nosep)、模型训练(hts-voicebuilding-plugin)和配置生成。
  • 支持多种合成范式,包括HMM-GMM/DNN和与Merlin等框架兼容的参数化模型,以及WORLD和STRAIGHT等声码器。
  • 实现三级配置系统(默认、语音、用户),以将运行时行为与组件构建时设置解耦。

实验结果

研究问题

  • RQ1如何使在MaryTTS中创建新语言和语音组件的过程更加可扩展、可维护,并对研究人员和开发人员更加友好?
  • RQ2现代构建自动化和云基础设施在减轻TTS组件开发技术负担方面发挥什么作用?
  • RQ3如何在单一、可扩展的工作流下统一支持单元选择和参数化(基于HMM)的合成?
  • RQ4开源、FOSS基础的工具链和依赖管理在多大程度上能简化TTS系统的扩展和分发?
  • RQ5如何在模块化、可扩展且向后兼容的框架中支持基于深度学习的TTS模型集成?

主要发现

  • 基于Gradle的新工作流程实现了高效、模块化且可复现的新语言和语音组件创建,显著降低了技术负担。
  • 使用云托管仓库(Bintray、GitHub)可实现语言模型、语音数据和训练模型的无缝分发与依赖解析。
  • 集成用于强制对齐、特征提取和模型训练的专用Gradle插件,显著简化了整个语音构建流水线。
  • 新系统同时支持传统的基于HMM的合成和现代的神经网络TTS,且可扩展支持Merlin等框架和WORLD、STRAIGHT等声码器。
  • 三级配置系统(默认、语音、用户)实现了灵活的运行时自定义,而无需修改组件构建。
  • 项目结构现支持每个语言和语音拥有独立的GitHub仓库,显著提升了可维护性与贡献者访问便利性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。