Skip to main content
QUICK REVIEW

[论文解读] fairseq S^2: A Scalable and Integrable Speech Synthesis Toolkit

Changhan Wang, Wei-Ning Hsu|arXiv (Cornell University)|Sep 14, 2021
Speech Recognition and Synthesis参考文献 61被引用 4
一句话总结

该论文介绍了 fairseq S²,一个可扩展且可集成的语音合成工具包,作为 fairseq 框架的扩展,支持端到端训练自回归与非自回归文本到语音模型,具备多说话人合成、低资源数据的预处理工具以及自动评估指标。通过语音活动检测(VAD)、噪声过滤和预训练说话人嵌入,该工具在极少人工筛选的数据上实现了模型性能与泛化能力的提升。

ABSTRACT

This paper presents fairseq S^2, a fairseq extension for speech synthesis. We implement a number of autoregressive (AR) and non-AR text-to-speech models, and their multi-speaker variants. To enable training speech synthesis models with less curated data, a number of preprocessing tools are built and their importance is shown empirically. To facilitate faster iteration of development and analysis, a suite of automatic metrics is included. Apart from the features added specifically for this extension, fairseq S^2 also benefits from the scalability offered by fairseq and can be easily integrated with other state-of-the-art systems provided in this framework. The code, documentation, and pre-trained models are available at https://github.com/pytorch/fairseq/tree/master/examples/speech_synthesis.

研究动机与目标

  • 解决语音合成领域缺乏统一、可扩展工具包的问题,这些工具包需支持多样化的模型架构与数据类型。
  • 通过稳健的预处理流程,实现使用较少人工筛选、真实场景中的语音数据训练高质量 TTS 模型。
  • 通过集成自动评估指标与预训练组件,加速开发与评估流程。
  • 支持与 fairseq 中其他最先进模型的集成,包括自监督语音表征与单元到语音系统。
  • 通过预训练说话人嵌入实现零样本说话人合成,扩展模型对未见说话人的泛化能力。

提出的方法

  • 在 fairseq 基础上扩展了一套文本到频谱图模型,包括 Tacotron2、Transformer 和 FastSpeech2,支持自回归与非自回归推理。
  • 通过可学习的说话人嵌入查找表以及来自验证模型的预训练说话人嵌入,实现多说话人能力。
  • 实现音频预处理流程,包括语音活动检测(VAD)、降噪(DN),以及基于信噪比(SNR)与词错误率(CER)的过滤,用于数据筛选。
  • 集成自动评估指标,如 MCD、CER、MOS 以及 F0/RMS 相关系数,以加速模型迭代。
  • 支持文本与自监督模型生成的可学习单元作为输入,实现无需文本的 TTS 系统。
  • 通过共享代码库与模块化设计,实现与现有 fairseq 模型(包括 ASR、MT、LM 与自监督学习)的无缝集成。

实验结果

研究问题

  • RQ1像 VAD、降噪与过滤这样的预处理流程,是否能提升在低资源、真实场景语音数据上的训练稳定性和性能?
  • RQ2与可学习嵌入相比,使用预训练说话人嵌入在零样本说话人合成与模型性能方面表现如何?
  • RQ3像 MCD 与 CER 这类自动指标在多大程度上能加速模型开发并减少对主观人工评估的依赖?
  • RQ4fairseq S² 是否能有效支持使用自监督语音表征作为输入的端到端单元到语音合成?
  • RQ5在自回归模型中,减少因子对在噪声或不完美数据上的训练收敛性与合成质量有何影响?

主要发现

  • 使用 VAD 且激进程度为 3 时,平均可减少 40% 的静音,但存在截断语音的风险;最优设置在去除静音与保留语音之间取得平衡。
  • 采用 DN+VAD-3+FLT 预处理的训练将 CER 降低至 10% 以下,并使 MOS 提升 0.2–0.3 分,尤其在 VCTK 与 Common Voice 数据集上表现显著。
  • 在 Transformer TTS 模型中,减少因子为 4 时性能优于因子为 2 的情况,且在未预处理的原始音频上,因子为 2 时训练完全失败。
  • 预训练说话人嵌入在性能上与可学习嵌入相当,同时支持对未见说话人的零样本合成。
  • 通过 SNR 与 CER 进行数据过滤,使 MCD 减少 0.1,CER 减少 1.5,表明在困难样本上模型拟合能力与可懂性得到改善。
  • fairseq S² 与自监督模型的集成成功实现了单元到语音合成,证明了无文本 TTS 流水线的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。