[论文解读] DiscreTalk: Text-to-Speech as a Machine Translation Problem
该论文提出 DiscreTalk,一种新颖的端到端文本到语音(TTS)系统,通过将 TTS 问题建模为神经机器翻译(NMT)问题,利用非自回归 VQ-VAE 将原始语音波形映射为离散符号,再使用 Transformer-NMT 模型从文本预测这些符号。该方法在自然度方面达到与 VQ-VAE 重建相当的水平,且优于使用非自回归声码器的传统 Transformer-TTS,避免了对超参数敏感的特征工程,并减轻了过度平滑问题。
This paper proposes a new end-to-end text-to-speech (E2E-TTS) model based on neural machine translation (NMT). The proposed model consists of two components; a non-autoregressive vector quantized variational autoencoder (VQ-VAE) model and an autoregressive Transformer-NMT model. The VQ-VAE model learns a mapping function from a speech waveform into a sequence of discrete symbols, and then the Transformer-NMT model is trained to estimate this discrete symbol sequence from a given input text. Since the VQ-VAE model can learn such a mapping in a fully-data-driven manner, we do not need to consider hyperparameters of the feature extraction required in the conventional E2E-TTS models. Thanks to the use of discrete symbols, we can use various techniques developed in NMT and automatic speech recognition (ASR) such as beam search, subword units, and fusions with a language model. Furthermore, we can avoid an over smoothing problem of predicted features, which is one of the common issues in TTS. The experimental evaluation with the JSUT corpus shows that the proposed method outperforms the conventional Transformer-TTS model with a non-autoregressive neural vocoder in naturalness, achieving the performance comparable to the reconstruction of the VQ-VAE model.
研究动机与目标
- 开发一种完全端到端的文本到语音系统,以消除人工设计的声学特征。
- 解决自回归 TTS 模型中常见的过度平滑问题。
- 通过使用离散符号序列,利用 NMT 和 ASR 技术(如束搜索、子词单元和语言建模)的优势。
- 评估基于离散符号的 TTS 是否能与 VQ-VAE 重建质量相当。
- 研究离散符号分辨率(下采样因子)与语音清晰度质量之间的权衡。
提出的方法
- 训练一个基于 GAN 的非自回归 VQ-VAE 模型,将原始语音波形映射为离散符号序列,学习完全数据驱动的表示。
- VQ-VAE 使用向量量化机制,将连续语音嵌入为离散标记,实现精确重建。
- 训练一个 Transformer-NMT 模型,从输入文本预测离散符号序列,将 TTS 视为序列到序列的翻译任务。
- 对离散符号序列应用子词单元(如字节对编码),以提升泛化能力,尤其在下采样因子较小时更有效。
- 通过浅层融合探索语言模型融合(VQ-LM),使用单独训练的基于 LSTM 的模型在未转录语音上进行训练,以提升生成质量。
- 使用 JSUT 语料库进行评估,采用 MOS 和自动指标(CER、TER),与基线模型和重建条件进行合成性能对比。
实验结果
研究问题
- RQ1基于 VQ-VAE 的原始语音离散表示是否能实现高质量的端到端 TTS,且无需手工特征?
- RQ2将 TTS 建模为机器翻译问题,是否相比传统自回归模型能提升自然度并减少过度平滑?
- RQ3下采样因子(DSF)的选择如何影响符号分辨率与语音质量之间的权衡?
- RQ4子词单元和语言模型融合在数据有限的情况下,能在多大程度上提升合成性能?
- RQ5所提方法是否能达到与 VQ-VAE 重建相当的自然度,表明接近最优的性能?
主要发现
- 所提出的 DiscreTalk 模型在自然度方面优于使用 Parallel WaveGAN 的传统 Transformer-TTS,DSF128 搭配子词单元时 MOS 达到 3.93。
- DSF128 搭配子词单元的模型达到 MOS 3.93,显著优于基线(3.48),并接近重建条件(4.32)。
- 子词单元在小下采样因子(DSF128)下尤为有效,相比原始符号序列能显著减少质量退化。
- 通过浅层融合使用 VQ-LM 未提升性能,可能由于数据有限,且 NMT 与 VQ-LM 模型共享训练数据。
- 小下采样因子(128)虽提升了重建质量,但增加了 NMT 训练难度,表明分辨率与训练稳定性之间存在权衡。
- 合成性能与重建性能之间的差距小于传统端到端 TTS 模型,表明 VQ-VAE 为性能设定了较强的上限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。