[论文解读] Generating diverse and natural text-to-speech samples using a quantized fine-grained VAE and auto-regressive prosody prior
本文提出一种量化细粒度变分自编码器(QFVAE),其在离散潜在码上采用自回归(AR)先验,以生成多样且自然的文本到语音(TTS)样本。通过利用向量量化对与语调相关的潜在特征进行离散化,并使用独立的自回归先验建模其时序依赖关系,该方法在保持多样性的同时,显著提升了标准变分自编码器(VAE)的语音自然度,并在自动语音识别(ASR)的数据增强中展现出实用性。
Recent neural text-to-speech (TTS) models with fine-grained latent features enable precise control of the prosody of synthesized speech. Such models typically incorporate a fine-grained variational autoencoder (VAE) structure, extracting latent features at each input token (e.g., phonemes). However, generating samples with the standard VAE prior often results in unnatural and discontinuous speech, with dramatic prosodic variation between tokens. This paper proposes a sequential prior in a discrete latent space which can generate more naturally sounding samples. This is accomplished by discretizing the latent features using vector quantization (VQ), and separately training an autoregressive (AR) prior model over the result. We evaluate the approach using listening tests, objective metrics of automatic speech recognition (ASR) performance, and measurements of prosody attributes. Experimental results show that the proposed model significantly improves the naturalness in random sample generation. Furthermore, initial experiments demonstrate that randomly sampling from the proposed model can be used as data augmentation to improve the ASR performance.
研究动机与目标
- 解决标准VAE-based TTS模型中因每个音素的潜在先验相互独立而导致的不自然、不连贯语音问题。
- 通过在离散潜在码上构建结构化先验,建模语调的时序依赖关系,从而提升生成样本的自然度。
- 探索利用多样化的TTS生成样本作为数据增强手段,以提升ASR的鲁棒性与泛化能力。
- 评估在连续与离散潜在空间中,不同先验建模策略(独立 vs. 自回归)在自然度与多样性之间的权衡。
提出的方法
- 将细粒度VAE集成到Tacotron 2中,从对齐的真实频谱图中提取音素级别的语调表征。
- 应用向量量化(VQ)将连续潜在特征离散化为一组固定的码书向量,从而实现离散潜在空间的建模。
- 在从训练数据中提取的VQ嵌入潜在序列上训练独立的自回归先验模型,以捕捉时序依赖关系。
- 采用两阶段训练策略:首先,使用教师强制训练TTS模型以重建真实频谱图;其次,在VAE后验码上训练自回归先验。
- 通过先在离散潜在空间中从自回归先验采样,再使用采样码通过TTS解码器生成语音。
- 比较不同先验方案:独立高斯先验、连续空间中的自回归先验,以及离散空间中的自回归先验,同时进行采样尺度与多样性的消融实验。

实验结果
研究问题
- RQ1与标准独立VAE先验相比,通过在离散潜在序列上使用自回归先验建模语调,是否能显著提升TTS样本的自然度?
- RQ2对细粒度语调潜在变量进行向量量化,如何影响TTS生成中样本多样性与自然度之间的权衡?
- RQ3从所提模型中采样是否能生成多样且自然的语音,从而有效增强ASR训练数据?
- RQ4在语音质量与ASR增益方面,不同先验建模策略(独立、连续空间中的自回归、离散空间中的自回归)的相对性能如何?
主要发现
- 与标准VAE相比,采用离散潜在空间中自回归先验的QFVAE在主观听音测试中显著提升了语音自然度。
- 使用独立先验(尺度=1.0)的QFVAE在LibriTTS测试集上训练ASR时,取得了16.9%的词错误率(WER),优于基线TTS模型(20.0%),并接近复制合成基线模型。
- 从QFVAE中每段文本生成10个多样化样本,可将ASR的WER降低至12.5%,表明语调多样性能显著增强数据增强的效果。
- 在真实语音与10倍过采样的合成语音(来自QFVAE)组合数据上进行训练,相比仅使用真实语音,WER相对降低了16%,显示出显著的数据增强收益。
- 离散空间中的自回归先验在自然度方面优于连续空间中的自回归先验,尽管两者均显著优于独立采样。
- 性能最佳的QFVAE模型在真实语音与合成数据组合上进行训练时,于LibriTTS上实现了6.0%的WER,优于仅使用真实语音训练的模型(7.2%),展现出强大的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。