Skip to main content
QUICK REVIEW

[论文解读] Mel-spectrogram augmentation for sequence to sequence voice conversion

Yeongtae Hwang, Hye Min Cho|arXiv (Cornell University)|Jan 6, 2020
Speech Recognition and Synthesis参考文献 21被引用 14
一句话总结

本文提出了一种梅尔倒谱图增强技术——具体包括时间长度控制、频率扭曲和音量控制——以在配对训练数据有限的情况下提升序列到序列语音转换(VC)模型的性能。结果表明,时间轴扭曲策略,尤其是对源和目标均应用的时间长度控制,通过在保留说话人特征的同时增加数据多样性,显著提升了VC性能,优于遮蔽和其他增强策略,且在不同规模的训练集上表现均更优。

ABSTRACT

For training the sequence-to-sequence voice conversion model, we need to handle an issue of insufficient data about the number of speech pairs which consist of the same utterance. This study experimentally investigated the effects of Mel-spectrogram augmentation on training the sequence-to-sequence voice conversion (VC) model from scratch. For Mel-spectrogram augmentation, we adopted the policies proposed in SpecAugment. In addition, we proposed new policies (i.e., frequency warping, loudness and time length control) for more data variations. Moreover, to find the appropriate hyperparameters of augmentation policies without training the VC model, we proposed hyperparameter search strategy and the new metric for reducing experimental cost, namely deformation per deteriorating ratio. We compared the effect of these Mel-spectrogram augmentation methods based on various sizes of training set and augmentation policies. In the experimental results, the time axis warping based policies (i.e., time length control and time warping.) showed better performance than other policies. These results indicate that the use of the Mel-spectrogram augmentation is more beneficial for training the VC model.

研究动机与目标

  • 为解决在训练序列到序列语音转换模型时配对语音数据不足(同一语句、不同说话人)的挑战。
  • 探究在训练数据有限的情况下,梅尔倒谱图增强对提升VC性能的有效性。
  • 提出一种基于变形每退化比(DPD)的超参数搜索策略,以在不重新训练VC模型的前提下降低训练成本。
  • 评估并比较多种增强策略(包括现有方法SpecAugment和新提出的方法)对VC质量的影响。

提出的方法

  • 采用SpecAugment策略:时间扭曲、频率掩蔽和时间掩蔽,用于梅尔倒谱图增强。
  • 提出新的增强策略:频率扭曲(音高变化)、音量控制(幅度调制)和时间长度控制(速度变化)。
  • 设计了DPD(每退化变形量)指标,用于在不训练完整VC模型的前提下评估增强策略的有效性。
  • 在训练过程中在线应用增强策略,通过基于DPD的搜索调整超参数,以最小化实验成本。
  • 在多个训练集规模(1/16至完整规模)下进行一对一语音转换实验,以评估不同策略的影响。
  • 采用标准VC评估指标:MCD(梅尔倒谱失真)、CER(字符错误率)、自然度和相似度,用于比较结果。

实验结果

研究问题

  • RQ1在配对数据有限的情况下,哪些梅尔倒谱图增强策略最有效地提升序列到序列语音转换性能?
  • RQ2时间轴扭曲策略与频率轴掩蔽及其他增强策略相比,在VC质量方面表现如何?
  • RQ3DPD指标是否能可靠地预测梅尔倒谱图增强的最优超参数,而无需训练完整的VC模型?
  • RQ4结合多种增强策略是否能提升VC性能,还是会导致语言和声学保真度下降?
  • RQ5增强策略的有效性在不同规模的训练数据中如何变化?

主要发现

  • 对源和目标梅尔倒谱图均应用时间长度控制(TLC)取得了最佳整体性能,在完整训练集上实现了最低的MCD(6.641)和最高的相似度(3.673)。
  • 时间扭曲(TW)和TLC在所有训练集规模下均表现出一致的性能提升,且TLC在完整数据集上同时实现了最低的MCD(6.641)和最高的相似度(3.673)。
  • 掩蔽策略(频率掩蔽和时间掩蔽)导致性能下降,可能是因为损失了关键的语言和声学信息。
  • 频率扭曲和音量控制带来的增益极小或为负,表明其可能比提升效果更易扭曲说话人特异性特征。
  • 组合多种策略并未提升性能,反而常导致结果更差,表明数据增强多样性与信息保留之间存在权衡。
  • DPD指标成功识别出有效超参数,而无需训练完整的VC模型,显著降低了实验成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。