[论文解读] Maximizing Mutual Information for Tacotron
该论文提出在Tacotron中最大化文本条件与预测声学特征之间的互信息(MMI),以减少自回归模型中局部信息偏好导致的语音合成错误。通过训练一个辅助的CTC识别器来增强文本与声学特征之间的依赖关系,该方法在不破坏端到端训练的前提下减少了错误,使LJSpeech数据集在DFR=0.2时的语音错误率(UER)相对降低67%。
End-to-end speech synthesis methods already achieve close-to-human quality performance. However compared to HMM-based and NN-based frame-to-frame regression methods, they are prone to some synthesis errors, such as missing or repeating words and incomplete synthesis. We attribute the comparatively high utterance error rate to the local information preference of conditional autoregressive models, and the ill-posed training objective of the model, which describes mostly the training status of the autoregressive module, but rarely that of the condition module. Inspired by InfoGAN, we propose to maximize the mutual information between the text condition and the predicted acoustic features to strengthen the dependency between them for CAR speech synthesis model, which would alleviate the local information preference issue and reduce the utterance error rate. The training objective of maximizing mutual information can be considered as a metric of the dependency between the autoregressive module and the condition module. Experiment results show that our method can reduce the utterance error rate.
研究动机与目标
- 为解决Tacotron等端到端语音合成模型中因自回归结构的局部信息偏好而导致的高语音错误率问题。
- 缓解条件模块与自回归模块之间依赖关系反映不佳的病态训练目标。
- 通过互信息最大化增强输入文本与预测声学特征之间的依赖关系。
- 在不破坏端到端训练或不依赖外部监督的前提下,提升推理阶段的模型可靠性。
- 提供一种比仅重建误差更能反映语言内容对齐关系的训练目标。
提出的方法
- 引入一个辅助的CTC识别器,以估计文本条件与预测声学特征之间的互信息。
- 训练该CTC识别器以预测文本与声学特征之间的对齐关系,使用与Tacotron解码器相同的隐藏状态。
- 通过联合目标优化主Tacotron模型:最小化重建损失并利用对比学习最大化互信息。
- 在训练中应用丢帧率(DFR)策略,以模拟推理条件并减少暴露偏差。
- 在全连接层之前添加一个额外的LSTM层,共享编码器以混合文本与声学信息,再输入CTC。
- 设置互信息权重超参数λ = 1.0,并在200k训练步长时进行评估。
实验结果
研究问题
- RQ1在Tacotron中最大化文本与声学特征之间的互信息是否能降低语音错误率?
- RQ2互信息最大化是否能缓解自回归语音合成模型中的局部信息偏好问题?
- RQ3所提方法是否能在不破坏端到端训练的前提下增强条件与输出之间的依赖关系?
- RQ4添加互信息目标是否会降低语音的感知质量或波形保真度?
- RQ5互信息最大化与DFR训练的结合如何影响泛化能力与错误降低效果?
主要发现
- 在LJSpeech数据集上,当RF=2且无DFR时,所提方法将语音错误率(UER)从16%降至10%,相对提升37.5%。
- 在DFR=0.2时,使用MMI的UER降至5%,相比基线实现67%的相对降低。
- 在更大的db-CSMSC语料库上,采用相同配置后,UER从17%降至5%,表明具有良好的泛化能力。
- 损失曲线分析显示,未使用MMI时,训练与验证重建误差的差距更早开始扩大,表明模型更易过拟合非语言性细节。
- 采用MMI的模型与基线的平均意见得分(MOS)相近(3.84 vs. 3.83),表明感知质量无退化。
- MMI与DFR=0.2的结合实现了最高的MOS(3.92),表明模型鲁棒性与质量均得到提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。