QUICK REVIEW
[论文解读] Emotional End-to-End Neural Speech Synthesizer
Younggun Lee, Azam Rabiee|arXiv (Cornell University)|Nov 15, 2017
Speech Recognition and Synthesis参考文献 8被引用 58
一句话总结
本论文在 Tacotron 的基础上加入情感嵌入与训练技巧,用以合成带有情感色彩的语音,解决暴露偏差与注意力对齐问题以提升质量。
ABSTRACT
In this paper, we introduce an emotional speech synthesizer based on the recent end-to-end neural model, named Tacotron. Despite its benefits, we found that the original Tacotron suffers from the exposure bias problem and irregularity of the attention alignment. Later, we address the problem by utilization of context vector and residual connection at recurrent neural networks (RNNs). Our experiments showed that the model could successfully train and generate speech for given emotion labels.
研究动机与目标
- 基于 Tacotron 引入一个情感条件化的端到端 TTS 模型。
- 解决暴露偏差与注意力错位问题,以提升长帧语音生成的质量。
- 能够利用学习得到的情感嵌入实现对多种预定义情感的语音生成。
提出的方法
- 将学习得到的情感嵌入注入到 Tacotron 的注意力及解码 RNN 中。
- 在解码过程中应用单调注意力以强制实现单调对齐。
- 通过将真实帧与预测帧混合作为解码输入实现半教师引导训练。
- 在注意力 RNN 输入中加入上下文向量 c_{t-1} 以引导对齐。
- 在 CBHG 文本编码器中添加残差连接以保留当前步信息并提高对齐的清晰度。
实验结果
研究问题
- RQ1将情感嵌入整合到 Tacotron 是否能生成带情感色彩的语音?
- RQ2强制单调注意力与半教师引导训练是否能改善注意力对齐和语音质量?
- RQ3上下文向量和 CBHG 残差连接是否能提高情感 TTS 的对齐稳定性与可懂度?
主要发现
- 情感 Tacotron 能生成带有指定情感标签的语音。
- 单调注意力比原始 Tacotron 的注意力对齐更干净、更稳定。
- 半教师引导训练有助于缓解暴露偏差并减少误差积累。
- 加入上下文向量与残差 CBHG 连接可得到更尖锐、更加可靠的注意力对齐。
- 该模型在一个包含六种情感类别且约 21 小时语音(文本、音频、情感标签)的韩国数据集上进行训练。
- 作者观察到注意力对齐的尖锐度与语音质量之间存在相关性,并提供了对生成语音的定性结果及 GitHub 资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。