[论文解读] Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability
本文提出 i-ETTS,一种基于强化学习的框架,通过与语音情感识别(SER)模型的交互,迭代优化语音输出,从而提升情感语音合成的效果。通过使用基于 SER 准确率的奖励函数进行策略梯度训练,i-ETTS 实现了 82.8% 的情感分类准确率,显著优于当前最先进(SOTA)基线模型,在情感可区分性和表现力方面表现出色。
Emotional text-to-speech synthesis (ETTS) has seen much progress in recent years. However, the generated voice is often not perceptually identifiable by its intended emotion category. To address this problem, we propose a new interactive training paradigm for ETTS, denoted as i-ETTS, which seeks to directly improve the emotion discriminability by interacting with a speech emotion recognition (SER) model. Moreover, we formulate an iterative training strategy with reinforcement learning to ensure the quality of i-ETTS optimization. Experimental results demonstrate that the proposed i-ETTS outperforms the state-of-the-art baselines by rendering speech with more accurate emotion style. To our best knowledge, this is the first study of reinforcement learning in emotional text-to-speech synthesis.
研究动机与目标
- 为解决情感 TTS 中的情感混淆问题,即合成语音无法清晰传达预期情感。
- 通过利用交互式强化学习,减少对大规模情感标注训练数据的依赖。
- 通过在训练过程中直接优化 SER 模型性能,提升情感可区分性。
- 开发一种稳定、迭代的训练策略,同时提升语音质量和情感表现力。
提出的方法
- i-ETTS 框架采用基于策略梯度的强化学习算法,以优化 TTS 模型。
- 语音情感识别(SER)模型充当环境,提供实时反馈,形式为情感分类准确率。
- 奖励函数被设计为与 SER 模型在合成语音上的准确率直接相关,以鼓励 TTS 模型生成更具可区分性的情感输出。
- 采用迭代训练策略,首先通过最大似然估计(MLE)预训练 TTS 模型,然后通过强化学习进行微调。
- 全局风格标记(GST)模块生成 256 维的情感嵌入,其中 5 个风格标记对应 5 种情感类别。
- 系统使用 Griffin-Lim 进行波形生成,并通过客观指标(SER 准确率)和主观指标(MOS、A/B 偏好测试)评估性能。
实验结果
研究问题
- RQ1强化学习能否提升情感语音合成中的情感可区分性?
- RQ2使用预训练 SER 模型的交互式训练范式如何影响合成语音的感知质量和情感清晰度?
- RQ3基于 SER 奖励的策略梯度优化能否减少情感 TTS 中对大规模情感标注数据集的依赖?
- RQ4迭代训练策略是否能稳定学习过程并提升情感感知 TTS 的收敛性?
- RQ5在情感表现力的客观与主观评估中,i-ETTS 与 SOTA 基线模型相比表现如何?
主要发现
- i-ETTS 模型在合成语音上的平均 SER 准确率达到 82.8%,显著优于 MTL-ETTS(73.8%)和 CET-ETTS(78.2%)。
- 在主观平均意见分(MOS)评估中,i-ETTS 在所有五个情感类别中的评分均高于两个基线模型。
- A/B 偏好测试结果确认,听众在所有情感类别中均一致偏好 i-ETTS 生成的语音在情感表现力方面。
- 所提出的方法通过直接优化 SER 性能,减少了情感混淆,提升了学习到的风格嵌入的可解释性和可区分性。
- 采用预训练与强化学习微调相结合的迭代训练策略,实现了稳定的收敛和持续的性能提升。
- 据我们所知,这是首次将强化学习应用于情感语音合成的研究,为情感感知 TTS 建立了全新的范式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。