Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability

Rui Liu, Berrak Şişman|arXiv (Cornell University)|Apr 3, 2021
Speech Recognition and Synthesis参考文献 30被引用 5
一句话总结

本文提出 i-ETTS,一种基于强化学习的框架,通过与语音情感识别(SER)模型的交互,迭代优化语音输出,从而提升情感语音合成的效果。通过使用基于 SER 准确率的奖励函数进行策略梯度训练,i-ETTS 实现了 82.8% 的情感分类准确率,显著优于当前最先进(SOTA)基线模型,在情感可区分性和表现力方面表现出色。

ABSTRACT

Emotional text-to-speech synthesis (ETTS) has seen much progress in recent years. However, the generated voice is often not perceptually identifiable by its intended emotion category. To address this problem, we propose a new interactive training paradigm for ETTS, denoted as i-ETTS, which seeks to directly improve the emotion discriminability by interacting with a speech emotion recognition (SER) model. Moreover, we formulate an iterative training strategy with reinforcement learning to ensure the quality of i-ETTS optimization. Experimental results demonstrate that the proposed i-ETTS outperforms the state-of-the-art baselines by rendering speech with more accurate emotion style. To our best knowledge, this is the first study of reinforcement learning in emotional text-to-speech synthesis.

研究动机与目标

  • 为解决情感 TTS 中的情感混淆问题,即合成语音无法清晰传达预期情感。
  • 通过利用交互式强化学习,减少对大规模情感标注训练数据的依赖。
  • 通过在训练过程中直接优化 SER 模型性能,提升情感可区分性。
  • 开发一种稳定、迭代的训练策略,同时提升语音质量和情感表现力。

提出的方法

  • i-ETTS 框架采用基于策略梯度的强化学习算法,以优化 TTS 模型。
  • 语音情感识别(SER)模型充当环境,提供实时反馈,形式为情感分类准确率。
  • 奖励函数被设计为与 SER 模型在合成语音上的准确率直接相关,以鼓励 TTS 模型生成更具可区分性的情感输出。
  • 采用迭代训练策略,首先通过最大似然估计(MLE)预训练 TTS 模型,然后通过强化学习进行微调。
  • 全局风格标记(GST)模块生成 256 维的情感嵌入,其中 5 个风格标记对应 5 种情感类别。
  • 系统使用 Griffin-Lim 进行波形生成,并通过客观指标(SER 准确率)和主观指标(MOS、A/B 偏好测试)评估性能。

实验结果

研究问题

  • RQ1强化学习能否提升情感语音合成中的情感可区分性?
  • RQ2使用预训练 SER 模型的交互式训练范式如何影响合成语音的感知质量和情感清晰度?
  • RQ3基于 SER 奖励的策略梯度优化能否减少情感 TTS 中对大规模情感标注数据集的依赖?
  • RQ4迭代训练策略是否能稳定学习过程并提升情感感知 TTS 的收敛性?
  • RQ5在情感表现力的客观与主观评估中,i-ETTS 与 SOTA 基线模型相比表现如何?

主要发现

  • i-ETTS 模型在合成语音上的平均 SER 准确率达到 82.8%,显著优于 MTL-ETTS(73.8%)和 CET-ETTS(78.2%)。
  • 在主观平均意见分(MOS)评估中,i-ETTS 在所有五个情感类别中的评分均高于两个基线模型。
  • A/B 偏好测试结果确认,听众在所有情感类别中均一致偏好 i-ETTS 生成的语音在情感表现力方面。
  • 所提出的方法通过直接优化 SER 性能,减少了情感混淆,提升了学习到的风格嵌入的可解释性和可区分性。
  • 采用预训练与强化学习微调相结合的迭代训练策略,实现了稳定的收敛和持续的性能提升。
  • 据我们所知,这是首次将强化学习应用于情感语音合成的研究,为情感感知 TTS 建立了全新的范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。