[论文解读] Emotion controllable speech synthesis using emotion-unlabeled dataset with the assistance of cross-domain speech emotion recognition
本文提出了一种新颖的情感可控文本转语音(TTS)系统,通过利用跨域语音情感识别(SER)模型和基于全局风格令牌(GST)的情感预测辅助任务,在完全无情感标注的TTS数据集上进行训练。该方法在语音质量损失最小的情况下实现了高度的情感表现力,展示了在零样本情感控制下的有效性,且无需依赖人工标注的情感数据。
Neural text-to-speech (TTS) approaches generally require a huge number of high quality speech data, which makes it difficult to obtain such a dataset with extra emotion labels. In this paper, we propose a novel approach for emotional TTS synthesis on a TTS dataset without emotion labels. Specifically, our proposed method consists of a cross-domain speech emotion recognition (SER) model and an emotional TTS model. Firstly, we train the cross-domain SER model on both SER and TTS datasets. Then, we use emotion labels on the TTS dataset predicted by the trained SER model to build an auxiliary SER task and jointly train it with the TTS model. Experimental results show that our proposed method can generate speech with the specified emotional expressiveness and nearly no hindering on the speech quality.
研究动机与目标
- 为解决情感标注数据集稀缺的问题,该问题限制了情感TTS的实际部署。
- 实现在TTS数据集中无需人工标注情感数据即可实现情感控制。
- 通过来自跨域SER的弱监督,改进神经TTS中与情感相关的语调建模。
- 通过辅助训练,在保持高语音质量的同时实现精确的情感表现力。
- 通过利用外部SER数据集和领域自适应,减少对昂贵情感标注的依赖。
提出的方法
- 在标注的SER数据集(源域)和无标注的TTS数据集(目标域)上,通过最大均值差异(MMD)进行领域自适应,预训练一个跨域SER模型以减少分布偏移。
- 从SER模型在TTS数据集上的softmax输出中预测软情感标签,并将其作为辅助情感预测任务的弱监督信号。
- TTS模型与GST模块及辅助情感预测头联合训练,其中情感预测基于学习到的风格令牌权重。
- 采用top-K参考选择方案构建特定情感的参考音频集合:对每种情感,选取预测置信度最高的K个音频并进行平均,以生成情感嵌入。
- 最终TTS推理使用所选参考集中平均后的风格令牌权重,以控制合成语音的情感语调。
- 该方法利用GST框架实现内容与风格的解耦,通过辅助预测任务增强情感建模。
实验结果
研究问题
- RQ1当仅在无情感标注的数据集上训练时,TTS系统能否实现可控的情感表现力?
- RQ2当存在领域偏移时,跨域SER在为TTS数据提供可靠情感标签方面的有效性如何?
- RQ3基于风格令牌权重的辅助情感预测任务是否能改善GST模块中情感内容的解耦?
- RQ4与使用所有预测音频相比,top-K参考选择策略是否能提升情感一致性和表现力?
- RQ5所提出方法在实现情感控制的同时,能在多大程度上保持语音质量?
主要发现
- 所提方法在中性、愤怒、快乐和悲伤情绪下的平均意见评分(MOS)分别为4.12、3.80、3.11和3.61,与基线模型相比语音质量无显著差异(p值 = 0.20)。
- 采用所提top-K方案,四种情绪类别(中性、愤怒、快乐、悲伤)的平均情感识别准确率达到78.75%,显著优于基线(36.75%)和全集基线(49.25%)。
- 对于唤醒度和效价维度,平均识别准确率分别为91.0%和55.5%,均远高于50.0%的随机基线。
- t-SNE可视化结果表明,所提模型的风格令牌权重在每种情感类别下形成清晰且明确的聚类,而基线模型则表现出较差的聚类效果。
- 该模型在“快乐”情绪上的表现尤其差,MOS仅为3.11,可能由于该类别SER准确率较低,凸显了该方法对SER质量的敏感性。
- 辅助情感预测任务显著提升了GST模块提取与情感相关特征的能力,这一点通过聚类和识别性能的提升得到证实。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。