[论文解读] Emotional Voice Conversion With Cycle-consistent Adversarial Network
本文提出了一种基于CycleGAN的情感语音转换(EVC)方法,通过循环一致性对抗学习,消除了对平行训练数据和动态时间规整(DTW)的依赖。该方法采用两个判别器来区分真实与生成的语音,并引入分类器以保持情感身份,从而在无需对齐误差的情况下,在客观和主观评估中均取得了具有竞争力的结果。
Emotional Voice Conversion, or emotional VC, is a technique of converting speech from one emotion state into another one, keeping the basic linguistic information and speaker identity. Previous approaches for emotional VC need parallel data and use dynamic time warping (DTW) method to temporally align the source-target speech parameters. These approaches often define a minimum generation loss as the objective function, such as L1 or L2 loss, to learn model parameters. Recently, cycle-consistent generative adversarial networks (CycleGAN) have been used successfully for non-parallel VC. This paper investigates the efficacy of using CycleGAN for emotional VC tasks. Rather than attempting to learn a mapping between parallel training data using a frame-to-frame minimum generation loss, the CycleGAN uses two discriminators and one classifier to guide the learning process, where the discriminators aim to differentiate between the natural and converted speech and the classifier aims to classify the underlying emotion from the natural and converted speech. The training process of the CycleGAN models randomly pairs source-target speech parameters, without any temporal alignment operation. The objective and subjective evaluation results confirm the effectiveness of using CycleGAN models for emotional VC. The non-parallel training for a CycleGAN indicates its potential for non-parallel emotional VC.
研究动机与目标
- 解决依赖平行数据的情感语音转换(EVC)方法在对齐过程中依赖动态时间规整(DTW)的局限性。
- 通过用生成对抗训练替代最小生成损失(如L1/L2),减少过度平滑化,提升转换语音的自然度。
- 探索基于CycleGAN实现非平行EVC的可行性,实现灵活且可扩展的无对齐情感语音数据训练。
- 在客观指标(MCD、LogF0-MSE)和情感转移的主观感知方面,评估基于CycleGAN的EVC性能。
- 验证对抗训练结合循环一致性与情感分类,能否在转换过程中有效保持语言内容与情感身份。
提出的方法
- 采用包含两个生成器的CycleGAN框架:一个将源情感映射到目标情感,另一个用于实现循环一致性。
- 使用两个判别器:一个用于真实/生成语音分类,另一个用于确保转换后的语音保留感知质量。
- 引入独立的情感分类器,以确保真实语音和转换后的语音均能被正确分类为对应情感,从而保持情感身份。
- 通过对抗损失、循环一致性损失和分类损失的组合进行模型训练,无需帧级对齐。
- 以谱特征和F0轮廓(CWT或对数形式)作为输入,使模型学习韵律与谱特征维度的联合映射。
- 在训练过程中采用源语音与目标语音的随机配对,无需平行脚本或基于DTW的对齐。
实验结果
研究问题
- RQ1基于CycleGAN的训练是否能在无需平行训练数据或DTW对齐的情况下,实现具有竞争力的情感语音转换性能?
- RQ2与最小生成损失(如L1/L2)相比,使用对抗损失在语音自然度和感知质量方面表现如何?
- RQ3在客观指标与主观感知下,CycleGAN在转换过程中对情感身份的保持程度如何?
- RQ4与简单的F0归一化相比,结合谱特征与韵律特征学习(F0、能量)是否能提升转换质量?
- RQ5在主观评估中,模型在不同情感对(如中性到悲伤 vs. 中性到愤怒)上的表现如何?
主要发现
- 在使用相同特征组合的情况下,基于CycleGAN的模型在MCD(梅尔倒谱失真)指标上优于DBLSTM基线模型,即使未使用最小生成损失。
- 在中性到悲伤的转换中,CycleGAN-2(使用谱特征和对数F0)在主观情感识别中达到最高准确率(65.6%的悲伤感知率),优于其他模型。
- 在中性到愤怒的转换中,DBLSTM-1在MCD和LF0-MSE指标上表现最佳,但CycleGAN-1实现了其94.2%的性能,且语音自然度显著更优。
- 主观评估结果表明,CycleGAN-2在悲伤转换中实现了最高的正确情感分类率(65.6%),表明其具有出色的感知对齐能力。
- CycleGAN模型成功保持了语言内容与说话人身份,且由于采用非平行训练,未出现对齐错误。
- 对抗损失与情感分类器的结合,即使未显式进行帧级对齐,也能生成比最小生成损失更自然的语音。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。