[论文解读] Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training
本文提出领域对抗训练(DAT),以实现仅用少量嘈杂目标说话人样本,在说话人适配与说话人编码设置下高效进行语音克隆。通过在潜在表征中解耦噪声与说话人身份,该方法在仅使用少量样本的情况下,相比基线模型及使用外部语音增强的模型,仍能实现更优的语音质量与说话人相似度。
Data efficient voice cloning aims at synthesizing target speaker's voice with only a few enrollment samples at hand. To this end, speaker adaptation and speaker encoding are two typical methods based on base model trained from multiple speakers. The former uses a small set of target speaker data to transfer the multi-speaker model to target speaker's voice through direct model update, while in the latter, only a few seconds of target speaker's audio directly goes through an extra speaker encoding model along with the multi-speaker model to synthesize target speaker's voice without model update. Nevertheless, the two methods need clean target speaker data. However, the samples provided by user may inevitably contain acoustic noise in real applications. It's still challenging to generating target voice with noisy data. In this paper, we study the data efficient voice cloning problem from noisy samples under the sequence-to-sequence based TTS paradigm. Specifically, we introduce domain adversarial training (DAT) to speaker adaptation and speaker encoding, which aims to disentangle noise from speech-noise mixture. Experiments show that for both speaker adaptation and encoding, the proposed approaches can consistently synthesize clean speech from noisy speaker samples, apparently outperforming the method adopting state-of-the-art speech enhancement module.
研究动机与目标
- 解决在目标说话人样本嘈杂时,现有序列到序列TTS系统性能下降所导致的数据高效语音克隆挑战。
- 通过使说话人适配与说话人编码方法对噪声具有鲁棒性,而无需清洁数据或外部增强模块,从而提升其性能。
- 利用领域对抗训练,在潜在表征中解耦噪声与说话人身份,确保语音合成的稳定性和高质量。
- 在嘈杂条件下,评估所提方法在少样本适配与单样本编码场景下的有效性。
提出的方法
- 将领域对抗训练(DAT)引入序列到序列TTS模型的解码器中,训练一个领域分类器以区分干净与嘈杂语音输入。
- 通过在解码器中引入领域分类器与噪声控制标签,改进说话人适配框架,使模型在微调过程中学习到与噪声无关的说话人表征。
- 通过引入领域分类器与外部说话人编码器,扩展说话人编码框架,确保说话人嵌入在输入音频存在噪声时仍具鲁棒性。
- 在反向传播中使用梯度反转,强制实现领域不变性,促使模型学习与噪声无关的说话人特异性特征。
- 在包含干净与嘈杂说话人样本的混合数据集上训练TTS模型,领域分类器对模型学习到与噪声相关的特征施加惩罚。
- 使用t-SNE可视化方法,证明所提方法能将同一说话人的嘈杂与干净样本聚类得非常接近,表明噪声解耦效果显著。
实验结果
研究问题
- RQ1当仅用少量嘈杂目标说话人样本进行微调时,领域对抗训练能否提升说话人适配性能?
- RQ2在仅使用单个嘈杂样本作为输入时,说话人编码能否保持高说话人相似度与自然度?
- RQ3当用作语音克隆预处理步骤时,所提方法是否优于最先进语音增强模块?
- RQ4领域对抗训练在潜在表征中解耦噪声与说话人身份的效率如何?
- RQ5所提方法在不同说话人性别及不同噪声水平的测试条件下是否具有鲁棒性?
主要发现
- 基于DAT的说话人适配模型在嘈杂女性样本上的平均意见评分(MOS)达到相似度3.65、自然度3.36,优于基线模型在该数据上无法收敛的表现。
- 在单样本说话人编码中,所提方法在嘈杂男性样本上的相似度得分为0.88,而基线模型使用去噪输入时仅为0.76,表明其具有更优的鲁棒性。
- 采用领域对抗训练的模型在干净、嘈杂与去噪测试集上均保持一致性能,而基线模型在适配与编码设置中均无法在嘈杂样本上有效适应。
- t-SNE可视化结果表明,所提方法能将同一说话人的嘈杂与干净样本聚类得非常接近,而基线模型则显示出明显分离的聚类,表明其嵌入受噪声影响。
- 在女性适配任务中,所提方法的MCD(梅尔倒谱失真)为4.18,低于去噪基线的4.72,表现更优。
- 在说话人编码中,所提方法在嘈杂男性样本上的相似度MOS得分为3.34,显著优于基线模型在去噪数据上的2.96。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。