[论文解读] Meta-Voice: Fast few-shot style transfer for expressive voice cloning using meta learning
Meta-Voice 提出了一种元学习方法,用于使用预训练的多说话人、多语调文本到语音(TTS)模型实现快速少样本情感化语音克隆。通过将模型无关元学习(MAML)应用于特定风格的参数,并结合领域自适应训练与正交约束以实现说话人-语调解耦,该方法仅需100次微调步骤和每个目标说话人5段语音(约12秒)即可实现高质量的语音克隆。
The task of few-shot style transfer for voice cloning in text-to-speech (TTS) synthesis aims at transferring speaking styles of an arbitrary source speaker to a target speaker's voice using very limited amount of neutral data. This is a very challenging task since the learning algorithm needs to deal with few-shot voice cloning and speaker-prosody disentanglement at the same time. Accelerating the adaptation process for a new target speaker is of importance in real-world applications, but even more challenging. In this paper, we approach to the hard fast few-shot style transfer for voice cloning task using meta learning. We investigate the model-agnostic meta-learning (MAML) algorithm and meta-transfer a pre-trained multi-speaker and multi-prosody base TTS model to be highly sensitive for adaptation with few samples. Domain adversarial training mechanism and orthogonal constraint are adopted to disentangle speaker and prosody representations for effective cross-speaker style transfer. Experimental results show that the proposed approach is able to conduct fast voice cloning using only 5 samples (around 12 second speech data) from a target speaker, with only 100 adaptation steps. Audio samples are available online.
研究动机与目标
- 解决在仅有限数据(如5段语音)可用时,快速少样本风格迁移的语音克隆挑战。
- 克服低数据语音克隆场景中模型容量与过拟合之间的权衡。
- 实现在保留情感化语调迁移能力的同时,快速适应新说话人的语音。
- 解耦说话人身份与语调表征,以支持有效的跨说话人风格迁移。
- 与标准微调基线相比,提升适应速度与效率,降低计算成本与处理时间。
提出的方法
- 采用模型无关元学习(MAML)优化预训练的多说话人、多语调TTS模型的特定风格参数,以实现快速适应。
- 将模型参数分解为共享参数(来自预训练)和特定风格参数(通过元学习优化)。
- 在潜在空间中应用领域自适应训练与梯度反转层(GRL),以解耦说话人与语调表征。
- 对说话人与语调向量施加正交约束,以提升表征解耦与泛化能力。
- 使用风格自适应层归一化(SALN)机制,在推理过程中以学习到的风格嵌入条件化TTS模型。
- 在大规模多说话人、多语调语料库(71小时)上预训练基础TTS模型,采用包含加权组件的联合损失函数以实现说话人与语调控制。
实验结果
研究问题
- RQ1元学习是否能在保持高语音质量与表现力的前提下,加速少样本语音克隆?
- RQ2MAML-based微调在减少实现高说话人相似度所需步数方面效果如何,尤其是在数据极少的情况下?
- RQ3在低数据设置下,领域自适应训练与正交约束在解耦说话人身份与语调表征方面的有效性如何?
- RQ4与标准微调基线相比,Meta-Voice在适应速度与最终性能方面表现如何?
- RQ5在仅使用5段短语音的情况下,该模型在跨性别与不同说话人类别之间的风格迁移中是否具备泛化能力?
主要发现
- Meta-Voice 仅使用每个目标说话人5段语音(约12秒)和100次适应步骤,即可实现超过0.7的说话人余弦相似度。
- 该模型在显著更少的适应步数内达到与基线模型相当的说话人相似度与梅尔倒谱失真(MCD)水平,证明了其优越的适应速度。
- 基线模型在经过足够多的微调后可达到与Meta-Voice相当的性能,证实Meta-Voice的主要优势在于更快的收敛速度。
- 领域自适应训练与正交约束有效解耦了说话人与语调表征,实现了稳健的跨说话人风格迁移。
- 该方法在同性别与跨性别风格迁移中均有效,且在不同说话人类别中表现一致。
- 展示该方法的音频样本已公开发布于线上,证实了生成语音的实际可用性与感知质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。