[论文解读] Adversarial Contrastive Predictive Coding for Unsupervised Learning of Disentangled Representations.
本论文提出了一种具有双编码器的全卷积变分自编码器,用于无监督分离语音内容与说话人因素。通过无平行数据或说话人标签的对抗对比预测编码,实现了最先进的零样本语音转换性能,包括对未见说话人的语音转换。
In this work we tackle disentanglement of speaker and content related variations in speech signals. We propose a fully convolutional variational autoencoder employing two encoders: a content encoder and a speaker encoder. To foster disentanglement we propose adversarial contrastive predictive coding. This new disentanglement method does neither need parallel data nor any supervision, not even speaker labels. With successful disentanglement the model is able to perform voice conversion by recombining content and speaker attributes. Due to the speaker encoder which learns to extract speaker traits from an audio signal, the proposed model not only provides meaningful speaker embeddings but is also able to perform zero-shot voice conversion, i.e. with previously unseen source and target speakers. Compared to state-of-the-art disentanglement approaches we show competitive disentanglement and voice conversion performance for speakers seen during training and superior performance for unseen speakers.
研究动机与目标
- 在无任何监督(包括说话人标签或平行数据)的情况下,分离语音信号中的说话人与内容因素。
- 仅使用从未见源说话人和目标说话人学习到的内容与说话人嵌入,实现零样本语音转换。
- 开发一种自监督表征学习方法,生成有意义的说话人嵌入,同时保持内容的解耦性。
- 与现有方法相比,提升解耦表征对未见说话人的泛化能力。
提出的方法
- 一种具有两个专用编码器的全卷积变分自编码器架构:一个用于内容,一个用于说话人表征。
- 引入对抗对比预测编码,通过在时间维度上对比预测表征,同时利用对抗训练优化说话人特异性特征,以促进解耦。
- 模型通过对比未来潜在状态的预测学习解耦表征,采用对比损失,鼓励正样本对之间的相似性,负样本对之间的差异性。
- 说话人编码器被训练为从原始音频中提取说话人特异性特征,通过重新组合内容与说话人嵌入实现零样本语音转换。
- 训练过程中不使用任何平行数据或说话人标注,完全依赖自监督对比学习。
- 利用解耦表征通过将内容从一个说话人转移到另一个说话人来合成语音,实现无需微调的语音转换。
实验结果
研究问题
- RQ1对抗对比预测编码是否能有效在无任何监督的情况下分离语音中的说话人与内容因素?
- RQ2该模型能否在未见源说话人和目标说话人的情况下实现零样本语音转换?
- RQ3在已见和未见说话人设置下,其解耦质量与当前最先进方法相比如何?
- RQ4所提方法是否能在无需说话人标签的情况下生成有意义的说话人嵌入?
主要发现
- 对于训练过程中见过的说话人,该模型实现了具有竞争力的解耦与语音转换性能,达到或超过当前最先进基线。
- 在未见过的说话人上,该模型在零样本语音转换中表现出更优性能,表明所学说话人表征具有强大的泛化能力。
- 未使用说话人标签或平行数据并未影响性能,证实了自监督对比方法的有效性。
- 说话人编码器成功从原始音频中学习到有意义的说话人嵌入,实现无需微调的高精度语音转换。
- 对抗对比预测编码机制通过在潜在空间中分离内容与说话人因素,有效促进了表征解耦。
- 通过重新组合内容与说话人属性,该模型实现了高质量的语音转换,即使在训练时源和目标说话人均未见过的情况下亦成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。