[论文解读] Many-to-Many Voice Transformer Network
本文提出了一种多对多语音转换变换器网络(VTN),将原始的序列到序列(S2S)语音转换模型扩展为通过共享潜在空间同时学习多个说话人之间的映射。通过引入身份映射损失和多说话人条件控制,该模型在语音质量和说话人相似度方面优于基线方法,尤其在主观听音测试中表现优异,并支持超越一对一场景的灵活转换。
This paper proposes a voice conversion (VC) method based on a sequence-to-sequence (S2S) learning framework, which enables simultaneous conversion of the voice characteristics, pitch contour, and duration of input speech. We previously proposed an S2S-based VC method using a transformer network architecture called the voice transformer network (VTN). The original VTN was designed to learn only a mapping of speech feature sequences from one speaker to another. The main idea we propose is an extension of the original VTN that can simultaneously learn mappings among multiple speakers. This extension called the many-to-many VTN makes it able to fully use available training data collected from multiple speakers by capturing common latent features that can be shared across different speakers. It also allows us to introduce a training loss called the identity mapping loss to ensure that the input feature sequence will remain unchanged when the source and target speaker indices are the same. Using this particular loss for model training has been found to be extremely effective in improving the performance of the model at test time. We conducted speaker identity conversion experiments and found that our model obtained higher sound quality and speaker similarity than baseline methods. We also found that our model, with a slight modification to its architecture, could handle any-to-many conversion tasks reasonably well.
研究动机与目标
- 通过利用序列到序列(S2S)学习来解决现有语音转换(VC)方法在处理超音段特征(如基频轮廓和时长)方面的局限性。
- 将原始的语音转换变换器网络(VTN)从一对一扩展为多对多说话人转换,实现对多个说话人的联合建模。
- 通过引入身份映射损失,保留当源说话人与目标说话人相同时的输入特征,从而提升模型泛化能力和性能。
- 实现灵活的VC任务,包括任意对多对转换和实时转换,且无需文本转录或自动语音识别(ASR)。
- 在同性别和异性别说话人对之间,通过客观指标和主观听音测试综合评估模型性能。
提出的方法
- 通过使用说话人嵌入向量对原始VTN架构进行扩展,以支持多个源说话人和目标说话人。
- 引入身份映射损失,当源说话人和目标说话人索引相同时,惩罚输出与输入之间的偏差,从而促使模型保留输入特征。
- 采用基于变换器的编码器-解码器架构,利用多头自注意力机制建模语音序列中的长距离依赖关系。
- 在实验中使用WORLD声码器进行波形生成,但建议未来采用端到端训练的神经声码器作为改进。
- 在所有说话人之间共享潜在空间,以捕捉共同的语调和谱特征,提升数据效率和泛化能力。
- 通过修改架构以在推理时允许任意目标说话人嵌入,支持任意对多对转换。
实验结果
研究问题
- RQ1在多个说话人上联合训练的序列到序列语音转换模型,能否学习共享的语调和谱表征以提升转换质量?
- RQ2身份映射损失在源说话人与目标说话人相同时,对保留输入特征的有效性如何?是否提升了泛化能力?
- RQ3在主观评估中,多对多VTN是否在语音质量和说话人相似度方面优于一对一和基线S2S-VC模型?
- RQ4通过将说话人嵌入替换为说话人验证嵌入,模型是否能泛化到未见说话人(零样本VC)?
- RQ5多对多VTN是否能够处理灵活的转换任务,如任意对多对或实时转换,而无需文本注释?
主要发现
- 多对多VTN在语音质量方面的平均意见得分(MOS)显著高于所有对比方法,仅略低于多对多ConvS2S-VC,Mann-Whitney检验的p值均小于0.05。
- 在主观听音测试中,该模型在说话人相似度方面优于一对一VTN和其他S2S基线模型,且差异具有统计学显著性(p < 0.05)。
- 尽管客观指标(MCD和LFC)低于多对多ConvS2S-VC,但多对多VTN在主观质量上表现更优,表明感知质量与模型设计之间存在强相关性。
- 身份映射损失被证明在提升推理阶段性能方面非常有效,尤其在保留说话人身份和自然度方面。
- 当与说话人验证嵌入结合时,该模型在未见说话人上表现出强大的泛化能力,表明零样本语音转换具有可行性。
- 架构扩展使得在仅进行最小修改的情况下,即可实现合理的任意对多对转换任务性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。