Skip to main content
QUICK REVIEW

[论文解读] MR-SVS: Singing Voice Synthesis with Multi-Reference Encoder

Shoutong Wang, Jinglin Liu|arXiv (Cornell University)|Jan 11, 2022
Music and Audio Processing被引用 7
一句话总结

MR-SVS 提出了一种零样本多说话人歌唱语音合成模型,通过将固定大小的说话人编码器与基于多头注意力的多参考编码器相结合,增强了音色建模能力。该多参考编码器可处理多个参考音频,以捕捉精细的语音特征。该方法还引入了一种音高偏移技术,以解决音高不一致问题,显著提升了合成语音的自然度与说话人相似度,该结论已通过 MOS 评估验证。

ABSTRACT

Multi-speaker singing voice synthesis is to generate the singing voice sung by different speakers. To generalize to new speakers, previous zero-shot singing adaptation methods obtain the timbre of the target speaker with a fixed-size embedding from single reference audio. However, they face several challenges: 1) the fixed-size speaker embedding is not powerful enough to capture full details of the target timbre; 2) single reference audio does not contain sufficient timbre information of the target speaker; 3) the pitch inconsistency between different speakers also leads to a degradation in the generated voice. In this paper, we propose a new model called MR-SVS to tackle these problems. Specifically, we employ both a multi-reference encoder and a fixed-size encoder to encode the timbre of the target speaker from multiple reference audios. The Multi-reference encoder can capture more details and variations of the target timbre. Besides, we propose a well-designed pitch shift method to address the pitch inconsistency problem. Experiments indicate that our method outperforms the baseline method both in naturalness and similarity.

研究动机与目标

  • 为解决零样本歌唱语音合成中单参考、固定大小说话人嵌入的局限性,这些局限性无法捕捉完整的音色细节,并且存在音高不一致问题。
  • 通过利用多个参考音频片段,采用基于多头注意力的编码器捕捉语音特征在帧级别上的变化,从而改进音色建模。
  • 通过引入一种音高偏移方法,将生成的音高轮廓与目标说话人的平均音高对齐,以减轻跨说话人(尤其是跨性别)的音高不一致问题。
  • 在保持零样本方法效率与便捷性的同时,显著提升低资源环境下的合成质量。

提出的方法

  • 多参考编码器通过将多个参考音频转换为梅尔频谱图,并经过卷积层与双向 LSTM 层,提取上下文感知的表示。
  • 多参考编码器使用多头自注意力机制,通过关注多个参考音频中不同的语音属性,计算高保真度的帧级嵌入,其中查询(query)、键(key)和值(value)矩阵均来自隐藏状态。
  • 模型将固定大小的说话人嵌入(即参考嵌入的平均值)与帧级多参考嵌入相结合,以对每个合成帧的声学模型进行条件控制。
  • 在推理阶段应用音高偏移方法,将输入音高轮廓调整至与目标说话人平均音高一致,从而降低音高不一致问题。
  • 整体模型基于修改后的 FastSpeech 2 架构,输入包括音素、时长、音高和说话人嵌入,通过重建损失预测梅尔频谱图。

实验结果

研究问题

  • RQ1与单个固定大小嵌入相比,处理多个参考音频的多参考编码器是否能提升零样本歌唱语音合成中的音色表征能力?
  • RQ2在多参考编码器中使用多头注意力机制是否能增强对不同演唱帧之间细微语音变化的建模能力?
  • RQ3音高不一致(尤其是跨性别配对)在多大程度上会降低歌唱语音合成的质量?该问题是否能被有效缓解?
  • RQ4将固定大小嵌入与多参考嵌入结合使用,与单独使用任一组件相比,在自然度与相似度方面表现如何?

主要发现

  • MR-SVS 模型在同性别歌唱合成中,自然度的平均意见评分(MOS)达到 4.42 ± 0.03,相似度达到 4.18 ± 0.03,显著优于基线模型。
  • 通过引入音高偏移方法,模型在跨性别转换中的相似度 MOS 提升超过 0.15 分(例如,从 3.51 ± 0.07 提升至 3.70 ± 0.05),证明其在缓解音高不一致方面的有效性。
  • 消融实验表明,仅使用多参考编码器时,其在相似度方面表现反而劣于基线,说明固定大小嵌入在整体音色建模中至关重要。
  • 单头多参考编码器虽优于基线,但多头版本进一步提升了性能,证实注意力机制在捕捉多样化语音特征方面的优势。
  • 该模型支持可控合成:通过修改输入音高、音素或时长,用户可改变旋律或内容,同时保持说话人身份不变,从而支持新型音乐制作工作流。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。