Skip to main content
QUICK REVIEW

[论文解读] DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System

Liqiang Zhang, Chengzhu Yu|arXiv (Cornell University)|Aug 7, 2020
Speech Recognition and Synthesis参考文献 23被引用 13
一句话总结

本文提出DurIAN-SC,一种统一的歌唱语音转换系统,通过将语音合成与歌唱合成整合到单一框架中,仅使用20秒目标说话人的语音数据即可生成高质量的歌唱语音。该系统采用预训练的说话人d-vector网络进行说话人嵌入,实现无需微调的一次性转换,并在极少量目标数据下仍能保持高度自然度与相似度。

ABSTRACT

Singing voice conversion is converting the timbre in the source singing to the target speaker's voice while keeping singing content the same. However, singing data for target speaker is much more difficult to collect compared with normal speech data.In this paper, we introduce a singing voice conversion algorithm that is capable of generating high quality target speaker's singing using only his/her normal speech data. First, we manage to integrate the training and conversion process of speech and singing into one framework by unifying the features used in standard speech synthesis system and singing synthesis system. In this way, normal speech data can also contribute to singing voice conversion training, making the singing voice conversion system more robust especially when the singing database is small.Moreover, in order to achieve one-shot singing voice conversion, a speaker embedding module is developed using both speech and singing data, which provides target speaker identify information during conversion. Experiments indicate proposed sing conversion system can convert source singing to target speaker's high-quality singing with only 20 seconds of target speaker's enrollment speech data.

研究动机与目标

  • 开发一种对目标说话人数据需求极少的歌唱语音转换系统,尤其在缺乏歌唱数据时仍能有效工作。
  • 将语音与歌唱合成训练统一于单一框架,以提升数据效率。
  • 仅使用20秒目标说话人数据,实现对未见说话人的单次语音转换。
  • 评估预训练说话人d-vector嵌入与可训练LUT嵌入在歌唱语音转换中的效果差异。

提出的方法

  • 模型采用统一的DurIAN架构实现语音与歌唱合成,共享相同的声学特征生成框架。
  • 输入特征包括文本/歌词、带语调的音素序列、帧级基频(f0)以及均方根能量(RMSE),用于时长与音高控制。
  • 说话人身份通过从目标说话人20秒语音或歌唱片段中提取的预训练d-vector进行编码。
  • 系统在混合语音与歌唱数据上进行训练,使语音数据能够辅助歌唱语音的学习。
  • 采用统一的损失函数,在端到端训练中同时优化自然度与相似度。
  • 说话人d-vector从预训练的说话人识别模型中提取,与主模型训练解耦。

实验结果

研究问题

  • RQ1统一的语音与歌唱语音转换框架能否有效利用仅语音数据训练出高质量的歌唱语音转换模型?
  • RQ2在转换质量与对未见说话人的泛化能力方面,预训练说话人d-vector嵌入相较于可训练LUT嵌入表现如何?
  • RQ3当歌唱数据稀缺或不可用时,语音数据在多大程度上能提升歌唱语音转换性能?
  • RQ4能否仅使用20秒目标说话人数据,配合预训练说话人嵌入模块,实现一次性歌唱语音转换?

主要发现

  • 在设定内说话人评估中,所提出的d-vector说话人嵌入系统在自然度(3.70 vs. 3.61)与相似度(3.61 vs. 3.56)方面均优于LUT基线。
  • 对于设定外说话人,d-vector方法实现了3.10的相似度MOS,证明了无需模型微调即可实现一次性转换的可行性。
  • 仅使用语音数据进行训练时,相似度MOS为3.71,自然度MOS为3.65,与混合数据(3.74和3.71)及纯歌唱数据(3.61和3.70)基线水平相当。
  • 在训练中加入语音数据可提升发音清晰度,并增强生成歌唱语音的相似度。
  • 该系统在极少量数据下实现了高质量的歌唱语音转换,证实语音数据可有效支持歌唱语音学习。
  • 预训练d-vector模块实现了对未见说话人的鲁棒一次性转换,无需为每位新用户重新训练或微调模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。