Skip to main content
QUICK REVIEW

[论文解读] Global Rhythm Style Transfer Without Text Transcriptions

Kaizhi Qian, Yang Zhang|arXiv (Cornell University)|Jun 16, 2021
Speech Recognition and Synthesis参考文献 42被引用 12
一句话总结

该论文提出 AutoPST,一种基于自编码器的无监督全局语调风格迁移框架,可在无需文本转录或细粒度语调注释的情况下,解耦节奏与音高。通过采用由自表达表示学习引导的节奏去除模块及两阶段训练策略,AutoPST 能够有效实现语音领域之间的语调迁移,尤其在节奏迁移方面显著优于基线模型,在感知相似性和细粒度节奏恢复方面表现更优。

ABSTRACT

Prosody plays an important role in characterizing the style of a speaker or an emotion, but most non-parallel voice or emotion style transfer algorithms do not convert any prosody information. Two major components of prosody are pitch and rhythm. Disentangling the prosody information, particularly the rhythm component, from the speech is challenging because it involves breaking the synchrony between the input speech and the disentangled speech representation. As a result, most existing prosody style transfer algorithms would need to rely on some form of text transcriptions to identify the content information, which confines their application to high-resource languages only. Recently, SpeechSplit has made sizeable progress towards unsupervised prosody style transfer, but it is unable to extract high-level global prosody style in an unsupervised manner. In this paper, we propose AutoPST, which can disentangle global prosody style from speech without relying on any text transcriptions. AutoPST is an Autoencoder-based Prosody Style Transfer framework with a thorough rhythm removal module guided by the self-expressive representation learning. Experiments on different style transfer tasks show that AutoPST can effectively convert prosody that correctly reflects the styles of the target domains.

研究动机与目标

  • 解决在无需依赖文本转录或局部语调注释的情况下实现语音全局语调风格迁移的挑战。
  • 在无监督条件下从语音表征中解耦节奏与音高成分,同时保留内容信息而仅改变风格。
  • 在缺乏文本转录的低资源或零资源语言设置下,实现有效的语调迁移。
  • 提升语调迁移的感知质量和准确性,特别是在语速和节奏方面的表现,适用于说话人与情感风格迁移任务。
  • 开发一种可泛化至多种风格迁移应用(如语音与情感风格迁移)的框架,且无需领域特定的真实语调数据。

提出的方法

  • AutoPST 是一种基于自编码器的框架,通过两阶段训练过程将语音分解为内容、音色和语调成分,以防止节奏信息泄露至内容表征中。
  • 提出一种新颖的节奏去除模块,由自表达表示学习引导,促使模型学习紧凑且解耦的节奏模式表征。
  • 自表达表示学习组件强制要求每个语音表征可表示为其他表征的线性组合,从而促进鲁棒且解耦的节奏建模。
  • 框架使用对比损失对齐不同风格下相同内容的潜在码,确保风格迁移过程中内容的保留。
  • 采用两阶段训练策略:首先训练模型在去除节奏的同时重建内容,然后微调模型以在保留内容的同时将语调迁移到目标领域。
  • 模型通过重建损失、对比损失和循环一致性损失的组合实现端到端训练,以确保忠实的风格迁移。

实验结果

研究问题

  • RQ1是否可以在无需文本转录或细粒度语调注释的情况下实现全局语调风格迁移?
  • RQ2自表达表示学习方法是否能有效解耦语音中的节奏,而无需依赖与音素转录的对齐?
  • RQ3所提出的 AutoPST 框架是否在感知质量上显著优于现有无监督基线模型?
  • RQ4AutoPST 是否能够恢复细粒度节奏模式(如被拉长两倍的单词“yellow”),而不仅调整整体语速?
  • RQ5在无法获取特定情感的真实语调数据的情况下,AutoPST 在非平行情感风格迁移任务中的泛化能力如何?

主要发现

  • AutoPST 在语调相似性方面显著优于基线模型,主观评估显示其与目标说话人的感知相似度远高于 AutoVC 或 RR。
  • 在说话人风格迁移任务中,AutoPST 的语调相似性得分显著高于基线模型,表明其在节奏与音高轮廓迁移方面具有高效性。
  • AutoPST 能够成功恢复异常拉长的单词(如“yellow”被拉长两倍),使其恢复至原始时长,证明其具备细粒度节奏模式识别能力。
  • 在情感风格迁移中,AutoPST 将快速(中性)与慢速(困倦)情感之间的相对时长差异调整为正值,表明节奏迁移正确,而基线模型未能实现此效果。
  • AutoPST 与 AutoVC 保持了较强的音色相似度,表明其语调迁移未损害音质,且由于实现了完整风格迁移,整体感知相似度更高。
  • 该模型在未见的情感类别和说话人身份上表现出良好的泛化能力,表明其在多样化领域间具备鲁棒性与可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。