Skip to main content
QUICK REVIEW

[论文解读] AttS2S-VC: Sequence-to-Sequence Voice Conversion with Attention and Context Preservation Mechanisms

Kou Tanaka, Hirokazu Kameoka|arXiv (Cornell University)|Nov 9, 2018
Speech Recognition and Synthesis被引用 12
一句话总结

该论文提出 AttS2S-VC,一种带有注意力机制和上下文保持机制的序列到序列语音转换模型,可实现无需时间对齐平行数据或音素标签的端到端语音谱包络、基频轨迹和时长转换。该方法在仅使用单张 GPU 的一天内完成训练,语音质量优于基于 GMM 的语音转换系统,并达到与 LSTM-TTS 相当的性能。

ABSTRACT

This paper describes a method based on a sequence-to-sequence learning (Seq2Seq) with attention and context preservation mechanism for voice conversion (VC) tasks. Seq2Seq has been outstanding at numerous tasks involving sequence modeling such as speech synthesis and recognition, machine translation, and image captioning. In contrast to current VC techniques, our method 1) stabilizes and accelerates the training procedure by considering guided attention and proposed context preservation losses, 2) allows not only spectral envelopes but also fundamental frequency contours and durations of speech to be converted, 3) requires no context information such as phoneme labels, and 4) requires no time-aligned source and target speech data in advance. In our experiment, the proposed VC framework can be trained in only one day, using only one GPU of an NVIDIA Tesla K80, while the quality of the synthesized speech is higher than that of speech converted by Gaussian mixture model-based VC and is comparable to that of speech generated by recurrent neural network-based text-to-speech synthesis, which can be regarded as an upper limit on VC performance.

研究动机与目标

  • 开发一种语音转换系统,通过避免依赖时间对齐的平行数据,实现训练的稳定与加速。
  • 在单一端到端框架中实现谱包络、基频轨迹和语音时长的联合转换。
  • 在训练过程中消除对音素标签或语言转录文本的需求。
  • 在最小监督条件下实现与最先进文本到语音系统相当的高质量语音转换。

提出的方法

  • 模型采用编码器-解码器架构,并引入注意力机制以对齐长度不同的源序列与目标序列。
  • 提出引导注意力损失,通过鼓励注意力在解码过程中聚焦于相关源帧来稳定训练。
  • 应用上下文保持损失,以在转换过程中保持源语音的时序与频谱上下文。
  • 使用通过 WORLD 语音编码器提取的原始声学特征(梅尔倒谱系数、对数基频和非周期性)进行端到端训练。
  • 解码器生成停止标记以确定序列终止,从而实现可变长度输出生成。
  • 通过调节超参数 λ_cp、λ_ga 和 σ_g 来平衡上下文保持、注意力引导与训练稳定性。

实验结果

研究问题

  • RQ1带有注意力机制与上下文保持机制的序列到序列模型,能否在无需时间对齐平行数据的情况下实现语音转换的稳定且快速训练?
  • RQ2该模型能否在无需音素标签或转录文本的情况下,联合转换谱包络、F0 轨迹与时长?
  • RQ3所提出的方法是否能产生比传统基于 GMM 的语音转换系统更高质量的语音?
  • RQ4在自然度与说话人相似度方面,该模型的性能与最先进端到端文本到语音系统相比如何?

主要发现

  • 主观偏好测试(15名听者参与)表明,所提出的 AttS2S-VC 模型在自然度与说话人相似度方面均优于基于 GMM 的语音转换系统。
  • 该模型的语音质量与基于 LSTM 的文本到语音系统相当,后者被视为语音转换性能的上限。
  • 仅使用一张 NVIDIA Tesla K80 GPU,训练仅耗时一天,展现出极高的训练效率。
  • 该方法不仅能转换谱特征,还能成功转换 F0 轨迹与时长,而传统帧/序列级语音转换系统通常无法实现这一点。
  • 该模型无需音素标签或时间对齐的源-目标语音对,可实现从原始语音序列的完全端到端学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。