Skip to main content
QUICK REVIEW

[论文解读] The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS

Wen-Chin Huang, Tomoki Hayashi|arXiv (Cornell University)|Oct 6, 2020
Speech Recognition and Synthesis被引用 7
一句话总结

本文提出了一种用于 Voice Conversion Challenge 2020 的序列到序列(seq2seq)基线系统,采用 ESPnet 和预训练模型构建级联的自动语音识别(ASR)与文本到语音(TTS)流水线。尽管系统设计简单,但在语音转换相似度方面表现优异,排名第二,充分展示了即使在非平行数据和有限微调数据条件下,seq2seq 建模在说话人身份转换任务中的强大潜力。

ABSTRACT

This paper presents the sequence-to-sequence (seq2seq) baseline system for the voice conversion challenge (VCC) 2020. We consider a naive approach for voice conversion (VC), which is to first transcribe the input speech with an automatic speech recognition (ASR) model, followed using the transcriptions to generate the voice of the target with a text-to-speech (TTS) model. We revisit this method under a sequence-to-sequence (seq2seq) framework by utilizing ESPnet, an open-source end-to-end speech processing toolkit, and the many well-configured pretrained models provided by the community. Official evaluation results show that our system comes out top among the participating systems in terms of conversion similarity, demonstrating the promising ability of seq2seq models to convert speaker identity. The implementation is made open-source at: https://github.com/espnet/espnet/tree/master/egs/vcc20.

研究动机与目标

  • 建立一个简单、开源且具有竞争力的语音转换基线系统,采用级联的 ASR 与 TTS 流水线。
  • 评估 seq2seq 模型在语音转换中的有效性,特别是在非平行训练数据条件下的表现。
  • 研究在低资源环境下,预训练 ASR 与 TTS 模型在跨语言语音转换中的性能表现。
  • 识别在有限微调数据条件下,级联系统在语音质量与可懂度方面的关键局限性。
  • 为语音转换领域的未来研究提供基准,尤其面向该领域的初学者。

提出的方法

  • 系统使用与说话人无关的 seq2seq ASR 模型,将源语音转录为语言内容,同时保留音素与语调信息。
  • 针对每个目标说话人,使用其有限数据(70 个语音样本)对说话人相关的 seq2seq TTS 模型进行微调,以合成具有目标说话人音色的语音。
  • TTS 模型在微调前,先在大规模多语言 TTS 数据集上进行预训练。
  • 采用非自回归神经声码器生成最终的语音波形,优先考虑推理速度。
  • 所有组件均基于 ESPnet 实现,利用社区提供的预训练模型与标准化训练协议。
  • 系统在 VCC2020 的两个任务中进行评估:同语种半平行语音转换与跨语言语音转换,采用主观与客观指标进行分析。

实验结果

研究问题

  • RQ1尽管是非端到端方法,级联的 seq2seq ASR+TTS 流水线是否能在语音转换中实现具有竞争力的性能?
  • RQ2在低资源、非平行语音转换场景下,使用预训练 ASR 与 TTS 模型的效果如何?
  • RQ3该级联系统的主要性能瓶颈是什么,特别是在语音质量与可懂度方面?
  • RQ4seq2seq 建模在语音转换过程中,对语调特征(如基频、时长与语速)的保留程度如何?
  • RQ5系统在不同语言对之间,特别是在目标语言不熟悉的情况下,表现如何?

主要发现

  • 系统在 VCC2020 挑战赛中实现了约 90% 的转换相似度得分,在 28 支队伍中排名第二,充分证明了说话人身份转换能力的强大。
  • 在任务 1(同语种半平行)中,系统在自然度方面的 MOS 得分为 3.0,相似度得分为 90%,表明输出质量较高。
  • 在任务 2(跨语言)中,系统自然度 MOS 降至 2.0,在 28 支队伍中排名第 21 位,表明语音质量显著下降。
  • 尽管存在语言与数据差异,系统在相似度得分上仍保持第 9 名,表明其能有效保留说话人特征。
  • 转换语音的 ASR 错误率显著高于源语音,表明 TTS 建模的不完善是导致可懂度下降的主要原因。
  • 系统与顶尖队伍之间的性能差距主要源于有限的微调数据(每名目标说话人仅 70 个语音样本),凸显了数据稀缺是关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。