[论文解读] Voice Conversion by Cascading Automatic Speech Recognition and Text-to-Speech Synthesis with Prosody Transfer
本文提出了一种基于自动语音识别(ASR)和文本到语音(TTS)合成的级联语音转换系统,结合韵律迁移技术。该方法利用讯飞ASR进行文本转录,并采用基于学习到的韵律编码条件化的Transformer TTS模型实现源说话人韵律的迁移,从而在语音转换挑战赛2020中实现了自然度和相似度方面的最先进性能。
With the development of automatic speech recognition (ASR) and text-to-speech synthesis (TTS) technique, it's intuitive to construct a voice conversion system by cascading an ASR and TTS system. In this paper, we present a ASR-TTS method for voice conversion, which used iFLYTEK ASR engine to transcribe the source speech into text and a Transformer TTS model with WaveNet vocoder to synthesize the converted speech from the decoded text. For the TTS model, we proposed to use a prosody code to describe the prosody information other than text and speaker information contained in speech. A prosody encoder is used to extract the prosody code. During conversion, the source prosody is transferred to converted speech by conditioning the Transformer TTS model with its code. Experiments were conducted to demonstrate the effectiveness of our proposed method. Our system also obtained the best naturalness and similarity in the mono-lingual task of Voice Conversion Challenge 2020.
研究动机与目标
- 开发一种非平行语音转换系统,通过ASR与TTS实现语言内容与说话人身份的解耦。
- 通过使用学习到的韵律编码显式建模韵律,提升语音转换的自然度与说话人相似度。
- 通过采用序列到序列TTS并引入全局韵律条件,克服先前识别-合成方法中帧级特征(如PPG)的局限性。
- 在大规模基准数据集——语音转换挑战赛2020上,在单语条件下评估该方法。
提出的方法
- 系统使用讯飞ASR引擎将源语音转录为文本,实现语言内容与说话人特性的解耦。
- 使用文本和说话人嵌入对Transformer TTS模型进行微调,以生成目标语音。
- 韵律编码器从源语音中提取全局韵律编码,捕捉基频、能量与时间模式。
- 将韵律编码迁移并用于条件化目标TTS模型,实现在合成过程中韵律的迁移。
- TTS模型采用多头注意力、残差连接、层归一化,并结合WaveNet声码器以实现高保真语音生成。
- 该方法采用多说话人预训练与说话人特定微调相结合的端到端训练策略。
实验结果
研究问题
- RQ1级联的ASR-TTS流水线是否能在无需并行训练数据的情况下实现具有竞争力的语音转换性能?
- RQ2通过使用学习到的韵律编码条件化TTS模型,是否能提升转换语音的自然度与相似度?
- RQ3与最先进系统相比,该方法在说话人相似度与自然度方面表现如何?
- RQ4该韵律编码是否具有说话人无关性,从而实现在不同说话人之间的有效韵律迁移?
主要发现
- 所提方法在语音转换挑战赛2020的单语赛道中取得最佳整体性能,在自然度与相似度得分上均超越所有其他参赛团队。
- 系统在自然度方面取得平均意见评分(MOS)3.733,在相似度方面取得3.704,与自然目标语音相比无显著统计差异。
- 引入韵律编码在TEF2目标说话人上带来自然度与相似度的轻微提升,但在所有说话人中未观察到一致优势。
- t-SNE可视化结果证实,韵律编码具有说话人无关性,不同说话人的编码在潜在空间中清晰分离。
- 采用韵律迁移的方法在整体挑战排名中表现优于VCC2018+基线,结果相当甚至更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。