Skip to main content
QUICK REVIEW

[論文レビュー] Voice Conversion by Cascading Automatic Speech Recognition and Text-to-Speech Synthesis with Prosody Transfer

Jingxuan Zhang, Lijuan Liu|arXiv (Cornell University)|Sep 3, 2020
Speech Recognition and Synthesis被引用数 5
ひとこと要約

本論文は、自動音声認識(ASR)と音声合成(TTS)を用いたプロソディー移行を伴う段階的音声変換システムを提案する。音声認識にはiFLYTEK ASRを活用し、学習されたプロソディー符号を条件とするTransformer TTSモデルにより、元の話者からのプロソディーを移行させる。この手法により、Voice Conversion Challenge 2020において自然さと類似性の両面で最先端の性能を達成した。

ABSTRACT

With the development of automatic speech recognition (ASR) and text-to-speech synthesis (TTS) technique, it's intuitive to construct a voice conversion system by cascading an ASR and TTS system. In this paper, we present a ASR-TTS method for voice conversion, which used iFLYTEK ASR engine to transcribe the source speech into text and a Transformer TTS model with WaveNet vocoder to synthesize the converted speech from the decoded text. For the TTS model, we proposed to use a prosody code to describe the prosody information other than text and speaker information contained in speech. A prosody encoder is used to extract the prosody code. During conversion, the source prosody is transferred to converted speech by conditioning the Transformer TTS model with its code. Experiments were conducted to demonstrate the effectiveness of our proposed method. Our system also obtained the best naturalness and similarity in the mono-lingual task of Voice Conversion Challenge 2020.

研究の動機と目的

  • ASRとTTSを用いて、言語的コンテンツと話者アイデンティティを分離する非並列音声変換システムの開発を目的とする。
  • 学習されたプロソディー符号を用いてプロソディーを明示的にモデル化することで、音声変換の自然さと話者類似性を向上させることを目的とする。
  • 従来の認識・合成手法で用いられるフレームレベル特徴(例:PPGs)の制限を克服するため、グローバルプロソディー条件付きのsequence-to-sequence TTSを用いることを目的とする。
  • モノリンガル条件下で、大規模ベンチマークであるVoice Conversion Challenge 2020を用いて手法を評価することを目的とする。

提案手法

  • システムはiFLYTEK ASRエンジンを用いて、元の音声をテキストに変換することで、言語的コンテンツと話者固有の特徴を分離する。
  • Transformer TTSモデルを、テキストと話者埋め込みを用いて、ターゲット話者に対して微調整し、ターゲット音声を生成する。
  • プロソディーエンコーダーが、元の発話からグローバルプロソディー符号を抽出し、ピッチ、エネルギー、タイミングのパターンを捉える。
  • 抽出されたプロソディー符号をターゲットTTSモデルに移行・適用することで、合成時にプロソディー移行を実現する。
  • TTSモデルは、マルチヘッドアテンション、残差接続、レイヤーナーミャライゼーション、WaveNet音声生成器を用い、高精細な音声生成を実現する。
  • マルチスプーカー事前学習と話者固有の微調整戦略を用いて、エンドツーエンドで学習を行う。

実験結果

リサーチクエスチョン

  • RQ1非並列学習データを必要としない段階的ASR-TTSパイプラインが、競争力のある音声変換性能を達成できるか?
  • RQ2学習されたプロソディー符号をTTSモデルに条件付けた場合、変換音声の自然さと類似性が向上するか?
  • RQ3本手法は、特に話者類似性と自然さの観点で、最先端のシステムと比較してどのように差をつけるか?
  • RQ4プロソディー符号は話者に依存しないものか?異なる話者間での効果的なプロソディー移行が可能か?

主な発見

  • 本手法は、Voice Conversion Challenge 2020のモノリンガルトラックで、自然さと類似性の両スコアにおいて、他の全チームを上回る最高の総合的性能を達成した。
  • 自然さの平均意見スコア(MOS)は3.733、類似性は3.704を記録し、自然なターゲット音声と統計的に有意な差が認められなかった。
  • プロソディー符号を含めることで、TEF2ターゲット話者において自然さと類似性にわずかな向上が見られたが、全話者にわたって一貫した利点は観察されなかった。
  • t-SNE可視化により、異なる話者からのプロソディー符号が潜在空間で明確に分離されており、プロソディー符号が話者に依存しないことが確認された。
  • プロソディー移行を含む手法は、VCC2018+ベースラインと同等の結果を達成したが、全体のチャレンジ順位ではそれを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。