Skip to main content
QUICK REVIEW

[論文レビュー] VoiceLoop: Voice Fitting and Synthesis via a Phonological Loop

Yaniv Taigman, Lior Wolf|arXiv (Cornell University)|Jul 20, 2017
Speech Recognition and Synthesis参考文献 20被引用数 13
ひとこと要約

VoiceLoopは、発音音素のアライメントや言語的特徴を必要とせず、制約のないリアルな音声サンプルから自然な音声を合成する新しいニューラル音声合成システムを提案する。長期間の依存関係を維持するために、音声ループにインspiredされた共有でシフトするバッファメモリを採用し、最小限のデータでも強力なボイスフィッティングと合成が可能であり、数個の音声サンプルでの新しい話者の後処理適応も可能である。

ABSTRACT

We present a new neural text to speech (TTS) method that is able to transform text to speech in voices that are sampled in the wild. Unlike other systems, our solution is able to deal with unconstrained voice samples and without requiring aligned phonemes or linguistic features. The network architecture is simpler than those in the existing literature and is based on a novel shifting buffer working memory. The same buffer is used for estimating the attention, computing the output audio, and for updating the buffer itself. The input sentence is encoded using a context-free lookup table that contains one entry per character or phoneme. The speakers are similarly represented by a short vector that can also be fitted to new identities, even with only a few samples. Variability in the generated speech is achieved by priming the buffer prior to generating the audio. Experimental results on several datasets demonstrate convincing capabilities, making TTS accessible to a wider range of applications. In order to promote reproducibility, we release our source code and models.

研究の動機と目的

  • YouTubeのスピーチなど、背景ノイズや clap、低品質な音声を含む制約のないリアルな音声サンプルから音声合成を可能にすること。
  • TTSの学習および推論において、アライメント済みの音素-音響データや明示的な言語的特徴を排除すること。
  • 数個の短い音声クリップのみを用いて、新しい話者のための後処理ボイスフィッティングを可能にすること。
  • モバイルデバイスでのリアルタイム推論に適した軽量で効率的なアーキテクチャの開発。

提案手法

  • 動的作業メモリとして、S ∈ ℝ^d×k の形をしたシフトするバッファメモリ行列が使用され、各時刻ステップで各列が右にシフトされ、新しい表現ベクトル u が先頭に挿入される。
  • 表現ベクトル u は、話者埋め込み、現在のアテンションコンテキスト、直前の出力、および全バッファ状態を入力とする浅い全結合ネットワークによって計算される。
  • アテンション機構は、Gravesの単調アテンションを用いて、音素埋め込みからコンテキストベクトルを計算し、逐次的かつ左から右への処理フローを保証する。
  • 出力音声は、バッファ状態と話者埋め込みを入力とする別個の浅いネットワークによって生成され、直接的かつパーソナライズされた合成が可能になる。
  • 話者アイデンティティは、学習された埋め込みベクトルによってモデル化され、最小限のデータで学習後微調整または新規アイデンティティへの適合が可能になる。
  • プリミングにより、前の単語のコンテキストベクトルをバッファに初期化することで、同じ入力テキストから多様なイントネーションを生成可能になり、複数のプロソディックなバリエーションが得られる。

実験結果

リサーチクエスチョン

  • RQ1制約のない、リアルな音声サンプルから、音素や言語的特徴のアライメントがなくても、高品質な音声合成が可能なニューラルTTSシステムは実現可能か?
  • RQ2RNNと比較して、共有でシフトするバッファメモリ機構は、音声合成における長期依存関係のモデル化にどの程度効果的か?
  • RQ3再トレーニングなしに、数個の短い音声クリップでのみ、モデルは新しい話者に一般化可能か?
  • RQ4音声ループにインspiredされたメモリアーキテクチャは、ノイズや非理想的な録音条件に対してどの程度のロバストネスを向上させるか?
  • RQ5バッファを異なる単語(例:'I'、'had'、'must'、'bye')でプリミングすることで、同じテキスト入力から多様なプロソディックなバリエーション(例:異なるイントネーション)を生成できるか?

主な発見

  • VoiceLoopは、実世界のYouTubeデータセットにおいて、MOS(平均評価得点)2.97 ± 1.03を達成し、ノイズが多くアライメントのとれていない学習データでも、人間が受け入れ可能な音声品質であることが示された。
  • 話者識別ネットワークは、合成音声上でトップ1正答率95.81%を達成し、合成された声がターゲット話者のアイデンティティと密接に一致していることが示された。
  • ベースラインのChar2Wavモデルとは異なり、モデルはclap や笑いなどの背景ノイズを合成しなかった。
  • 異なる単語(例:'I'、'had'、'must'、'bye')でバッファをプリミングすることで、スペクトログラムおよびF0解析により、F0や音節長の変化を伴う明確なプロソディックパターンの違いが得られた。
  • システムはCPU上で2.7倍以上のリアルタイム推論速度を達成し、モバイルデバイスへの展開に適した高い計算効率を示した。
  • 数秒程度の音声データのみで後処理話者フィッティングが有効であったため、最小限のデータでゼロショットボイスクラーニングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。