Skip to main content
QUICK REVIEW

[論文レビュー] Machine Speech Chain with One-shot Speaker Adaptation

Andros Tjandra, Sakriani Sakti|arXiv (Cornell University)|Mar 28, 2018
Speech Recognition and Synthesis参考文献 25被引用数 13
ひとこと要約

本論文では、自己教師あり学習を活用して、エンドツーエンドの自動音声認識(ASR)および音声合成(TTS)モデルが相互に向上するように、話者認識とワンショット話者適応を統合した機械的音声チェーンフレームワークを提案する。未学習の話者からの1つのリファレンス音声サンプルを用いることで、TTSはその話者の声で音声を生成可能であり、ASRは多様な話者特徴を学習することで、WSJ eval92で9.86%のCERを達成し、7.12%の上界に近く、優れた性能を示した。

ABSTRACT

In previous work, we developed a closed-loop speech chain model based on deep learning, in which the architecture enabled the automatic speech recognition (ASR) and text-to-speech synthesis (TTS) components to mutually improve their performance. This was accomplished by the two parts teaching each other using both labeled and unlabeled data. This approach could significantly improve model performance within a single-speaker speech dataset, but only a slight increase could be gained in multi-speaker tasks. Furthermore, the model is still unable to handle unseen speakers. In this paper, we present a new speech chain mechanism by integrating a speaker recognition model inside the loop. We also propose extending the capability of TTS to handle unseen speakers by implementing one-shot speaker adaptation. This enables TTS to mimic voice characteristics from one speaker to another with only a one-shot speaker sample, even from a text without any speaker information. In the speech chain loop mechanism, ASR also benefits from the ability to further learn an arbitrary speaker's characteristics from the generated speech waveform, resulting in a significant improvement in the recognition rate.

研究の動機と目的

  • マルチスプーカー学習中に未学習の話者を処理できないという、従来の音声チェーンモデルの制限に対処する。
  • 話者認識をループに統合することで、音声-テキストマッピングにおける情報損失を軽減する。
  • ワンショット適応(1つのリファレンスサンプルのみ)を用いて、TTSが未学習の話者に一般化できるようにする。
  • 適応済みTTSが生成する多様な話者特徴を学習させることで、ASRの性能を向上させる。
  • ペアド(音声-テキスト)およびペアドでない(音声のみまたはテキストのみ)データを用いた閉ループフレームワークにおいて、半教師あり学習の有効性を示す。

提案手法

  • 音声から話者埋め込みを抽出するために、音声チェーンループに話者認識モデル(DeepSpeaker)を統合する。
  • TTSにおけるワンショット話者適応を、1つのリファレンス話者埋め込みに条件づけて、新しい話者の声で音声を生成する。
  • ASRとTTSを、ペアド(音声-テキスト)およびペアドでない(音声のみまたはテキストのみ)データを用いて、フィードバックループを通じて共同で学習する。
  • ASRとTTSの両方の訓練において、教師強制(teacher-forcing)を適用し、一方のコンポonentの予測出力をもう一方のコンポーネントの入力として使用する。
  • ラベルなしデータを活用するために、ASRからテキストを生成し、TTSから音声を再構築することで、自己教師あり学習を可能にする。
  • 同じ音声信号からの話者埋め込みを用いてTTSを条件づけることで、1つの例からも声のクローンが可能になる。

実験結果

リサーチクエスチョン

  • RQ11つのリファレンスサンプルのみを用いて、機械的音声チェーンモデルが未学習の話者を効果的に処理できるか。
  • RQ2音声チェーンループに話者認識を統合することで、マルチスプーカーデータにおけるASRおよびTTSの性能がどのように向上するか。
  • RQ3TTSにおけるワンショット話者適応が、合成音声の多様性および現実性をどの程度向上させるか。
  • RQ4ASRとTTSの間の閉ループフィードバック機構が、半教師あり学習環境で顕著な性能向上をもたらすか。
  • RQ5提案されたフレームワークは、豊富なペアドデータを必要とせずに、教師あり上界に近い性能を達成できるか。

主な発見

  • 提案された音声チェーンモデルは、ペアドのSI84(paired)およびペアドでないSI200(unpaired)データを用いた半教師あり学習により、WSJ eval92テストセットで9.86%のCERを達成し、ベースライン(17.35%)およびラベル伝搬法(14.58%)を顕著に上回った。
  • TTSモデルは、提案された音声チェーンを用いて、0.886のlog-MelスペクトログラムL2ノルム平方誤差を達成し、教師あり上界の0.836に近く、優れた性能を示した。
  • ワンショット話者適応により、TTSは1つのリファレンスサンプルのみを用いて、未学習話者の声で高品質な音声を生成可能となった。
  • 適応済みTTSが生成する多様な話者特徴を学習させることで、ASRの性能が顕著に向上した。
  • 話者認識のループ内統合により、話者ばらつきを効果的にモデル化でき、音声チェーンにおける情報損失が低減された。
  • モデルは未学習話者への一般化能力を示し、固定された話者アイデンティティに依存する従来の音声チェーン手法の主な限界を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。