Skip to main content
QUICK REVIEW

[論文レビュー] A Unified Speaker Adaptation Method for Speech Synthesis using Transcribed and Untranscribed Speech with Backpropagation

Hieu-Thi Luong, Junichi Yamagishi|arXiv (Cornell University)|Jun 18, 2019
Speech Recognition and Synthesis参考文献 67被引用数 9
ひとこと要約

本稿は、音声の字幕ありまたはなしの両方のデータを用いて、バックプロパゲーションに基づくエンドツーエンドの微調整が可能な統合的スピーカー適応フレームワークを提案する。音声モデルをスピーカーに依存しない言語的エンコーダーとスピーカー適応型デコーダーに因子分解し、無教師適応用の補助エンコーダーを導入することで、字幕なしデータですら優れた主観的品質を達成し、人間評価においても教師ありベースラインを上回ることを実証した。

ABSTRACT

By representing speaker characteristic as a single fixed-length vector extracted solely from speech, we can train a neural multi-speaker speech synthesis model by conditioning the model on those vectors. This model can also be adapted to unseen speakers regardless of whether the transcript of adaptation data is available or not. However, this setup restricts the speaker component to just a single bias vector, which in turn limits the performance of adaptation process. In this study, we propose a novel speech synthesis model, which can be adapted to unseen speakers by fine-tuning part of or all of the network using either transcribed or untranscribed speech. Our methodology essentially consists of two steps: first, we split the conventional acoustic model into a speaker-independent (SI) linguistic encoder and a speaker-adaptive (SA) acoustic decoder; second, we train an auxiliary acoustic encoder that can be used as a substitute for the linguistic encoder whenever linguistic features are unobtainable. The results of objective and subjective evaluations show that adaptation using either transcribed or untranscribed speech with our methodology achieved a reasonable level of performance with an extremely limited amount of data and greatly improved performance with more data. Surprisingly, adaptation with untranscribed speech surpassed the transcribed counterpart in the subjective test, which reveals the limitations of the conventional acoustic model and hints at potential directions for improvements.

研究の動機と目的

  • マルチスプリーカーTTSモデルにおける固定されたスピーカー埋め込みベクトルの制限を解消し、適応性能を向上させること。
  • エンドツーエンドのバックプロパゲーションを用いて、字幕ありおよびなしの両方の音声データを効果的に活用したスピーカー適応を可能にすること。
  • 言語的教師信号が欠如するにもかかわらず、無教師適応が主観的品質で教師あり適応を上回る可能性を検証すること。
  • スピーカーに依存しない成分とスピーカー適応型成分を分離した因子分解型音声モデルアーキテクチャを構築し、柔軟な微調整を可能にすること。
  • 全音声デコーダーの微調整と一部レイヤーの微調整の違いが適応性能に与える影響を評価すること。

提案手法

  • 音声モデルをスピーカーに依存しない(SI)言語的エンコーダーとスピーカー適応型(SA)音声デコーダーに因子分解し、モジュラーな適応が可能になる。
  • 補助音声エンコーダーを、言語的特徴を音声のみから再構成するように訓練することで、字幕が利用できない状況でも無教師適応が可能になる。
  • 字幕あり適応では、正解の字幕を用いてバックプロパゲーションによるネットワーク全体の微調整が行われる。
  • 字幕なし適応では、補助エンコーダーが言語的エンコーダーに代わる形で使用され、音声波形のみを用いてSAデコーダー全体が微調整される。
  • SAデコーダーの全層または部分層の微調整が可能であり、スケーリングおよびバイアスコードのアブレーションスタディが実施されている。
  • エンドツーエンドのバックプロパゲーションを活用した統合的トレーニングおよび適応フレームワークを実装し、教師ありおよび無教師設定の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1バックプロパゲーションを用いて、字幕ありおよびなしの両方の音声データを統合的に活用できるフレームワークが、効果的なスピーカー適応を達成できるか。
  • RQ2音声波形のみを用いた無教師適応が、字幕付きの教師あり適応を主観的品質で上回るか。
  • RQ3音声デコーダー全体を微調整するのと、スピーカー関連のコンponentsのみを微調整するのとでは、適応性能にどのような差が生じるか。
  • RQ4音声のみで訓練された補助エンコーダーが、無教師適応において言語的エンコーダーの代わりに効果的に機能するか。
  • RQ5スプーラー固有の適応戦略(例:スケーリングおよびバイアスコード)が適応品質に与える影響は何か。

主な発見

  • 字幕なし音声のみを用いた無教師適応手法が、教師あり手法を著しく上回る主観的品質を達成し、テストセットにおける平均MOSスコアは3.45を記録した。
  • 320発話のデータで、無教師モデルBaB^all_uは4段階スケールで平均類似度スコア3.12を達成し、特定のスピーカーにおいては教師ありモデルBaB^all_s+(3.11)およびBaB^all_u(2.86)を上回った。
  • 10発話のデータでは、教師ありモデルBaB^all_s+の平均品質スコアは2.88であったが、無教師モデルBaB^all_uは2.98を記録し、最小限のデータでも優れた性能を示した。
  • 無教師モデルBaB^all_uは平均MOS(3.45)が最も高く、ペairwise比較において59%の選択を獲得し、言語的教師信号が欠如しているにもかかわらず、より自然な音声を生成した。
  • 音声デコーダー全体を微調整したモデル(BaB^all)は、教師ありおよび無教師設定の両方で部分的微調整を上回った。
  • 無教師システムBaB^all_uは、英語アクセントでないスピーカー(p264およびp345)において類似度が最も低く、字幕なしでは言語的マッピングに限界がある可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。