[論文レビュー] Attentron: Few-Shot Text-to-Speech Utilizing Attention-Based Variable-Length Embedding
Attentronは、変動長のスタイルモデリングに注意ベースのエンコーダーを用い、グローバルな安定性を確保する粗粒度エンコーダーを備えた二重エンコーダー構造を採用することで、未学習の話者をわずか数個の参照音声サンプルのみでクローン可能なfew-shot text-to-speechモデルを提案する。これは、話者類似度と音声品質の両面で最先端の性能を達成しており、特に複数の参照入力を用いる場合に顕著に優れている。客観的評価および人間評価の両方で、先行手法を上回っている。
On account of growing demands for personalization, the need for a so-called few-shot TTS system that clones speakers with only a few data is emerging. To address this issue, we propose Attentron, a few-shot TTS model that clones voices of speakers unseen during training. It introduces two special encoders, each serving different purposes. A fine-grained encoder extracts variable-length style information via an attention mechanism, and a coarse-grained encoder greatly stabilizes the speech synthesis, circumventing unintelligible gibberish even for synthesizing speech of unseen speakers. In addition, the model can scale out to an arbitrary number of reference audios to improve the quality of the synthesized speech. According to our experiments, including a human evaluation, the proposed model significantly outperforms state-of-the-art models when generating speech for unseen speakers in terms of speaker similarity and quality.
研究の動機と目的
- 未学習話者に対して、わずか数個の参照音声サンプルでのみパーソナライズ可能なtext-to-speechシステムを実現すること。
- 単一のグローバル話者埋め込みの限界を克服し、詳細な話し方のスタイルを捉えられず、短い参照発話では性能が低下する問題を解決すること。
- 微調整を必要とせず、複数の参照音声入力を効果的にスケーリング可能なfew-shot TTSシステムを設計すること。
- 不正な出力を防ぐために、合成の安定性と品質を向上させるために粗粒度エンコーダーを導入すること。
- 注意機構を用いて可変長埋め込み学習を可能にし、複数の参照から得られる時間的スタイル情報を保持すること。
提案手法
- モデルは、変動長の埋め込み(細粒度エンコーダーからのもの)とグローバル埋め込み(粗粒度エンコーダーからのもの)の2種類の埋め込みを条件として用いる、Tacotron 2ベースのTTSフレームワークを採用している。
- 細粒度エンコーダーは、スケーリングされたドット積注意を用いて、複数の参照音声入力から関連するフレームを抽出し、時間的スタイル情報を保持する可変長埋め込みを生成する。
- 粗粒度エンコーダーは、参照音声の時間的特徴を統合して1つのグローバル埋め込みを生成し、合成の安定性を向上させる。
- デコーダーは、テキストエンコーディングと連結されたグローバル埋め込みに注目する一方、細粒度エンコーダーの出力はブロードキャストされ、自己回帰的スペクトログラム生成の条件付けに用いられる。
- モデルはエンドツーエンドでマルチスプーカーTTSの目的関数に従って学習され、推論段階では任意の数の参照サンプルをサポートする。
- アブレーションスタディにより、粗粒度エンコーダー、細粒度エンコーダー、および注意メカニズムの各要素の影響が評価されている。
実験結果
リサーチクエスチョン
- RQ1わずか数個の参照音声サンプルでのみ、微調整を伴わず未学習話者をクローン可能なfew-shot TTSシステムは構築可能か?
- RQ2可変長埋め込みを注意機構で実現することで、固定長グローバル埋め込みに比べ、話者類似度と音声品質が向上するか?
- RQ3粗粒度エンコーダーの追加が、合成の安定性と理解可能性に与える影響は何か?
- RQ4複数の参照音声サンプルの追加が性能向上に寄与するか?また、より多くの入力に対してもモデルは効果的にスケーリング可能か?
- RQ5提案された注意メカニズムは、平均プーリングや自己注意と比較して、未学習話者への一般化性能に優れているか?
主な発見
- 8つの参照サンプルを訓練時および推論時ともに使用した場合、Attentronは未学習話者に対して0.788の話者類似度と11.67のMCDを達成し、ベースライン手法を顕著に上回っている。
- 訓練時8サンプル、推論時1サンプル(Attentron(8-1))を用いた場合、未学習話者に対して0.769の話者類似度を達成し、単一参照ベースラインに比べて一般化性能が向上していることが示された。
- 粗粒度エンコーダーを削除すると、未学習話者で143件の注意コラプスが発生し、話者類似度が0.738に低下した。これは合成における不安定性を示している。
- 細粒度エンコーダーを平均プーリングや自己注意に置き換えると、未学習話者の話者類似度はそれぞれ0.751および0.755に低下した。これは、注意ベースの可変長埋め込みの必要性を示している。
- 『Encoded value』バージョン(注意値を畳み込み層およびLSTM層で変更)では、未学習話者の話者類似度が0.754に低下した。これは、生の注意特徴を操作することで過学習のリスクが高まることを示している。
- Attentron(8-8)が最良の全体的性能を達成し、訓練時および推論時ともに複数の参照を用いることで、品質と安定性が最大限に向上することを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。