[論文レビュー] AdaSpeech 3: Adaptive Text to Speech for Spontaneous Style
AdaSpeech 3 は、事前学習済みのリーディングスタイルTTSモデルを、埋め込み一時停止(FP)予測子と混合専門家(MoE)型持続時間予測子を導入することで、自然な一時停止と多様なリズムをモデル化することにより、即興的発話合成に適応するテキストから音声への変換システムを提案する。この手法は自然さと即興性において顕著な向上を達成し、ベースラインのAdaSpeechと比較してMOSが0.24高く、SMOSスコアが0.3高い結果を得た。
While recent text to speech (TTS) models perform very well in synthesizing reading-style (e.g., audiobook) speech, it is still challenging to synthesize spontaneous-style speech (e.g., podcast or conversation), mainly because of two reasons: 1) the lack of training data for spontaneous speech; 2) the difficulty in modeling the filled pauses (um and uh) and diverse rhythms in spontaneous speech. In this paper, we develop AdaSpeech 3, an adaptive TTS system that fine-tunes a well-trained reading-style TTS model for spontaneous-style speech. Specifically, 1) to insert filled pauses (FP) in the text sequence appropriately, we introduce an FP predictor to the TTS model; 2) to model the varying rhythms, we introduce a duration predictor based on mixture of experts (MoE), which contains three experts responsible for the generation of fast, medium and slow speech respectively, and fine-tune it as well as the pitch predictor for rhythm adaptation; 3) to adapt to other speaker timbre, we fine-tune some parameters in the decoder with few speech data. To address the challenge of lack of training data, we mine a spontaneous speech dataset to support our research this work and facilitate future research on spontaneous TTS. Experiments show that AdaSpeech 3 synthesizes speech with natural FP and rhythms in spontaneous styles, and achieves much better MOS and SMOS scores than previous adaptive TTS systems.
研究の動機と目的
- 即興的発話に特徴的な埋め込み一時停止(um, uh)と可変リズムを、限られた学習データとこれらの特徴のモデル化が不足していることから、自然な即興的スタイル発話の合成という課題に取り組むこと。
- 最小限の即興的発話データのみを用いて、事前学習済みのリーディングスタイルTTSモデルを即興的発話にデータ効率的に適応することを可能にすること。
- 学習可能な予測子と微調整メカニズムを通じて、FP挿入とリズム変動の制御性を向上させること。
- わずかな適応発話発話のみを用いて、異なる話者への即興的スタイルの転送を可能にすること。
- 今後の研究を支援するため、新しい即興的発話データセット(SPON-FP, SPON-RHYTHM, SPON-TIMBRE)を公開すること。
提案手法
- 各音素を「なし」「um」「uh」に分類するFP予測子を導入し、信頼度スコアのしきい値に基づいて挿入を制御する。
- 速さ、中程度、遅さの3つの専門家を備えた混合専門家(MoE)型持続時間予測子を採用し、多様な発話リズムをモデル化する。
- SPON-RHYTHMサブセットからのテキスト-ピッチ/持続時間ペアデータを用いて、MoE型持続時間予測子とピッチ予測子を微調整し、即興的リズムパターンに適応する。
- SPON-TIMBREサブセットからのわずかな音声サンプルのみを用いて、デコーダーのパラメータを微調整することで話者のトーンを適応させる。
- ポッドキャスト音声から新しい即興的発話データセットをマイニングし、テキスト-FPペア(SPON-FP)、テキスト-ピッチ/持続時間ペア(SPON-RHYTHM)、テキスト-音声ペア(SPON-TIMBRE)を含む。
- 強制アラインメントとFPタグ付きASRを用いて、FP予測子および持続時間予測子の学習データを整列化する。
実験結果
リサーチクエスチョン
- RQ1テキスト-FPペアデータのみを用いて、適応的TTSシステムが即興的発話における埋め込み一時停止(um, uh)を効果的にモデル化できるか?
- RQ2即興的発話における多様なリズムを捉える際、混合専門家型持続時間予測子は単一の持続時間予測子を上回る性能を示すか?
- RQ3限られた即興的発話データに対してピッチおよび持続時間予測子を微調整することは、自然さと即興性の向上にどの程度効果的か?
- RQ4わずかな適応発話発話のみを用いて、新しい話者に即興的スタイルをどの程度効果的に転送できるか?
- RQ5FP予測とリズム適応は、合成音声の即興性の認識を向上させるためにどのように相互作用するか?
主な発見
- AdaSpeech 3 はベースラインのAdaSpeechと比較して、平均意見評価(MOS)が0.24高く、自然さと発話速度の観点から顕著な音声品質の向上を示した。
- システムはAdaSpeechと比較して、音声品質および即興性のMOS(SMOS)スコアが0.3高い結果を得ており、即興的発話特徴の捉え込みにおいて優れた性能を示した。
- FP予測子はランダム挿入と比較して、FPの妥当性(CMOS)で0.156の向上を示し、文脈に応じた一時停止挿入の有効性を確認した。
- MoE型持続時間予測子を削除した場合(w/o MoE)、FPを伴う音声品質のCMOSが0.332低下し、MoEがリズム多様性のモデル化において重要な役割を果たしていることを示した。
- 持続時間およびピッチ予測子の両方を微調整すると、適応なしの場合と比較してCMOSが0.384向上し、両者の共同適応の重要性を強調した。
- 話者間スタイル転送では、男性話者で0.175のCMOS向上、女性話者で0.205のCMOS向上を達成し、即興的スタイルの強力な転送性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。