[論文レビュー] Few Shot Adaptive Normalization Driven Multi-Speaker Speech Synthesis
本論文では、1つのリファレンス音声サンプルのみを用いて未学習の話者のスタイルで高品質な音声を生成できる、少数ショット多話者音声合成モデルであるFSM-SSを提案する。正規化層のアフィンパラメータを用いて発音の特徴(ピッチ、エネルギー、話者アイデンティティ)を分離することで、非自己回帰的Transformerを用いた適応的正規化を活用し、VCTKおよびLibriTTSで最先端の性能を達成した。未学習話者に対するMCDは9.78まで低下し、強力なボイスモーフィング能力を有している。
The style of the speech varies from person to person and every person exhibits his or her own style of speaking that is determined by the language, geography, culture and other factors. Style is best captured by prosody of a signal. High quality multi-speaker speech synthesis while considering prosody and in a few shot manner is an area of active research with many real-world applications. While multiple efforts have been made in this direction, it remains an interesting and challenging problem. In this paper, we present a novel few shot multi-speaker speech synthesis approach (FSM-SS) that leverages adaptive normalization architecture with a non-autoregressive multi-head attention model. Given an input text and a reference speech sample of an unseen person, FSM-SS can generate speech in that person's style in a few shot manner. Additionally, we demonstrate how the affine parameters of normalization help in capturing the prosodic features such as energy and fundamental frequency in a disentangled fashion and can be used to generate morphed speech output. We demonstrate the efficacy of our proposed architecture on multi-speaker VCTK and LibriTTS datasets, using multiple quantitative metrics that measure generated speech distortion and MoS, along with speaker embedding analysis of the generated speech vs the actual speech samples.
研究の動機と目的
- 未学習の話者に一般化可能な高品質な少数ショット多話者音声合成の課題に対処すること。
- 音声生成中にピッチ、エネルギー、話者アイデンティティといった発音特徴を分離・制御し、パーソナライズドな出力を実現すること。
- 話者固有の微調整や大量データを必要とせずにゼロショットおよび少数ショットの適応を可能にすること。
- 正規化モジュールにおけるピッチ、エネルギー、話者埋め込みの独立した操作によって、ボイスモーフィングの可能性を実証すること。
提案手法
- モデルは、入力テキストとリファレンス音声に条件づけられる非自己回帰的フィードフォワードTransformerアーキテクチャを採用し、適応的正規化を実装する。
- 適応的正規化は2つのバージョンで実装され、それぞれ畳み込み型と多頭注目型であり、両者とも話者埋め込み、リファレンス音声からの基本周波数(F0)およびエネルギーに条件づけられる。
- インスタンス正規化のアフィンパラメータが話者埋め込み、基本周波数(F0)、エネルギーによって変調され、発音特徴を分離的に制御する。
- 変動予測器はリファレンス音声の発音特徴に条件づけられ、期間、エネルギー、F0を予測する。
- 正規化層はTransformerデコーダーに統合され、残差接続の前に隠れ表現を変調する。
- 推論時に話者アイデンティティ、F0、エネルギーの入力埋め込みを独立して変更することで、ボイスモーフィングを実現する。
実験結果
リサーチクエスチョン
- RQ1話者、ピッチ、エネルギーに条件づけた適応的正規化は、未学習話者向けの高品質な少数ショット多話者TTSを可能にするか?
- RQ2正規化のアフィンパラメータは、ピッチ、エネルギー、話者アイデンティティといった発音特徴をどれほど効果的に分離できるか?
- RQ3提案手法の少数ショットアプローチは、ゼロショットや既存の最先端手法に比べ、音声品質および発音忠実度において優れているか?
- RQ4発音入力を独立して操作することで、モデルがどれほどボイスモーフィングに利用可能か?
主な発見
- LibriTTSデータセットにおいて、少数ショット設定でMCDが9.78に低下し、先行手法(Skerry-Ryan et al., 2018)のMCD 10.87を顕著に上回った。
- VCTKでは少数ショット設定でGPEが24.45、VDEが14.47に低下し、予測された発音と正解発音の整合性が向上したことを示した。
- アブレーションスタディにより、正規化モジュールにピッチとエネルギーを組み込むことで、MCDがベースモデルの21.68から13.65に低下し、MoSが2.64から3.72に向上した。
- 畳み込み型正規化バージョンが多頭注目型バージョンを上回り、VCTKおよびLibriTTSの両データセットでより低いMCDとGPEを達成した。
- F0とエネルギーの独立した操作により、実質的なボイスモーフィングが可能であることが、F0およびエネルギーを変更した定性的なサンプルで示された。
- 話者埋め込みの分析により、生成された音声埋め込みがリファレンス話者のものと非常に近いことが確認され、正確なスタイル転送が実現していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。