[論文レビュー] fairseq S^2: A Scalable and Integrable Speech Synthesis Toolkit
この論文では、fairseqフレームワークの拡張として構築されたスケーラブルで統合可能な音声合成ツールキット、fairseq S²を紹介する。このツールキットは、マルチスプーカー合成、低リソースデータ用の前処理ツール、自動評価指標を備えた、自己回帰的および非自己回帰的テキスト-to-音声モデルのエンドツーエンド学習を可能にする。音声活動検出(VAD)、ノイズ除去、事前学習済みスプーカー埋め込みを用いた最小限のデータセットでの改善されたモデル性能と一般化性能が示されている。
This paper presents fairseq S^2, a fairseq extension for speech synthesis. We implement a number of autoregressive (AR) and non-AR text-to-speech models, and their multi-speaker variants. To enable training speech synthesis models with less curated data, a number of preprocessing tools are built and their importance is shown empirically. To facilitate faster iteration of development and analysis, a suite of automatic metrics is included. Apart from the features added specifically for this extension, fairseq S^2 also benefits from the scalability offered by fairseq and can be easily integrated with other state-of-the-art systems provided in this framework. The code, documentation, and pre-trained models are available at https://github.com/pytorch/fairseq/tree/master/examples/speech_synthesis.
研究の動機と目的
- 多様なモデルアーキテクチャーやデータタイプをサポートする統合的でスケーラブルな音声合成ツールキットの不足に対処すること。
- 強力な前処理パイプラインを用いて、データの整備が不十分な「野生の」音声データから高品質なTTSモデルを学習可能にすること。
- 自動評価指標と事前学習済みコンponentの統合により、開発と評価を迅速化すること。
- 自己教師付き音声表現やユニットto音声システムを含む、fairseq内の他の最先端モデルとの統合を支援すること。
- 事前学習済みスプーカー埋め込みを用いたゼロショットスプーカー合成を可能にし、未学習スプーカーへの一般化を拡張すること。
提案手法
- Tacotron2、Transformer、FastSpeech2を含む、テキスト-toスペクトログラムモデルのスイートをfairseqに拡張し、自己回帰的および非自己回帰的推論を両方サポートする。
- 検証モデルから得た事前学習済みスプーカー埋め込みと学習可能なスプーカー埋め込みルックアップテーブルを用いてマルチスプーカー機能を導入する。
- 音声活動検出(VAD)、ノイズ低減(DN)、SNRおよびCERに基づくフィルタリングを含む、音声前処理パイプラインを実装し、データの整備を支援する。
- MCD、CER、MOS、F0/RMS相関などの自動評価指標を統合し、モデルの反復を加速する。
- テキストと、自己教師付きモデルから得た学習済みユニット(ユニット)を入力としてサポートし、テキストフリーTTSシステムを可能にする。
- 共有コードベースとモジュラー設計により、ASR、MT、LM、自己教師付き学習の既存fairseqモデルとのシームレスな統合を可能にする。
実験結果
リサーチクエスチョン
- RQ1VAD、ノイズ低減、フィルタリングなどの前処理パイプラインは、低リソースで「野生の」音声データにおける学習安定性と性能を向上させるか?
- RQ2ゼロショットスプーカー合成とモデル性能の観点から、事前学習済みスプーカー埋め込みと学習可能な埋め込みの比較において、どちらが優れているか?
- RQ3MCD や CER などの自動評価指標は、モデル開発をどれほど加速させ、人的評価への依存をどれほど減らせるか?
- RQ4fairseq S²は、自己教師付き音声表現を入力として用いたエンドツーエンドのユニットto音声合成を効果的にサポートできるか?
- RQ5自己回帰的モデルにおける還元要因が、ノイズや不完全なデータにおける学習収束と合成品質に与える影響はどの程度か?
主な発見
- 攻撃的レベル3のVADを用いることで、平均してサイレント部分が40%削減されたが、音声の切断リスクも伴った。最適な設定は、サイレント部分の除去と音声の保存の両立を図った。
- DN + VAD-3 + FLT の前処理を用いた学習により、CERが10%未満に低下し、MOSが0.2〜0.3ポイント向上した。特にVCTKおよびCommon Voiceにおいて顕著だった。
- Transformer TTSモデルにおける還元要因4が2よりも優れた性能を示した。一方、前処理なしの生データでは還元要因2では学習が完全に失敗した。
- 事前学習済みスプーカー埋め込みは、学習可能な埋め込みと同等の性能を達成し、未学習スプーカーのゼロショット合成を可能にした。
- SNRおよびCERに基づくデータフィルタリングにより、MCDが0.1低下、CERが1.5低下した。これは、困難な例においてモデル適合性と明瞭性が向上したことを示している。
- fairseq S²と自己教師付きモデルの統合により、ユニットto音声合成が成功した。テキストフリーTTSパイプラインの実現可能性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。