[論文レビュー] TalkNet: Fully-Convolutional Non-Autoregressive Speech Synthesis Model
TalkNet は、音素長予測子とメルスペクトログ램生成器を用いて、高速で高品質な音声合成を実現する、完全畳み込み型で非自己回帰的な音声合成モデルである。語彙の飛躍や繰り返しを明示的な長さ予測により解消し、1080万パラメータで準SOTAの音声品質を達成。Tacotron 2 や FastSpeech と比較して3倍少ない。訓練および推論が著しく高速化される。
We propose TalkNet, a convolutional non-autoregressive neural model for speech synthesis. The model consists of two feed-forward convolutional networks. The first network predicts grapheme durations. An input text is expanded by repeating each symbol according to the predicted duration. The second network generates a mel-spectrogram from the expanded text. To train a grapheme duration predictor, we add the grapheme duration to the training dataset using a pre-trained Connectionist Temporal Classification (CTC)-based speech recognition model. The explicit duration prediction eliminates word skipping and repeating. Experiments on the LJSpeech dataset show that the speech quality nearly matches auto-regressive models. The model is very compact -- it has 10.8M parameters, almost 3x less than the present state-of-the-art text-to-speech models. The non-autoregressive architecture allows for fast training and inference.
研究の動機と目的
- 自己回帰的TTSモデルの限界、特に注意機構の失敗による語彙の飛躍・繰り返しを解消する。
- 自己回帰的デコードと注意機構の必要性を排除し、訓練および推論の高速化を実現する。
- 教師モデルを必要とせず、高品質な音声を維持しながら、パラメータ効率の高いTTSシステムを構築する。
- 明示的な長さ予測により、プロソディーと音声速度の直接制御を可能にする。
- 外部のアライメントアノテーションを必要とせず、事前学習済みCTCベースのASRモデルから抽出したアライメントを用いて長さ予測子を学習する。
提案手法
- モデルは2つの完全畳み込み型の前向きネットワークを用いる:音素長予測子とメルスペクトログラム生成器。
- 入力テキストはまず長さ予測子を通過し、各音素の予測長さが出力される。
- その後、入力テキストは各文字がその予測長さに従って繰り返されることで、時間軸に整合したシーケンスに拡張される。
- 拡張されたシーケンスは、非自己回帰的に最終的なメルスペクトログラムを生成するメルスペクトログラム生成器に供給される。
- 長さ予測は、事前学習済みCTCベースのASRモデルから抽出されたアライメントを用いて学習される。これにより、文字と音声のアライメントが真値として提供される。
- 訓練中に長さオーグメンテーションが適用され、長さ予測子の誤りに対して耐性を高める。
実験結果
リサーチクエスチョン
- RQ1完全畳み込み型で非自己回帰的なTTSモデルは、Tacotron 2 などの自己回帰的モデルと同等の音声品質を達成できるか?
- RQ2明示的な長さ予測は、注意機構に依存せずに語彙の飛躍や繰り返しを効果的に解消できるか?
- RQ31100万パラメータ未満のコンパクトなTTSモデルは、より大きな最先端モデルと同等の性能を発揮できるか?
- RQ4非自己回帰的アーキテクチャは、自己回帰的ベースラインと比較して、訓練および推論の高速化にどの程度寄与するか?
- RQ5事前学習済みCTCベースのASRモデルは、追加のアノテーションを必要とせず、高品質な長さ予測子の学習に十分なアライメントの監視を提供できるか?
主な発見
- LJSpeechデータセットにおいて、TalkNetは平均評価得点(MOS)3.74 ± 0.07を達成し、Tacotron 2 の3.85 ± 0.06に非常に近い。
- 語彙の飛躍や繰り返しはほぼゼロにまで低減され、困難なテスト文においてもTacotron 2 や Transformer-TTS より優れた性能を示した。
- V100 GPU上での推論遅延は1サンプルあたり0.019秒で、リアルタイム要因(RTF)は328.65に達し、Tacotron 2(RTF 7.56)や FastSpeech(RTF 221.01)を大きく上回る。
- 8台のV100 GPUで混合精度で学習した場合、訓練時間は約2時間で、類似モデルと比較して著しく高速化された。
- TalkNetは1080万パラメータにとどまり、Tacotron 2(2820万)や FastSpeech(3010万)と比較して約3倍少ない。パラメータ効率の高さが裏付けられた。
- 訓練時に長さオーグメンテーションを適用したことで、長さ予測子の誤りに対して頑健な性能を発揮し、一般化性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。