[論文レビュー] Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet
本稿では、マルチソースTacotronとデュアルアテンション、WaveNetを用いた共同学習フレームワークを提案し、1つの共有モデルで音声合成(TTS)と音声変換(VC)を統合する。モデルはテキストまたはソーススピーカーのスペクトログ램を入力とし、WaveNetを介して高品質な音声を生成し、両タスクで競争力ある性能を達成。VC性能は独立したモデルを上回っている。
We investigated the training of a shared model for both text-to-speech (TTS) and voice conversion (VC) tasks. We propose using an extended model architecture of Tacotron, that is a multi-source sequence-to-sequence model with a dual attention mechanism as the shared model for both the TTS and VC tasks. This model can accomplish these two different tasks respectively according to the type of input. An end-to-end speech synthesis task is conducted when the model is given text as the input while a sequence-to-sequence voice conversion task is conducted when it is given the speech of a source speaker as the input. Waveform signals are generated by using WaveNet, which is conditioned by using a predicted mel-spectrogram. We propose jointly training a shared model as a decoder for a target speaker that supports multiple sources. Listening experiments show that our proposed multi-source encoder-decoder model can efficiently achieve both the TTS and VC tasks.
研究の動機と目的
- テキストから音声への変換(TTS)と音声変換(VC)を1つの共有ディープラーニングモデルに統合すること。
- タスク固有のモデル設計や再学習の必要性を減らすために、1つのアーキテクチャがTTSとVCの両方を実行できるようにすること。
- 共同学習による共有表現学習とデータ効率の向上を活用することで、VC性能を向上させること。
- 共有アーキテクチャと特徴工学のトレンドの進展により、TTSとVCの理論的差異が縮小したかどうかを検証すること。
提案手法
- テキストまたはソーススピーカーのスペクトログラムを処理する2つのエンコーダーを備えたマルチソースの系列対系列モデルに、デュアルアテンションを適用。共有デコーダーがメルスペクトログ램を予測する。
- Tacotronアーキテクチャに基づく共有デコーダーを採用。プリネット、CBHGモジュール、およびアテンションベースのRNNを用いて系列モデリングを実現。
- WaveNetを音声生成器(ボコーダー)として使用。予測されたメルスペクトログラムを条件として、16 kHzの生の音声波形(μ-law量子化)を生成。
- TTSおよびVCのデータの混合を用いて共同学習を実施。訓練中に適切な入力ソースを選択するためのマスク機構を導入。
- 限定的なデータでターゲットスピーカーに適応させるために、事前学習済みTTSモデルを微調整。
- 高精細な波形をモデル化するため、30層の拡張畳み込み層(指数的拡張)とスキップ接続を用いたWaveNetボコーダーを採用。
実験結果
リサーチクエスチョン
- RQ11つのディープラーニングモデルが、テキストから音声への変換と音声変換の両タスクを効果的に実行できるか?
- RQ2TTSとVCを共同で学習させることで、別々に学習させる場合と比較して両タスクの性能が向上するか?
- RQ3マルチソースエンコーダ-デコーダー構造とデュアルアテンションを用いることで、TTSおよびVCの入力に一般化する能力にどのような影響を与えるか?
- RQ4共有表現学習は、非同期データを用いた場合にVC品質にどのような影響を与えるか?
- RQ5共有モデルは、TTSの品質を競争力ある水準に保ちつつ、VC性能を向上させることができるか?
主な発見
- 提案された共同モデルは、同じアーキテクチャを用いてTTSとVCの両タスクを実行可能であり、入力の種別がタスクを決定する。
- ハイブリッドVCシステムは、MOSスコアで測定した音声品質およびスピーカー類似度の両面で、独立したVCモデルを上回った。
- ハイブリッドシステムのスピーカー類似度MOSは、独立したVCモデルよりも顕著に高く、より優れたスピーカー移行が実現した。
- ハイブリッドモデルのTTS性能は、独立したTTSシステムに比べて低かったため、VCに過剰適合しているか、TTSに十分な容量が与えられていない可能性がある。
- 結果から、共同学習によりVC性能が向上することが示されたが、TTSとVCの性能をバランスさせるために、さらなるアーキテクチャの調整が必要である。
- ターゲットスピーカーに適応させるために事前学習済みTTSモデルを用いることで、限定的なデータでもTTS品質が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。