[論文レビュー] Linear networks based speaker adaptation for speech synthesis
本稿では、複数の層に線形ネットワーク(LN)を挿入し、出力層と同時に微調整することで、神経音声合成におけるスプーカー適応手法を提案する。パラメータの効率性を高めるために低ランク+対角(LRPD)分解を用いることで、わずか200件の適応発話でも、1,000件の発話を用いて訓練されたスプーカーに依存するモデルと同等のスプーカー適応品質を達成し、低データ環境下で標準的な微調整やフルLNを上回る性能を発揮する。
Speaker adaptation methods aim to create fair quality synthesis speech voice font for target speakers while only limited resources available. Recently, as deep neural networks based statistical parametric speech synthesis (SPSS) methods become dominant in SPSS TTS back-end modeling, speaker adaptation under the neural network based SPSS framework has also became an important task. In this paper, linear networks (LN) is inserted in multiple neural network layers and fine-tuned together with output layer for best speaker adaptation performance. When adaptation data is extremely small, the low-rank plus diagonal(LRPD) decomposition for LN is employed to make the adapted voice more stable. Speaker adaptation experiments are conducted under a range of adaptation utterances numbers. Moreover, speaker adaptation from 1) female to female, 2) male to female and 3) female to male are investigated. Objective measurement and subjective tests show that LN with LRPD decomposition performs most stable when adaptation data is extremely limited, and our best speaker adaptation (SA) model with only 200 adaptation utterances achieves comparable quality with speaker dependent (SD) model trained with 1000 utterances, in both naturalness and similarity to target speaker.
研究の動機と目的
- 限定的なターゲットスプーカー発話データしか入手できない状況で、高品質でスプーカー固有の音声合成ボイスを構築する課題に対処すること。
- 複数の層に線形ネットワーク(LN)を導入することで、深層ニューラルネットワークベースの音声合成におけるスプーカー適応性能を向上させること。
- スプーカー固有のパラメータの過学習を低減するために、低ランク+対角(LRPD)分解を適用し、極端に少ないデータ環境下でも適応を安定化させること。
- 女性→女性、男性→女性、女性→男性といった多様なスプーカー適応方向をカバーして評価すること。
- 標準的な微調整やフルLNと比較して、最小限の適応データでも自然さとスプーカー類似度が優れていることを示すこと。
提案手法
- 音声合成用のマルチタスクDNN-BLSTM音声モデルの複数の隠れ層に線形ネットワーク(LN)を統合する。
- 適応中に、出力層と併せてLNパラメータを共同で微調整することで、ネットワーク全体を再訓練せずにスプーカー固有の変換を実現する。
- LN層に低ランク+対角(LRPD)分解を適用し、自由パラメータ数を削減することで、適応データが少ない状況での安定性を向上させる。
- LRPD分解を用いて線形変換行列のランクを制約し、少ないデータ環境下での表現力と一般化性能のバランスを図る。
- 言語的特徴量とメルケプストラム係数、対数F0、バンドアパーリオーディティ、ビーカスステータスのマルチ出力ヘッドを用いて、マルチスプーカーDNN-BLSTMベースモデルを学習する。
- 共有エンコーダー層を変更せずに、ターゲットスプーカーの少数発話のみを用いてLN層と出力層を微調整することでスプーカー適応を実行する。
実験結果
リサーチクエスチョン
- RQ1DNN-BLSTM TTSモデルの複数の層に線形ネットワーク(LN)を挿入することで、出力層のみの標準的微調整と比較して、スプーカー適応性能が向上するか?
- RQ2少数の適応発話しか利用できない状況下で、LN層の低ランク+対角(LRPD)分解が適応の安定性と一般化性能に与える影響は何か?
- RQ3200件の適応発話のみを用いても、1,000件の発話を用いて訓練されたスプーカーに依存する(SD)モデルと同等の自然さとスプーカー類似度を達成できるか?
- RQ4男性→女性や女性→男性といった挑戦的なクロスボイス適応方向でも、本手法はどのように性能を発揮するか?
- RQ5過学習が生じにくいため、データが少ない環境下でLRPD-LNバージョンがフルLNよりもより頑健であるか?
主な発見
- LRPD-LN適応手法は、1,000件の発話を用いて訓練されたスプーカーに依存する(SD)モデルと同等の主観的品質(自然さとスプーカー類似度)を、わずか200件の適応発話で達成した。
- 200件の適応発話で、LRPD-LNは客観的評価および主観的評価の両面で、標準的出力層微調整およびフルLNを上回った。特に低データ環境下で顕著な優位性を示した。
- 発話数が50件未満の状況では、過剰なスプーカー固有パラメータによる過学習のため、フルLNはLRPD-LNより劣った性能を示した。
- 発話数が100件を超えると、フルLNがLRPD-LNを上回るようになった。これは、十分なデータがある状況ではLRPD制約が最適でなくなることを示唆している。
- 主観的テストでは、データが少ない状況でLRPD-LNがSDモデルやフルLNモデルよりも安定していることが確認された。SDモデルは発話数が減少するにつれて著しく性能が低下した。
- 本手法は、男性→女性や女性→男性といったクロスボイス適応タスクに対しても良好に一般化でき、LRPD-LNは同じ少量データで訓練されたSDモデルを常に上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。