[論文レビュー] Noise Robust TTS for Low Resource Speakers using Pre-trained Model and Speech Enhancement
本論文では、話者埋め込みとメルスペクトログ램ノイズ除去マスクを条件付き入力として統合し、話者およびノイズ特性を独立してモデル化することで、低リソース話者のノイズ耐性のある音声合成フレームワークを提案する。クリーンで多話者データおよびノイズありデータで事前学習されたモデルは、低品質な新規話者に適応し、高品質なクリーン音声を合成する。主観評価において、ノイズ除去済みデータへの微調整ベースラインより平均0.115の平均意見スコア(MOS)向上を達成した。
With the popularity of deep neural network, speech synthesis task has achieved significant improvements based on the end-to-end encoder-decoder framework in the recent days. More and more applications relying on speech synthesis technology have been widely used in our daily life. Robust speech synthesis model depends on high quality and customized data which needs lots of collecting efforts. It is worth investigating how to take advantage of low-quality and low resource voice data which can be easily obtained from the Internet for usage of synthesizing personalized voice. In this paper, the proposed end-to-end speech synthesis model uses both speaker embedding and noise representation as conditional inputs to model speaker and noise information respectively. Firstly, the speech synthesis model is pre-trained with both multi-speaker clean data and noisy augmented data; then the pre-trained model is adapted on noisy low-resource new speaker data; finally, by setting the clean speech condition, the model can synthesize the new speaker's clean voice. Experimental results show that the speech generated by the proposed approach has better subjective evaluation results than the method directly fine-tuning pre-trained multi-speaker speech synthesis model with denoised new speaker data.
研究の動機と目的
- インターネットで一般的に見られる低品質・低リソースな音声データから、高品質なパーソナライズドTTSモデルを訓練する課題に対処すること。
- 各新規話者に高精細データを必要とせずに、騒音環境下でのTTSシステムの耐性を向上させること。
- 話者およびノイズの条件付きモデリングを用いて、騒音あり・低リソース話者データからエンドツーエンドでクリーンで自然な音声を合成すること。
- 固定長ノイズベクトルの制限を克服し、より正確なノイズ表現を得るために可変長メルスペクトログラムノイズ除去マスクを用いること。
提案手法
- TTSモデルは、話者アイデンティティとノイズ特性を分離するために、話者埋め込みとメルスペクトログラムノイズ除去マスクを条件付き入力として使用する。
- ノイズ除去マスクは、メルスペクトログラム領域におけるクリーン音声エネルギーと全エネルギーの比として計算され、周波数ビンごとのノイズ含有量を表す。
- モデルは、クリーンな多話者データとノイズありで拡張された多話者データの組み合わせを事前学習することで、頑健な表現を学習する。
- 適応段階では、話者埋め込みと対応するノイズありマスクを入力として、低リソースでノイズありの新規話者データに対して微調整を行う。
- 推論段階では、クリーンマスク(すべての要素が1)を用いて、同じ話者埋め込みからクリーン音声を生成する。
- 話者埋め込みは、話者アイデンティティの一貫性を保証するため、事前学習済みの話者認識モデルから抽出する。
実験結果
リサーチクエスチョン
- RQ1メルスペクトログラムノイズ除去マスクは、低SNR音声における時間的に変化するノイズをTTSの条件付けに効果的に表現できるか?
- RQ2話者埋め込みとノイズ表現の両方に条件付けたTTSモデルは、低リソースでノイズありの話者データにおける合成品質を向上させるか?
- RQ3本手法の事前学習と適応戦略は、ノイズ除去済みデータへの直接微調整と比較して、音声品質と話者類似度の面で優れているか?
- RQ4可変長ノイズマスクは、複雑で非定常なノイズをモデル化する上で、固定長ノイズベクトルを上回る効果を示すか?
主な発見
- 提案手法は、ベースライン手法よりも平均0.115 MOSポイントの向上を達成し、4名の低リソース話者において平均意見スコアは3.424(ベースライン3.313)を記録した。
- 音声強調モデルは、-5 dB SNRで3.787 dB、0 dBで7.154 dB、5 dBで8.694 dBのSI-SDR値を達成し、効果的なノイズ低減を示した。
- 合成音声と学習データ間の話者埋め込みのコサイン類似度は高く維持された(平均0.865)、ノイズおよび低リソース条件下でも話者アイデンティティが保持されたことを示した。
- メルスペクトログラムノイズ除去マスクの使用により、マスクがノイズありからクリーンへと変化するに従い、音声が滑らかにノイズありからクリーンへと移行するようになった。
- 主観評価により、ノイズ除去済みデータにおける情報損失が原因で生じる声の不安定性が、本手法によって低減されていることが確認された。
- 本モデルは、わずか数分間の低品質・ノイズあり音声のみを用いても、新規話者のクリーン音声を効果的に合成でき、低リソースデータにおける優れた一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。