[論文レビュー] DenoiSpeech: Denoising Text to Speech with Frame-Level Noise Modeling
DenoiSpeechは、共同で訓練されたノイズ条件モジュールを用いてフレーム単位のノイズをモデル化することで、ノイズの多い学習データから高品質でクリアな音声を合成するテキストtoスピーク(TTS)システムを提案する。実世界のノイズデータにおいて、従来手法(発話単位のノイズ埋め込みまたは事前エnhancementされた音声を用いる手法)をそれぞれ0.31および0.66 MOS向上させ、複雑なノイズ環境下でも優れた耐障害性と知覚的品質を示した。
While neural-based text to speech (TTS) models can synthesize natural and intelligible voice, they usually require high-quality speech data, which is costly to collect. In many scenarios, only noisy speech of a target speaker is available, which presents challenges for TTS model training for this speaker. Previous works usually address the challenge using two methods: 1) training the TTS model using the speech denoised with an enhancement model; 2) taking a single noise embedding as input when training with noisy speech. However, they usually cannot handle speech with real-world complicated noise such as those with high variations along time. In this paper, we develop DenoiSpeech, a TTS system that can synthesize clean speech for a speaker with noisy speech data. In DenoiSpeech, we handle real-world noisy speech by modeling the fine-grained frame-level noise with a noise condition module, which is jointly trained with the TTS model. Experimental results on real-world data show that DenoiSpeech outperforms the previous two methods by 0.31 and 0.66 MOS respectively.
研究の動機と目的
- 対象スピーカーのための学習データとしてノイズのある音声しか入手できない状況において、高品質なテキストtoスピーク(TTS)モデルを訓練する課題に対処すること。
- 粗い発話単位のノイズ埋め込みや事前エnhancementされた音声を用いる従来手法の限界を克服すること。これらの手法は、時間的に変化する複雑なノイズ環境下で失敗する。
- 時間的に変化する微細なノイズパターンをモデル化することで、実世界のノイズ環境下での音声合成品質を向上させること。
- 語彙的または言語的コンテンツの漏洩を防ぐために、敵対的CTC損失を用いてノイズ抽出器が音声コンテンツではなくノイズ情報のみを学習することを保証すること。
提案手法
- DenoiSpeechは、TTSデコーダーにフレーム単位のノイズ情報を注入するためのノイズ条件モジュールを備えた、変更を加えたFastSpeech 2アーキテクチャを採用する。
- ノイズ条件モジュールには、ペアデータおよび非ペアデータを用いた学習により、ノイズのある音声入力から背景ノイズを分離するUNetベースのノイズ抽出器が含まれる。
- ノイズエンコーダーは抽出されたノイズを潜在表現に変換し、その表現をTTSモデル内の隠れ状態と連結することで、合成をノイズ特性に条件づける。
- 敵対的CTCモジュールを導入し、ノイズとブランクトークンのアライメントを強制することで、ノイズ抽出器が音声の発音的・言語的コンテンツを学習しないように保証する。
- TTS損失、ピッチ予測損失、敵対的CTC損失を組み合わせたマルチタスク損失を用いて、ノイズ抽出器とTTSモデルをエンドツーエンドで最適化する。
- 推論時、ノイズエンコーダーの入力としてサイレント(無音)を用いることで、背景ノイズなしのクリアな音声を生成可能となる。
実験結果
リサーチクエスチョン
- RQ1訓練データにノイズが多く、時間的に変化する複雑なノイズが含まれる状況下で、フレーム単位のノイズモデリングがTTS品質を向上させ得るか?
- RQ2発話単位のノイズ埋め込みと比較して、フレーム単位のノイズ条件付けは知覚的品質および耐障害性においてどのように異なるか?
- RQ3ノイズ抽出器をTTSモデルと共同で訓練することで、実世界のノイズデータにおける汎化性と性能が向上するか?
- RQ4敵対的CTCモジュールは、ノイズ表現への意味的情報の漏洩を防ぐために果たす役割は何か?
- RQ5ペアデータ(クリア音声とノイズ音声の対)が存在しないノイズデータで学習した場合、この手法の有効性は何か?
主な発見
- DenoiSpeechは実世界のノイズデータにおいて平均意見スコア(MOS)3.35を達成し、次に優れたベースライン(Enhancement-Based)を0.66MOS上回った。
- 人工的なノイズデータでは、DenoiSpeechはMOS3.77を達成し、Enhancement-Based手法を0.31MOS、Augment-Adversarial手法を0.34MOS上回った。
- フレーム単位のノイズ条件付けは、発話単位の条件付けと比較して0.59CMOSの合成品質向上をもたらし、時間的粒度の重要性を示した。
- ノイズ抽出器をTTS学習中に固定した場合、性能は0.16CMOS低下し、共同学習による汎化性向上の有効性を裏付けた。
- 敵対的CTCモジュールを削除すると、0.09CMOSのスコア低下が生じ、純粋なノイズの分離に有効であることを証明した。
- 実世界のノイズデータでは人工データよりもより高い性能向上を示し、複雑な実世界のノイズに対して優れた耐障害性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。