Skip to main content
QUICK REVIEW

[論文レビュー] Neural source-filter waveform models for statistical parametric speech synthesis

Xin Wang, Shinji Takaki|arXiv (Cornell University)|Apr 27, 2019
Speech Recognition and Synthesis参考文献 53被引用数 8
ひとこと要約

この論文は、正弦波ベースの励起源、拡張畳み込みフィルタ、および条件付き特徴処理を用いて、WaveNetの100倍以上高速に高品質な音声波形を生成する統計的パrametric音声合成のためのニューラルソースフィルタ(NSF)フレームワークを提案している。モデルはSTFTを用いたスペクトル振幅差を直接最小化することで訓練され、非自己回帰的かつワンショット推論によりWaveNet並みの品質を達成する。

ABSTRACT

Neural waveform models such as WaveNet have demonstrated better performance than conventional vocoders for statistical parametric speech synthesis. As an autoregressive (AR) model, WaveNet is limited by a slow sequential waveform generation process. Some new models that use the inverse-autoregressive flow (IAF) can generate a whole waveform in a one-shot manner. However, these IAF-based models require sequential transformation during training, which severely slows down the training speed. Other models such as Parallel WaveNet and ClariNet bring together the benefits of AR and IAF-based models and train an IAF model by transferring the knowledge from a pre-trained AR teacher to an IAF student without any sequential transformation. However, both models require additional training criteria, and their implementation is prohibitively complicated. We propose a framework for neural source-filter (NSF) waveform modeling without AR nor IAF-based approaches. This framework requires only three components for waveform generation: a source module that generates a sine-based signal as excitation, a non-AR dilated-convolution-based filter module that transforms the excitation into a waveform, and a conditional module that pre-processes the acoustic features for the source and filer modules. This framework minimizes spectral-amplitude distances for model training, which can be efficiently implemented by using short-time Fourier transform routines. Under this framework, we designed three NSF models and compared them with WaveNet. It was demonstrated that the NSF models generated waveforms at least 100 times faster than WaveNet, and the quality of the synthetic speech from the best NSF model was better than or equally good as that from WaveNet.

研究の動機と目的

  • 統計的パrametric音声合成におけるWaveNetのような自己回帰的(AR)ニューラルボコーダの遅い推論速度を解消すること。
  • Parallel WaveNet や ClariNet のようなフローベースまたは知識蒸留手法の複雑さと高い学習コストを克服すること。
  • TTS用に、ARおよびIAFベースの波形モデルの代替として、シンプルで効率的かつ高品質な手法を開発すること。
  • 性能の劣化を伴わずに高速かつワンショットの波形生成を可能にすること。
  • 正弦波励起源が波形における周期性およびF0構造の学習をどのように簡素化するかを調査すること。

提案手法

  • NSFフレームワークは3つのモジュールから構成される:正弦波ベースの励起信号を生成するソースモジュール、励起信号を波形に変換する非自己回帰的拡張畳み込みフィルタモジュール、および両モジュールの入力音声特徴を処理する条件付きモジュール。
  • モデルは、短時間フーリエ変換(STFT)を用いて生成波形とターゲット波形間のスペクトル振幅差を最小化することで訓練される。
  • 3つのNSFバリエーションが導入された:ベースラインNSF(b-NSF)、簡略化NSF(s-NSF)、および高調波+ノイズNSF(hn-NSF)。hn-NSFは高調波成分とノイズ成分の別々のソース・フィルタペアを用いる。
  • 訓練目的はSTFTを介して効率的に実装されており、逐次生成や複雑なフローベースの訓練を必要とせず、高速な最適化が可能である。
  • フィルタモジュールはスキップ接続を備えた残差ネットワークとして設計されており、励起信号を自然な音声波形へ段階的に変換できる。
  • F0入力は直接ソースモジュールに供給され、生成出力における明示的なピッチ制御が可能になる。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的ニューラルソースフィルタフレームワークは、ワンショットかつ高速な波形生成を可能にしつつ、WaveNet並みの音声品質を達成できるか?
  • RQ2正弦波ベースの励起信号を用いることで、ニューラルボコーダにおける周期性およびF0構造の学習がどのように簡素化されるか?
  • RQ3アーキテクチャの簡略化および高調波成分とノイズ成分の別々のモデル化が、波形品質および学習効率に与える影響は何か?
  • RQ4STFTに基づくスペクトル振幅損失は、他の訓練目的と比較して、知覚的品質および学習安定性においてどのように差を示すか?
  • RQ5NSFフレームワークはARおよびIAFベースのアプローチと比較して、学習時間およびモデルの複雑さをどの程度削減できるか?

主な発見

  • hn-NSFモデルは、単一話者向け日本語コーパスを用いた大規模な聴取テストにおいて、WaveNetと同等の音声品質を達成した。
  • 最良のNSFモデルは、WaveNetボコーダーよりも少なくとも100倍速く波形を生成でき、リアルタイム推論を可能にした。
  • 入力F0と生成波形から抽出したF0の相関係数は高く(hn-NSFのF0r3で0.988)、正確なピッチ追跡が確認された。
  • hn-NSFモデルのフィルタモジュールは、層ごとのスペクトログラムの変化から、正弦波励起をフォルマント構造を持つ波形に効果的に変換していることが示された。
  • アブレーションスタディにより、スキップ接続が性能に不可欠であり、正弦波励起を除去すると著しく性能が低下することが確認された。
  • STFTに基づくスペクトル振幅損失は、複数のSTFT設定を用いても、効率的な学習と安定した収束を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。