Skip to main content
QUICK REVIEW

[論文レビュー] Neural Harmonic-plus-Noise Waveform Model with Trainable Maximum Voice Frequency for Text-to-Speech Synthesis

Xin Wang, Junichi Yamagishi|arXiv (Cornell University)|Aug 27, 2019
Speech Recognition and Synthesis参考文献 21被引用数 8
ひとこと要約

本稿では、ニューラルハーモニック+ノイズ波形モデル(sinc-h-NSF)における学習可能な最大声トーン周波数(MVF)を提案し、周期的および非周期的成分間の時間変動型スペクトルバンド分離を可能にした。低域および高域通過フィルタを窓付きsincフィルタとしてパrameter化し、音声特徴からMVFを予測することで、ベースラインのh-NSFを上回る音声品質を実現しながら、リアルタイム生成速度を維持し、WaveNetと同等のMOSスコアを達成した。

ABSTRACT

Neural source-filter (NSF) models are deep neural networks that produce waveforms given input acoustic features. They use dilated-convolution-based neural filter modules to filter sine-based excitation for waveform generation, which is different from WaveNet and flow-based models. One of the NSF models, called harmonic-plus-noise NSF (h-NSF) model, uses separate pairs of source and neural filters to generate harmonic and noise waveform components. It is close to WaveNet in terms of speech quality while being superior in generation speed. The h-NSF model can be improved even further. While h-NSF merges the harmonic and noise components using pre-defined digital low- and high-pass filters, it is well known that the maximum voice frequency (MVF) that separates the periodic and aperiodic spectral bands are time-variant. Therefore, we propose a new h-NSF model with time-variant and trainable MVF. We parameterize the digital low- and high-pass filters as windowed-sinc filters and predict their cut-off frequency (i.e., MVF) from the input acoustic features. Our experiments demonstrated that the new model can predict a good trajectory of the MVF and produce high-quality speech for a text-to-speech synthesis system.

研究の動機と目的

  • 周期的および非周期的成分間のスペクトル分離が一定であると仮定する、ハーモニック+ノイズNSFモデルにおける固定MVFの制限を解消すること。
  • 音声におけるハーモニック成分とノイズ成分を分離する時間変動型最大声トーン周波数(MVF)をモデル化することで、音声品質を向上させること。
  • 事前に定義されたフィルタカットオフに依存せず、入力音声特徴からエンドツーエンド学習可能なMVF予測を可能にすること。
  • 音声品質を向上させながらも、NSFモデルの高い生成速度を維持すること。

提案手法

  • 微分可能となるように、低域および高域通過FIRフィルタを窓付きsincフィルタとしてパrameter化することで、MVF制御を可能にした。
  • U/V(発声状態)と残差信号を組み合わせた学習関数を用いて、入力音声特徴からMVFカットオフ周波数を予測した。
  • ソースモジュールおよびフィルタモジュールで使用するため、F0およびメルスペクトログラム特徴量を波形レートにアップサンプリングするための条件付きモジュールを導入した。
  • 生成波形と自然な波形の間のスペクトル振幅距離を最小化することで、モデルを学習した。
  • MVF予測戦略を評価するため、3つのバリエーションを導入した:sinc1-h-NSF(U/V + 残差)、sinc2-h-NSF(MVFを直接学習)、sinc3-h-NSF(U/VからのみMVFを予測)。
  • GPUメモリ使用量を削減しながら生成速度に影響を与えない、メモリ効率の良い推論モードを適用した。

実験結果

リサーチクエスチョン

  • RQ1神経波形モデルは、入力音声特徴から時間変動型最大声トーン周波数(MVF)を予測することで、音声品質を向上させることができるか?
  • RQ2ハーモニック+ノイズNSFモデルにおいて、学習可能なMVFは固定MVFと比較して、主観的品質およびスペクトル正確性の面で優れているか?
  • RQ3U/Vを事前知識として用いる、残差信号を用いる、または直接予測するといったMVF予測戦略の中で、どの戦略が最も安定的かつ正確なMVFトレースを生み出すか?
  • RQ4提案モデルは、音声品質を向上させながらも、NSFモデルの高い生成速度を維持できるか?
  • RQ5モデルは自己回帰的生成を用いずに、WaveNetと同等のMOSスコアを達成できるか?

主な発見

  • U/V状態と学習された残差信号を組み合わせたsinc1-h-NSFは、最も安定的かつ正確なMVF予測を達成し、自然なスペクトログラムパターンに近づいた。
  • sinc1-h-NSFは平均MOSスコア4.48を達成し、ベースラインh-NSF(4.47)およびWaveNet(4.49)と統計的に差がなく、高い主観的品質を示した。
  • sinc2-h-NSFは発声領域でMVFを低く予測し、非周期的成分が過剰に現れ、ハーモニック構造が損なわれ、MOSスコアが低下した。
  • sinc3-h-NSFはシグモイド関数が飽和し、全フレームでMVF = 1.0を出力したため、非周期性が失われ、[s]のような不自然な無声音が生成された。
  • すべてのNSFベースのモデル、特にsinc1-h-NSFは、1枚のP100 GPUで1秒間に335,000以上の波形サンプルを生成し、WaveNetの0.19kサンプル/秒を大幅に上回った。
  • モデルは120万パラメータのコンactなパラメータ数を維持しており、ベースラインh-NSFと同等であり、モデルの複雑さに顕著な増加がないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。