Skip to main content
QUICK REVIEW

[論文レビュー] HooliGAN: Robust, High Quality Neural Vocoding

Ollie McCarthy, Zohaib Ahmed|arXiv (Cornell University)|Aug 6, 2020
Music and Audio Processing参考文献 15被引用数 10
ひとこと要約

HooliGAN は、微分可能デジタル信号処理(DDSP)とニューラル ソースフィルタ(NSF)技術を組み合わせ、敵対的訓練を用いて自然な音声を生成する、頑健で高品質なニューラルボコーダーである。高速な推論(GPUで2.2MHz)を実現し、30分未塔の小さなデータセットでも強力な汎化性能を示し、聴取テストでは優れた知覚的品質を達成した。

ABSTRACT

Recent developments in generative models have shown that deep learning combined with traditional digital signal processing (DSP) techniques could successfully generate convincing violin samples [1], that source-excitation combined with WaveNet yields high-quality vocoders [2, 3] and that generative adversarial network (GAN) training can improve naturalness [4, 5]. By combining the ideas in these models we introduce HooliGAN, a robust vocoder that has state of the art results, finetunes very well to smaller datasets (<30 minutes of speechdata) and generates audio at 2.2MHz on GPU and 35kHz on CPU. We also show a simple modification to Tacotron-basedmodels that allows seamless integration with HooliGAN. Results from our listening tests show the proposed model's ability to consistently output high-quality audio with a variety of datasets, big and small. We provide samples at the following demo page: https://resemble-ai.github.io/hooligan_demo/

研究の動機と目的

  • 高い知覚的品質を実現しながら、高速な推論速度を維持するニューラルボコーダーの開発。
  • 非常に小さな音声データセット(30分未塔)でも、頑健で汎化性能の高いモデルの向上。
  • Tacotronに基づくテキスト音声変換システムとのシームレスな統合。
  • ソース励起モデルを活用することで、位相の曖昧さと波形量子化に起因するアーチファクトを低減。
  • DDSP(DSPに基づく信号モデリング)と NSF(ニューラルフィルタリング)の長所を統合し、音声品質を向上。

提案手法

  • モデルは、音響特徴から抽出されたログメルスペクトログ램、F0ピッチ、無声音/有声音(UV)シーケンスを入力とする。
  • 2つの1次元畳み込み層と全結合層を持つエンコーダーが、入力を処理してオシレータおよびノイズ制御パラメータを生成する。
  • 線形補間を用いてフレームレベルのパラメータをサンプルレベルにアップサンプリングし、加法的オシレータが調波成分を生成する。
  • NSFを模倣したニューラルフィルタブロックが、拡張因果畳み込みを用いて励起信号を処理し、スペクトルエンVELOープのダイナミクスをモデル化する。
  • ディスクラミネーターは、MelGANと同様に大口径のストライド付き畳み込みを用い、位相に依存しない学習を可能にし、知覚的品質を向上させる。
  • GANの目的関数を用いた敵対的訓練により、自然さが向上し、自己回帰モデルにありがちなアーチファクトが低減される。

実験結果

リサーチクエスチョン

  • RQ1DDSP風のソース励起とNSF風のニューラルフィルタリングをハイブリッド的に組み合わせることで、エンドツーエンド波形モデルよりも高品質な音声が得られるか?
  • RQ2提案モデルは、非常に小さな音声データセット(30分未塔)で微調整された場合、どのように性能を示すか?
  • RQ3高い推論速度を維持しながら、最先端ボコーダーと同等の知覚的品質を達成できるか?
  • RQ4F0とUV状態を明示的にモデル化することで、メルスペクトログラムに圧縮された調波成分を示す男性声の分野における頑健性が向上するか?
  • RQ5モデルは、Tacotronに基づくテキスト音声変換パイプラインとシームレスに統合できるか?

主な発見

  • HooliGAN は、LJSpeechの全テストデータに対して聴取テストで平均評価得点(MOS)4.07を達成し、WaveRNN、MelGAN、WaveGlow を上回った。
  • モデルは小さなデータセットでも優れた頑健性を示し、特に男性声において、たった30分のデータで微調整した場合に顕著な性能向上を示した。
  • HooliGAN はGPUで2.2MHz、CPUで35kHzの推論速度を達成し、品質を維持しながら WaveRNN や WaveGlow を上回る速度性能を示した。
  • WaveRNN や WaveGlow が直接波形を学習するため位相関連の歪みに起因する「曇った」アーチファクトを多く発生させるのに対し、HooliGAN の出力はそれらよりも少ないアーチファクトを示した。
  • HooliGAN のMOSは、テキスト音声変換における真値に近く、Tacotron2との高い互換性と高い知覚的忠実度を示した。
  • 明示的なソース励起とDSPコンponentsを備えたモデルのアーキテクチャは、複雑さを低減し、特にデータが少ない状況でも一般化性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。