Skip to main content
QUICK REVIEW

[論文レビュー] NU-GAN: High resolution neural upsampling with GAN

Rithesh Kumar, Kundan Kumar|arXiv (Cornell University)|Oct 22, 2020
Speech Recognition and Synthesis参考文献 20被引用数 22
ひとこと要約

NU-GANは、位相推定の課題を避けるために周波数領域でマグニチュードスペクトログラムに処理を行うGANベースのニューラルアップサンプリング手法を提案する。22 kHzの低解像度音声を44.1 kHzの高解像度音声に変換する。オリジナルの44.1 kHz音声とほとんど区別がつかない結果を達成し、ABXテストでは単一話者データセットでランダムな選択より7.4%、複数話者データセットで10.8%高い性能を示した。

ABSTRACT

In this paper, we propose NU-GAN, a new method for resampling audio from lower to higher sampling rates (upsampling). Audio upsampling is an important problem since productionizing generative speech technology requires operating at high sampling rates. Such applications use audio at a resolution of 44.1 kHz or 48 kHz, whereas current speech synthesis methods are equipped to handle a maximum of 24 kHz resolution. NU-GAN takes a leap towards solving audio upsampling as a separate component in the text-to-speech (TTS) pipeline by leveraging techniques for audio generation using GANs. ABX preference tests indicate that our NU-GAN resampler is capable of resampling 22 kHz to 44.1 kHz audio that is distinguishable from original audio only 7.4% higher than random chance for single speaker dataset, and 10.8% higher than chance for multi-speaker dataset.

研究の動機と目的

  • テキストから音声を生成するシステムが24 kHzまでしか出力しないというギャップを埋める。これは、44.1 kHzの高解像度音声を必要とするアプリケーションにおいて重要である。
  • テキストや話者IDと相関が低い高周波数成分をモデル化する課題を克服する。
  • 従来のテキストからスペクトログラムへの変換ステージや音声合成ステージを変更せずに、既存のTTSパイプラインに統合可能な、高速でフォワードプロパゲーション型のニューラルアップサンプラーを開発する。
  • 深層生成モデルの文脈において、これまで達成されていなかった44.1 kHz解像度での高品質音声スーパーサンプリングを実現する。
  • 波形生成や位相再構築の複雑さを回避する計算効率の高いソリューションを提供する。

提案手法

  • NU-GANはまず、時間領域でsinc補間を用いて22 kHzの音声を44.1 kHzにアップサンプリングする。
  • その後、補間された信号に対して短時間フーリエ変換(STFT)を実行し、マグニチュードスペクトログラムを取得する。
  • モデルは周波数領域で動作し、位相情報を保持したまま、欠落している高周波数のマグニチュードビンを予測することに焦点を当てる。
  • 生成敵対ネットワーク(GAN)アーキテクチャを用い、本物の高解像度スペクトログラムと生成されたスペクトログラムを区別するディスクリミネーターを訓練する。
  • この手法は完全にフォワードプロパゲーション型であり、自己回帰モデルとは異なり、高速な推論と並列サンプリングが可能である。
  • 訓練目的関数には敵対的損失に加え、知覚的損失と再構成損失を組み合わせ、生成音声の忠実性と自然さを確保する。

実験結果

リサーチクエスチョン

  • RQ1テキストや話者IDと相関が低い高周波数成分を効果的に生成できるか、GANベースのアプローチは有効か?
  • RQ2音声スーパーサンプリングにおいて、波形生成に比べてマグニチュードスペクトログラムの周波数領域モデリングは、より効果的で効率的か?
  • RQ3ニューラルアップサンプラーは、オリジナルの高解像度録音と聴覚的に区別がつかない44.1 kHz音声を生成できるか?
  • RQ4単一話者および複数話者設定において、NU-GANの知覚的品質はベースラインのsinc補間と比較してどの程度優れているか?
  • RQ5NU-GANは、初期のテキストからスペクトログラムへの変換ステージや音声合成ステージを再トレーニングせずに、既存のTTSパイプラインにシームレスに統合できるか?

主な発見

  • 単一話者データセットにおけるABXテストでは、NU-GANはオリジナルの44.1 kHz音声との知覚的区別可能性がランダム選択よりわずかに7.4%高い。
  • 20人の話者が含まれる複数話者データセットでは、区別可能性スコアがランダム選択より10.8%高いが、これは優れた一般化性能を示している。
  • 単一話者データセットにおいて、NU-GANはベースラインのsinc補間よりもABX精度で約20パーセンテージポイント高い。
  • モデルは完全にフォワードプロパゲーション型であり、高速にサンプリング可能で、リアルタイムまたはニアリアルタイムの音声スーパーサンプリングが可能である。
  • TTSパイプラインへの応用における定性的な結果から、NU-GANはより明瞭で自然な音声を生成し、特に「s」音や「f」音の強調が顕著に向上している。
  • NU-GANは、深層生成モデルの文脈において、44.1 kHz解像度での知覚的に高品質な音声スーパーサンプリングを達成した最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。