Skip to main content
QUICK REVIEW

[論文レビュー] Neural Vocoder is All You Need for Speech Super-resolution

Haohe Liu, Woosung Choi|arXiv (Cornell University)|Mar 28, 2022
Speech and Audio Processing被引用数 7
ひとこと要約

本論文は、事前学習済み音声変換器の事前知識を活用することで、固定された入力解像度やアップサンプリング比に制限されない、多様な入力解像度およびアップサンプリング比において最先端の性能を達成する神経音声変換器ベースの音声スーパーレゾリューション手法NVSRを提案する。単純なリピートパディングによるメル帯域拡張を用いても、WSRGlow や Nu-wave よりも 44.1 kHz でのログスペクトル距離(LSD)でそれぞれ 8% および 37% 低い性能を達成しており、音声変換器のインダクティブバイアスの重要性を示している。

ABSTRACT

Speech super-resolution (SR) is a task to increase speech sampling rate by generating high-frequency components. Existing speech SR methods are trained in constrained experimental settings, such as a fixed upsampling ratio. These strong constraints can potentially lead to poor generalization ability in mismatched real-world cases. In this paper, we propose a neural vocoder based speech super-resolution method (NVSR) that can handle a variety of input resolution and upsampling ratios. NVSR consists of a mel-bandwidth extension module, a neural vocoder module, and a post-processing module. Our proposed system achieves state-of-the-art results on the VCTK multi-speaker benchmark. On 44.1 kHz target resolution, NVSR outperforms WSRGlow and Nu-wave by 8% and 37% respectively on log spectral distance and achieves a significantly better perceptual quality. We also demonstrate that prior knowledge in the pre-trained vocoder is crucial for speech SR by performing mel-bandwidth extension with a simple replication-padding method. Samples can be found in https://haoheliu.github.io/nvsr.

研究の動機と目的

  • 既存の音声スーパーレゾリューション手法が固定された入力解像度およびアップサンプリング比に制限されているという限界を解消すること。
  • 入力とターゲットのサンプリング周波数が異なる実世界の不一致状況における一般化性能の向上。
  • 事前学習済み神経音声変換器が音声スーパーレゾリューションにおける強力なインダクティブバイアスとして機能するかを検証すること。
  • 再トレーニングなしにマルチスケーラー・マルチスプーカー音声スーパーレゾリューションを統合的かつ柔軟に処理できるシステムの開発。

提案手法

  • NVSR は二段階のパイプラインを採用:まず低解像度入力から高解像度メルスペクトログラムを予測し、次に神経音声変換器を用いて波形を合成する。
  • メル帯域拡張は単純なリピートパディング法を用いて実施され、驚くべきことに学習済み手法を上回る性能を示した。
  • 出力波形の精錬と高周波数ノイズの低減を目的として、ローパスフィルタリング(LFR)を用いたポストプロセッシングモジュールを適用。
  • TFGAN などの事前学習済み神経音声変換器を活用し、子音構造や高調波パターンといった強力な音声事前知識を注入。
  • 線形周波数予測よりも、高いアップサンプリング比に対しても取り扱いやすいメル周波数スケールで処理を実施。
  • 同一モデルを複数の入力解像度(2–32 kHz)およびターゲット周波数(16–44.1 kHz)で評価し、柔軟性を実証。

実験結果

リサーチクエスチョン

  • RQ1神経音声変換器ベースのアプローチは、音声スーパーレゾリューションにおいて多様な入力サンプリング周波数およびアップサンプリング比に一般化可能か?
  • RQ2学習済みニューラルネットワークと比較して、単純なリピートパディング法によるメル帯域拡張はどの程度効果的か?
  • RQ3事前学習済み音声変換器の事前知識は、音声スーパーレゾリューション性能をどの程度向上させるか?
  • RQ4固定された入力-ターゲット設定でトレーニングされたタスク特化型モデルと比較して、単一の統合モデルが優れた性能を発揮できるか?
  • RQ5ポストプロセッシングは神経音声変換器ベースのスーパーレゾリューションにおいて波形品質を顕著に向上させるか?

主な発見

  • NVSR は 44.1 kHz ターゲットベンチマークで平均ログスペクトル距離(LSD)0.86 を達成し、WSRGlow(0.94)および Nu-wave(1.37)をそれぞれ 0.08 および 0.51 低下させ、最先端の性能を達成。
  • NVSR-Pad はメル帯域拡張にリピートパディングのみを用い、12 kHz および 24 kHz 入力において Nu-wave を上回る LSD 1.27 を達成。
  • 2 kHz から 16 kHz のスーパーレゾリューションにおいて NVSR は LSD 1.07 を達成し、このような高いアップサンプリング比(UPR = 8)で初めてこの性能を達成した。
  • ポストプロセッシングなしの NVSR の性能は LSD 0.84 から 0.96 に低下し、ノイズ低減におけるポストプロセッシングの重要性を示している。
  • メルスペクトログラム予測ヘッドがなくても、音声変換器単体で LSD を 4.65(生波形)から 1.89 に改善しており、音声変換器自体の音声品質向上能力を証明。
  • 真値メルスペクトログラムを用いた場合の理論的最良性能(LSD = 0.76)に非常に近い性能を NVSR が達成しており、メル予測モジュールの高効率性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。