Skip to main content
QUICK REVIEW

[論文レビュー] FeatherWave: An efficient high-fidelity neural vocoder with multi-band linear prediction

Qiao Tian, Zewang Zhang|arXiv (Cornell University)|May 12, 2020
Speech Recognition and Synthesis参考文献 21被引用数 9
ひとこと要約

FeatherWaveは、LPCNetフレームワークにマルチバンド線形予測(MB-LP)を統合することで、高精細で効率的なニューラルボコーダーを提案する。これにより、1回のRNNステップで複数の音声サンプルを並列に生成でき、計算複雑度が低減される。2コアのCPU上で24 kHzで10倍リアルタイムの合成速度を達成し、MOSが4.55に達する。LPCNetに比べて速度と品質の両面で優れている。

ABSTRACT

In this paper, we propose the FeatherWave, yet another variant of WaveRNN vocoder combining the multi-band signal processing and the linear predictive coding. The LPCNet, a recently proposed neural vocoder which utilized the linear predictive characteristic of speech signal in the WaveRNN architecture, can generate high quality speech with a speed faster than real-time on a single CPU core. However, LPCNet is still not efficient enough for online speech generation tasks. To address this issue, we adopt the multi-band linear predictive coding for WaveRNN vocoder. The multi-band method enables the model to generate several speech samples in parallel at one step. Therefore, it can significantly improve the efficiency of speech synthesis. The proposed model with 4 sub-bands needs less than 1.6 GFLOPS for speech generation. In our experiments, it can generate 24 kHz high-fidelity audio 9x faster than real-time on a single CPU, which is much faster than the LPCNet vocoder. Furthermore, our subjective listening test shows that the FeatherWave can generate speech with better quality than LPCNet.

研究の動機と目的

  • リアルタイムおよびエッジデバイス向けに適した、より高速で効率的なニューラルボコーダーの開発。
  • 24 kHzの高精細音声向けに、LPCNet やマルチバンド WaveRNN などの軽量RNNベースボコーダーの計算非効率性を解決すること。
  • LPCNetアーキテクチャにマルチバンド処理と線形予測を組み合わせることで、音声品質と生成速度を向上させること。
  • 最適化されたインフェンスカーネルとモデルプルーニングを活用し、リソース制限のあるデバイスでも高品質・低遅延の推論を可能にすること。

提案手法

  • RNNステップごとに複数の音声サンプルを並列に生成できるように、LPCNetフレームワークにマルチバンド信号処理を統合する。
  • サブバンド信号を同時にモデル化するため、マルチバンド線形予測(MB-LP)を適用し、シーケンス長と計算負荷を低減する。
  • 8ビットμ-law量子化と事前強調処理、および単一のソフトマックス出力層を用い、LPCNetと同様に離散化された音声を効率的にモデル化する。
  • 2段階のスパースプルーニング法(TSSP)を採用し、モデル効率を向上させるとともに量子化ノイズを低減し、音声品質を向上させる。
  • マルチスレーディングを活用した最適化されたストリーミングインフェンスカーネルを設計し、推論を高速化する。
  • メルスペクトログ램を用いてLPフィルタを抽出することで、別個のピッチ抽出処理の必要性を排除し、モデルのロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1マルチバンド処理は、LPCNetのような軽量RNNベースのニューラルボコーダーのインフェンス速度を著しく向上させつつ、音声品質を損なわずに実現できるか?
  • RQ2LPCNetアーキテクチャにマルチバンド線形予測を組み合わせることで、計算複雑度と生成効率にどのような影響を与えるか?
  • RQ3提案された2段階のスパースプルーニング法(TSSP)は、従来のプルーニング手法に比べて、音声品質とモデル効率にどの程度の向上をもたらすか?
  • RQ4FeatherWaveは、2コアCPU上で10倍リアルタイムの24 kHz高精細音声合成を達成しつつ、高精度な聴取品質を維持できるか?
  • RQ524 kHzで、MoL WaveNet と同等の最先端モデルと比較して、主観的品質評価において FeatherWave はどの程度の性能を示すか?

主な発見

  • 24 kHz音声生成におけるFeatherWaveの計算複雑度は1.6 GFLOPSであり、LPCNetの2.8 GFLOPSに比べ顕著に低減されている。
  • 最適化されたマルチスレーディングインフェンスカーネルを用いて、2コアCPU上で24 kHzの高精細音声を10倍リアルタイムで生成可能である。
  • 主観的聴取テストの結果、24 kHzでMOSが4.55を達成しており、MoL WaveNet(4.58)にわずかに劣るが、LPCNet(4.48)を上回っている。
  • 2段階のスパースプルーニング法(TSSP)により、90%のスパarsity条件下でNLLが4.14から4.07に低下し、モデル品質の向上と悪質なプルーニング選択のリスク低減が示された。
  • 10ビットμ-law量子化と単一のソフトマックス層を採用することで、LPCNetよりも量子化ノイズと忠実度の損失が低減されている。
  • Parallel WaveNetに比べて推論速度が優れており、同じハードウェア環境で同等の速度を達成するためのCPUコア数が8つから2つにまで削減されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。