Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Recurrent Neural Network Based Progressive Learning for Monaural Speech Enhancement

Andong Li, Minmin Yuan|arXiv (Cornell University)|Aug 28, 2019
Speech and Audio Processing参考文献 41被引用数 10
ひとこと要約

本稿では、因果的畳み込み再帰ニューラルネットワークを用いたプログレッシブ学習フレームワーク、PL-CRNNを提案する。この手法は、PL-DNN、PL-LSTM、CRNNと比較して92〜97%少ないパラメータで、優れた音声品質と聞き取りやすさを達成する。計算複雑度を低減しつつ、特に低SNR条件下でも高い性能を維持する。

ABSTRACT

Recently, progressive learning has shown its capacity to improve speech quality and speech intelligibility when it is combined with deep neural network (DNN) and long short-term memory (LSTM) based monaural speech enhancement algorithms, especially in low signal-to-noise ratio (SNR) conditions. Nevertheless, due to a large number of parameters and high computational complexity, it is hard to implement in current resource-limited micro-controllers and thus, it is essential to significantly reduce both the number of parameters and the computational load for practical applications. For this purpose, we propose a novel progressive learning framework with causal convolutional recurrent neural networks called PL-CRNN, which takes advantage of both convolutional neural networks and recurrent neural networks to drastically reduce the number of parameters and simultaneously improve speech quality and speech intelligibility. Numerous experiments verify the effectiveness of the proposed PL-CRNN model and indicate that it yields consistent better performance than the PL-DNN and PL-LSTM algorithms and also it gets results close even better than the CRNN in terms of objective measurements. Compared with PL-DNN, PL-LSTM, and CRNN, the proposed PL-CRNN algorithm can reduce the number of parameters up to 93%, 97%, and 92%, respectively.

研究の動機と目的

  • 既存のディープラーニングベースのモノラル音声強調モデルが示す高い計算コストと大きなパラメータ数の問題に取り組むこと、特にリソース制限のある環境を想定する。
  • 従来の手法が失敗する低信号対雑音比(SNR)条件下での音声品質と聞き取りやすさの向上を図ること。
  • プログレッシブ学習とパラメータ効率の良い因果的CRNNアーキテクチャを統合することで、モデルの複雑度を低減しつつ性能を損なわないこと。
  • 異なる学習ターゲットが音声強調性能に与える影響を調査すること。

提案手法

  • 提案されたPL-CRNNフレームワークは、各プログレッシブ学習段階において因果的畳み込み再帰ニューラルネットワーク(CRNN)を基本サブモデルとして使用し、将来のコンテキストを必要としないリアルタイム推論を可能にする。
  • すべてのプログレッシブ段階にわたりパラメータ共有を適用することで、トレーニング可能なパラメータ総数を著しく削減しつつ、性能の向上を維持する。
  • プログレッシブ学習はトレーニングを複数段階に分け、各段階でSNRを段階的に向上させる。中間出力を次の段階の事前分布として使用する。
  • モデルは、音声品質への影響を評価するために、クリーン音声とスペクトルマスクの2つの異なる学習ターゲットを採用する。
  • アーキテクチャは、畳み込みニューラルネットワーク(CNN)による局所的スペクトル特徴抽出の長所と、再帰ニューラルネットワーク(RNN)による音声の長期的時間的依存性のモデル化の長所を統合する。
  • 計算複雑度を測定するために、浮動小数点乗算加算(FMA)演算を用い、ベースラインと比較してFMA数が顕著に削減されていることが示された。

実験結果

リサーチクエスチョン

  • RQ1因果的CRNNを用いたプログレッシブ学習フレームワークは、PL-DNNやPL-LSTMと比較して、顕著に低いモデル複雑度でより優れた音声強調性能を達成できるか?
  • RQ2プログレッシブ段階間でのパラメータ共有は、パラメータ数と音声強調性能にどのように影響を与えるか?
  • RQ3異なる学習ターゲット(例:クリーン音声対スペクトルマスク)が最終的な強調品質に与える影響は何か?
  • RQ4プログレッシブ学習戦略は、低SNRおよび非定常雑音条件下でも性能向上をもたらすか?
  • RQ5CRNNベースのモデルは、はるかに少ないパラメータ数とFMA数で、標準的なCRNNと同等またはそれ以上の性能を達成できるか?

主な発見

  • PL-CRNNは、PL-DNNと比較して最大93%、PL-LSTMと比較して97%、CRNNと比較して92%のパラメータ削減を達成し、最高のパラメータ効率を実現した。
  • PL-CRNNは、未知の雑音条件下でPESQが2.60、STOIが0.90を達成し、PL-DNN(PESQ: 2.36、STOI: 0.87)、PL-LSTM(PESQ: 2.44、STOI: 0.88)、CRNN(PESQ: 2.55、STOI: 0.89)を上回る性能を示した。
  • 122万パラメータというわずかなパラメータ数にもかかわらず、440万パラメータを有するSCRNNを上回る性能を達成し、CRNNの25%のパラメータで同等以上の性能を実現した。
  • Q=5段階のモデルでは、FMA数が634万(SCRNN)よりわずかに多い994万(FMA)であったが、Q=3段階の場合はFMA数が594万(FMA)に低下し、SCRNNを上回る性能を達成した。
  • プログレッシブ学習は、特に低SNR条件下で、段階間での学習ダイナミクスの向上と事前知識の伝達により、一貫した性能向上をもたらした。
  • LSTMオンリーネットワークにおける飽和効果が確認された。スタックされたLSTM層のパラメータ数を増加させても、性能の向上は比例的ではなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。