Skip to main content
QUICK REVIEW

[論文レビュー] Tensor-Train Long Short-Term Memory for Monaural Speech Enhancement

Suman Samui, Indrajit Chakrabarti|arXiv (Cornell University)|Dec 25, 2018
Speech and Audio Processing参考文献 14被引用数 4
ひとこと要約

本稿では、テンソル・トレイン分解を用いて重み行列を要因分解することで、深層LSTMネットワークの圧縮を図るテンソル・トレイン長短期記憶(TT-LSTM)モデルを提案する。標準RNNと比較して、パラメータ数が数個のオーダーも少ないにもかかわらず、TT-LSTMを用いたTensorNetは、一致するおよび不一致のノイズ条件の両方で、競争力のある音声品質と聞き取りやすさの性能を達成している。

ABSTRACT

In recent years, Long Short-Term Memory (LSTM) has become a popular choice for speech separation and speech enhancement task. The capability of LSTM network can be enhanced by widening and adding more layers. However, this would introduce millions of parameters in the network and also increase the requirement of computational resources. These limitations hinders the efficient implementation of RNN models in low-end devices such as mobile phones and embedded systems with limited memory. To overcome these issues, we proposed to use an efficient alternative approach of reducing parameters by representing the weight matrix parameters of LSTM based on Tensor-Train (TT) format. We called this Tensor-Train factorized LSTM as TT-LSTM model. Based on this TT-LSTM units, we proposed a deep TensorNet model for single-channel speech enhancement task. Experimental results in various test conditions and in terms of standard speech quality and intelligibility metrics, demonstrated that the proposed deep TT-LSTM based speech enhancement framework can achieve competitive performances with the state-of-the-art uncompressed RNN model, even though the proposed model architecture is orders of magnitude less complex.

研究の動機と目的

  • モノラル音声強調における深層LSTMモデルの高いパラメータ数と計算コストを解決すること。
  • メモリや計算リソースに制限のある低価格端末(スマートフォンや組み込みシステムなど)への展開制限を克服すること。
  • パラメータ効率の良い重み行列の要因分解により、モデルの複雑さを著しく削減しながらも、高い音声品質と聞き取りやすさを維持すること。
  • 評価において、訓練時に存在しなかったノイズタイプに対しても一般化できるよう、話者およびノイズの一般化を実現すること。
  • 顕著な圧縮にもかかわらず性能を維持するTT-LSTMユニットを用いた深層ニューラルネットワークフレームワークの構築

提案手法

  • LSTMユニットの密な重み行列にテンソル・トレイン(TT)分解を適用し、低ランクのコアテンソルの系列に要因分解する。
  • TT形式を用いて各LSTM重み行列を行列積の鎖として表現することで、パラメータ数を削減しながら表現能力を維持する。
  • エンドツーエンドのモノラル音声強調を実現するため、TT-LSTMユニットを用いた3層の深層TensorNetアーキテクチャを構築する。
  • 時間周波数(T-F)マスクアプローチを採用し、ネットワークがノイズあり入力から綺麗な音声を再構築するためのマスクを予測する。
  • ドロップアウト(0.5)とバッチ正則化を用いて、バックプロパゲーションスルータイムによる学習を実施し、一般化性能を向上させる。
  • TTランク(例:ランク4)を用いて、モデルの複雑さと性能のバランスを制御し、圧縮度を調整する。

実験結果

リサーチクエスチョン

  • RQ1テンソル・トレイン分解は、パフォーマンスを損なわせることなく、モノラル音声強調のためのLSTMモデルを効果的に圧縮できるか?
  • RQ2標準の圧縮されていないLSTMおよびDNNベースラインと比較して、TT-LSTMモデルの音声品質および聞き取りやすさの性能はどの程度か?
  • RQ3訓練時に存在しなかったノイズタイプに対し、TT-LSTMモデルはどの程度一般化できるか?
  • RQ4標準RNNと比較して、モデルのパラメータ効率はどの程度であり、低リソースデバイスへの展開を可能にするか?
  • RQ5SNRレベルの変動や多様な話者集団に対し、TT-LSTMフレームワークはどの程度のロバストネスを示すか?

主な発見

  • TT-LSTMを用いたTensorNetは、パラメータ数が数個のオーダーも少ないにもかかわらず、最先端の圧縮されていないRNNモデルと同等のPESQおよびSTOIスコアを達成している。
  • テストセットA(一致ノイズ)では、TT-LSTM-ランク4モデルが平均PESQ 2.45、STOI 0.82を達成し、DNNベースラインを上回り、LSTMベースラインと同等の性能を示した。
  • テストセットB(不一致ノイズ)では、TT-LSTMモデルが平均PESQ 2.38、STOI 0.80を維持し、訓練時に存在しなかったノイズタイプに対しても強い一般化性能を示した。
  • 標準LSTMと比較して、TT-LSTMモデルはモデルの複雑さを複数のオーダーも減少させ、メモリ制限のあるデバイスへの効率的な展開を可能にした。
  • 本研究で提示されたフレームワークは顕著な話者一般化を示しており、テスト話者は訓練および検証セットとは全く異なる人物であった。
  • TTランク(例:4)の使用により、多様なノイズ条件下でも高い性能を維持しながら、モデルの複雑さを効果的に制御できることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。