Skip to main content
QUICK REVIEW

[論文レビュー] A Recurrent Variational Autoencoder for Speech Enhancement

Simon Leglaive, Xavier Alameda-Pineda|arXiv (Cornell University)|Oct 24, 2019
Speech and Audio Processing参考文献 33被引用数 5
ひとこと要約

本稿では、潜在変数における時間的依存性を活用することで、前向き伝播アーキテクチャーよりも優れた再構成性能を達成する、単一チャネル音声強調のための再帰的変分オートエンコーダー(RVAE)を提案する。テスト時における変分EMアルゴリズムを用いたエンコーダーのファインチューニングにより、事後分布の時間的ダイナミクスを捉え、ベースライン手法に対して6.8 dBのSI-SDR向上を達成し、最先端の性能を実現した。

ABSTRACT

This paper presents a generative approach to speech enhancement based on a recurrent variational autoencoder (RVAE). The deep generative speech model is trained using clean speech signals only, and it is combined with a nonnegative matrix factorization noise model for speech enhancement. We propose a variational expectation-maximization algorithm where the encoder of the RVAE is fine-tuned at test time, to approximate the distribution of the latent variables given the noisy speech observations. Compared with previous approaches based on feed-forward fully-connected architectures, the proposed recurrent deep generative speech model induces a posterior temporal dynamic over the latent variables, which is shown to improve the speech enhancement results.

研究の動機と目的

  • 音声信号における時間的依存性をモデル化できない前向き伝播VAEの限界を解消すること。
  • 深層生成モデルの潜在空間に再帰的ダイナミクスを導入することで、音声強調性能を向上させること。
  • ノイズ混在観測値を前提とした潜在変数の真の事後分布を近似できるように、テスト時におけるエンコーダーのファインチューニング手法を開発すること。
  • 独立フレームモデルを越えて、事後時間的ダイナミクスの恩恵を享受できることを示すこと。
  • 点推定手法や前向き伝播ベースラインと比較して、変分EMを用いた提案RVAEの優位性を検証すること。

提案手法

  • RNNベースのデコーダーを備えた再帰的VAE(RVAE)を採用し、潜在変数の全系列に条件付けられるため、音声フレームの時間的モデリングが可能となる。
  • テスト時にノイズ混合信号から推定される非負値行列分解(NMF)ノイズモデルを用いる。
  • テスト時に変分期待最大化(VEM)アルゴリズムを適用し、エンコーダーをファインチューニングして、ノイズ入力下での潜在変数の真の事後分布を近似する。
  • 比較のための「点推定」代替手法(PEEM)を導入し、潜在変数の最大事後確率推定値のみを用いる。
  • VEM目的関数に対してR=1サンプルによるモンテカルロ推定を実施し、FFNNでは10ステップ、RNN/BRNNでは1ステップの勾配更新をAdamで最適化することで、性能と計算量のバランスを図る。
  • モデルはクリア音声のみで学習され、生成モデルはニューラルネットワークが予測する分散を伴う複素正規分布尤度関数で定義される。

実験結果

リサーチクエスチョン

  • RQ1VAEの潜在空間に再帰的ダイナミクスを組み込むことで、前向き伝播アーキテクチャーよりも音声強調性能が向上するか?
  • RQ2テスト時に変分EMによるエンコーダーのファインチューニングは、点推定推論よりも優れた音声推定を達成できるか?
  • RQ3RNNアーキテクチャが誘発する事後時間的ダイナミクスは、VEMアルゴリズムの最適化を安定化・向上させるか?
  • RQ4提案手法RVAE(VEM)は、SI-SDR、PESQ、ESTOIの観点から、既存の生成的および判別的アプローチと比較して優れているか?
  • RQ5この音声強調設定において、双方向RNN(BRNN)は単方向RNN(RNN)よりも顕著に優れているか?

主な発見

  • VEMを用いたRVAEは中央値として6.8 dBのSI-SDRを達成し、FFNNベースのVEM(4.4 dB)およびPEEM(4.4 dB)を顕著に上回り、再帰的モデリングの利点を示した。
  • RNNベースのモデルは6.8 dBのSI-SDRを達成し、MCEMを用いた最良のFFNNモデル(5.4 dB)よりも1.4 dB高い性能を示し、時間的ダイナミクスの優位性を裏付けた。
  • BRNNモデルは6.9 dBのSI-SDRを達成し、RNNよりわずかに優れていたが、差は統計的に有意ではなく、この設定では双方向コンテキストの恩恵が限定的であることを示唆した。
  • VEMアルゴリズムは全モデルでPEEMを上回り、RNNモデルではSI-SDRが2.4 dB向上した。これは、点推定値ではなく完全な事後分布近似の価値を確認した。
  • FFNN用のVEMアルゴリズムは反復回数を増やすにつれて性能が劣化したが、RNNモデルでは安定しており、時間的ダイナミクスが収束性と最適化を向上させることを示唆した。
  • 提案手法は0.67のESTOIスコアと2.35のPESQを達成し、オラクル・ウィーナー・フィルタ(0.88 ESTOI、3.13 PESQ)に近い、優れた聴取的品質を実現した。これは、ペaired学習データが存在しないにもかかわらず顕著な結果である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。