Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Multichannel Variational Autoencoder for Underdetermined Source Separation

Shogo Seki, Hirokazu Kameoka|arXiv (Cornell University)|Sep 29, 2018
Speech and Audio Processing被引用数 12
ひとこと要約

本稿では、従来の非負値行列分解(NMF)源モデルに代わり、条件付き変分オートエンコーダー(CVAE)を用いることで、複雑なスペクトロトーメポラルパターンをよりよく捉えることのできる、未決定多チャンネル音源分離のための新規フレームワークである一般化多チャンネル変分オートエンコーダー(GMVAE)を提案する。GMVAEは、特にリバーブ環境下で、3音源を2マイクロホンで分離する未決定状態において、MNMFより優れた分離性能を達成している。これは、深層生成モデルの表現力が向上したことに起因する。

ABSTRACT

This paper deals with a multichannel audio source separation problem under underdetermined conditions. Multichannel Non-negative Matrix Factorization (MNMF) is one of powerful approaches, which adopts the NMF concept for source power spectrogram modeling. This concept is also employed in Independent Low-Rank Matrix Analysis (ILRMA), a special class of the MNMF framework formulated under determined conditions. While these methods work reasonably well for particular types of sound sources, one limitation is that they can fail to work for sources with spectrograms that do not comply with the NMF model. To address this limitation, an extension of ILRMA called the Multichannel Variational Autoencoder (MVAE) method was recently proposed, where a Conditional VAE (CVAE) is used instead of the NMF model for source power spectrogram modeling. This approach has shown to perform impressively in determined source separation tasks thanks to the representation power of DNNs. While the original MVAE method was formulated under determined mixing conditions, this paper generalizes it so that it can also deal with underdetermined cases. We call the proposed framework the Generalized MVAE (GMVAE). The proposed method was evaluated on a underdetermined source separation task of separating out three sources from two microphone inputs. Experimental results revealed that the GMVAE method achieved better performance than the MNMF method.

研究の動機と目的

  • スペクトログラムがNMF仮定に従わない源をモデル化できない多チャンネルNMF(MNMF)およびILRMAの制限を解消すること。
  • 元々決定的状態を想定して設計された多チャンネル変分オートエンコーダー(MVAE)を、未決定音源分離に拡張すること。
  • 多チャンネル音声における源パワー スペクトログラム推定のため、条件付きVAE(CVAE)による深層生成モデリングを活用し、より柔軟で正確なモデル化を実現すること。
  • 混合行列、源分散、VAEパラメータの同時推定を可能にする統合最適化フレームワークを確立すること。

提案手法

  • GMVAEフレームワークは、MNMFにおけるNMFベースの源モデルを、個々の源のパワー スペクトログラムを話者IDを条件としてモデル化する条件付き変分オートエンコーダー(CVAE)に置き換える。
  • CVAEは、源スペクトログラムを潜在ベクトルにマップするエンコーダーネットワークと、潜在コードからスペクトログラムを再構成するデコーダーネットワークから構成され、話者ラベル付き音声データ上で学習される。
  • 源パワーとスパarsityに制約を課した、混合行列A(f)、源分散v_j(f,n)、VAEパラメータ(ϕ, θ)を同時に最適化する変分下界(ELBO)を定式化する。
  • 主要化最小化アルゴリズムを用いてELBOを反復的に最適化し、バックプロパゲーションと閉形式解を用いて、混合行列、源分散、VAEパラメータのそれぞれを別々に更新する。
  • 話者固有のスペクトログラムの適切なクラス別モデリングを保証するため、源クラス埋め込みc_jにソフトマックス層を適用し、CVAEのクラス条件付き生成を強制する。
  • アルゴリズムはMNMFベースラインから初期化され、反復的に改善され、主要化最小化フレームワーク下で収束が保証される。

実験結果

リサーチクエスチョン

  • RQ1CVAEのような深層生成モデルは、未決定多チャンネル音源分離において、従来のNMFベースのモデルを上回ることができるか?
  • RQ2源スペクトログラムがNMFモデル仮定に反する場合、CVAEの表現力が分離性能をどのように向上させるか?
  • RQ3源の数がマイクロホン数を上回る未決定状態において、提案されたGMVAEフレームワークは収束性と安定性を維持できるか?
  • RQ4リバーブ条件が変化する中で、GMVAEはMNMFと比較してどの程度の分離品質を達成するか?

主な発見

  • SDR、SIR、ISR、SARの指標で測定したところ、GMVAEは低リバーブ(T60 = 78 ms)および高リバーブ(T60 = 351 ms)両状態で、MNMFよりも顕著に優れた分離性能を達成した。
  • 特に高リバーブ状態(T60 = 351 ms)において、MNMFはその剛性あるNMFモデルにより困難をきたしたが、GMVAEは柔軟なCVAEモデルにより効果的に適応した。
  • CVAEにおける話者IDの条件付き利用により、話者固有のスペクトログラムの正確なモデリングが可能となり、分離精度が向上した。
  • SDRおよびSIRの両指標において、GMVAEは2つのMNMFベースライン(MNMF1およびMNMF2)を常に上回った。
  • 主要化最小化フレームワーク下でアルゴリズムは安定して収束し、MNMFからの初期化が最終的な性能向上に寄与した。
  • 結果から、多チャンネルBSSにおける源パワー スペクトログラムモデリングに、CVAEによる深層生成モデリングがNMFの強力な代替手段であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。