Skip to main content
QUICK REVIEW

[論文レビュー] Deep Transform: Cocktail Party Source Separation via Complex Convolution in a Deep Neural Network

Andrew Simpson|arXiv (Cornell University)|Apr 12, 2015
Speech and Audio Processing参考文献 9被引用数 4
ひとこと要約

本稿では、複素数の畳み込みアーキテクチャ内で円周統計を用いて複雑なスペクトログラムをモデル化することにより、カクテルパーティー効果の音源分離を実現する深層ニューラルネットワークフレームワーク、Deep Transformを提案する。確率的位相モデリングにより、マグニチュードと位相成分を同時に推定することで、二値マスクベースの手法と同等の分離性能を達成し、音声分離における複素数値ディープラーニングの有効性を示した。

ABSTRACT

Convolutional deep neural networks (DNN) are state of the art in many engineering problems but have not yet addressed the issue of how to deal with complex spectrograms. Here, we use circular statistics to provide a convenient probabilistic estimate of spectrogram phase in a complex convolutional DNN. In a typical cocktail party source separation scenario, we trained a convolutional DNN to re-synthesize the complex spectrograms of two source speech signals given a complex spectrogram of the monaural mixture - a discriminative deep transform (DT). We then used this complex convolutional DT to obtain probabilistic estimates of the magnitude and phase components of the source spectrograms. Our separation results are on a par with equivalent binary-mask based non-complex separation approaches.

研究の動機と目的

  • 音源分離において、複素スペクトログラムを適切に扱える深層ニューラルネットワーク手法の不足に対処すること。
  • モノラル混合音声から個々の音声源の複素スペクトログラムを再構築する判別的深層変換を構築すること。
  • 円周統計を用いてスペクトログラムの位相を確率的にモデリングし、分離精度を向上させること。
  • 最先端の二値マスクベースの分離手法と同等の性能を達成すること。
  • 音声源分離における深層ニューラルネットワークにおける複素数畳み込みの有効性を示すこと。

提案手法

  • 本手法は、複素数値スペクトログラムを直接処理する複素数畳み込みニューラルネットワーク(CNN)を採用し、位相情報を保持する。
  • スペクトログラムの位相成分は、von Mises分布として円周統計を用いてモデリングされ、確率的位相推定を可能にする。
  • ネットワークは、単一のモノラル混合スペクトログラムから2つの音声源の複素スペクトログラムを再構築するように学習する。
  • モデルは各音声源のマグニチュードおよび位相の確率的推定値を出力し、整合性のある信号再合成を可能にする。
  • 再構築誤差を複素数ドメインで最小化する判別的学習目的関数が採用され、スペクトルマグニチュードと位相の両方を最適化する。
  • 最終的な分離は、推定された複素スペクトログラムの逆フーリエ変換によって達成される。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、音声源分離のための複素スペクトログラムを効果的にモデル化できるか?
  • RQ2円周統計を用いた確率的位相推定は、分離性能をどのように向上させるか?
  • RQ3複素数畳み込みネットワークは、マグニチュードのみを扱う手法と比較して、性能が優れているか、同等か?
  • RQ4複素数ドメインにおけるマグニチュードと位相の共同推定は、二値マスクベースの手法と同等の結果をもたらすか?
  • RQ5カクテルパーティー状況下で、複素スペクトログラム再構築のエンドツーエンド学習は、実行可能で効果的か?

主な発見

  • 提案されたDeep Transformは、二値マスクベースの非複素数的手法と同等の分離性能を達成し、その有効性を裏付けた。
  • 円周統計による確率的位相モデリングにより、深層ネットワーク内での正確で整合性のある位相推定が可能になった。
  • 複素数畳み込みアーキテクチャは、モノラル混合音声からマグニチュードと位相の両方を再構築する能力を効果的に学習した。
  • 本手法は、マグニチュードのみの表現に依存せずに、複素数ドメインで深層ニューラルネットワークを効果的に学習できることを示した。
  • 結果として、複素スペクトログラムドメインにおけるマグニチュードと位相の共同推定が、高品質な音源分離を実現することがわかった。
  • 2つの重なった音声源が存在する典型的なカクテルパーティー状況でも、本手法は頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。