Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end Networks for Supervised Single-channel Speech Separation

Shrikant Venkataramani, Paris Smaragdis|arXiv (Cornell University)|Oct 5, 2018
Speech and Audio Processing参考文献 24被引用数 9
ひとこと要約

本稿では、従来のSTFTベースの処理に代わって、生波形に直接処理を行うエンドツーエンドのディープラーニングアーキテクチャを、単一チャネル音声分離のために提案している。学習可能なマスキングヘッドと、SDR、STOI、SIR、SARを組み合わせた複合損失関数を導入することで、優れた分離性能を達成しており、主観的評価ではSDR-STOIおよびSIR-SARの組み合わせが、ターゲット音声の保持と干渉音の抑制において最良の聴取的結果を示した。

ABSTRACT

The performance of single channel source separation algorithms has improved greatly in recent times with the development and deployment of neural networks. However, many such networks continue to operate on the magnitude spectrogram of a mixture, and produce an estimate of source magnitude spectrograms, to perform source separation. In this paper, we interpret these steps as additional neural network layers and propose an end-to-end source separation network that allows us to estimate the separated speech waveform by operating directly on the raw waveform of the mixture. Furthermore, we also propose the use of masking based end-to-end separation networks that jointly optimize the mask and the latent representations of the mixture waveforms. These networks show a significant improvement in separation performance compared to existing architectures in our experiments. To train these end-to-end models, we investigate the use of composite cost functions that are derived from objective evaluation metrics as measured on waveforms. We present subjective listening test results that demonstrate the improvement attained by using masking based end-to-end networks and also reveal insights into the performance of these cost functions for end-to-end source separation.

研究の動機と目的

  • STFTベースのフロントエンドを回避し、生音声波形に直接処理を行うエンドツーエンドのニューラルネットワークを、単一チャネルの音源分離のために開発すること。
  • 混合波形の潜在表現とマスク推定を同時に最適化することで、分離性能を向上させること。
  • SDR、STOI、SIR、SARといった、主観的に関連する指標に基づくコスト関数を、エンドツーエンドの学習に適応させるために評価・最適化すること。
  • 主観的聴取テストと客観的評価を通じて、複合損失関数の有効性を検証すること。

提案手法

  • 従来のSTFTおよび逆STFTを、生波形をエンドツーエンドで処理するための学習可能な畳み込み層および転置畳み込み層に置き換える。
  • 時間領域でのバイナリまたはソフトマスクを推定するマスキングベースのアーキテクチャを導入し、マスクと潜在表現の両方を同時に最適化可能にする。
  • SDR、STOI、SIR、SAR指標を組み合わせた複合コスト関数を設計し、最適化のバランスをとるために単位化する。
  • 波形再構成品質を向上させるために、これらの主観的動機付けに基づいた損失関数を用いてバックプロパゲーションでネットワークを学習する。
  • 180名の参加者が関与するAmazon Mechanical Turkを介したCAQEによる主観的聴取テストを実施し、異なるコスト関数における主観的品質を評価する。
  • SDR、SIR、SAR、STOIといった客観的指標を用いて、主観的平均意見スコアとの相関関係を検証し、妥当性を確認する。

実験結果

リサーチクエスチョン

  • RQ1生波形に直接学習させるエンドツーエンドのニューラルネットワークは、単一チャネル音声分離において、STFTベースのアーキテクチャを上回る性能を発揮できるか?
  • RQ2マスク推定と潜在表現の同時最適化は、直接波形予測を行う手法と比較して、分離性能を向上させるか?
  • RQ3SDR、STOI、SIR、SARに基づく複合損失関数の中で、どの関数が主観的聴取テストにおいて最良の聴取的品質をもたらすか?
  • RQ4異なるコスト関数は、ターゲット音声の保持、干渉音の抑制、アーチファクト生成にどのように影響を与えるか?

主な発見

  • マスキングベースのエンドツーエンドモデル(Full-AET masking)は、主観的聴取テストで最高の平均意見スコアを達成し、他のすべてのアーキテクチャを上回った。
  • SDRとSTOIを組み合わせた複合損失関数が、ターゲット音声の保持と音声の明瞭度向上において最良の性能を示した。
  • SDRを単独で最大化することで、全テストモデルおよびコスト関数において最も少ない主観的アーチファクトが発生した。
  • SIRとSARを組み合わせた損失関数が、干渉音源の抑制において最も効果的であった。
  • 主観的結果から、MSE損失を最小化することが、音声の明瞭度や主観的品質を最大化することに一致しないことが確認され、指標に基づいたコスト関数の必要性が裏付けられた。
  • BSS-EvalおよびSTOI指標に基づく複合コスト関数の使用により、標準的なMSEベースの学習に比べて顕著な性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。