Skip to main content
QUICK REVIEW

[論文レビュー] Two-stage model and optimal SI-SNR for monaural multi-speaker speech separation in noisy environment

Chao Ma, Dongmei Li|arXiv (Cornell University)|Apr 14, 2020
Speech and Audio Processing参考文献 19被引用数 4
ひとこと要約

本稿では、ノイジーサイドでマルチスピーカー音声分離を実現するための、conv-TasNetに基づく2段階型ディーブラーニングモデルを提案する。拡張された時間的畳み込みネットワーク(dilated temporal convolutional networks)を用いて、音声増強と分離の2段階を逐次的に行う。最適化されたSI-SNR(OSI-SNR)という、標準のSI-SNRを上回る改善された目的関数を導入し、2段階アーキテクチャと共同で学習させることで、1段階型ベースラインを上回る優れた性能を達成する。

ABSTRACT

In daily listening environments, speech is always distorted by background noise, room reverberation and interference speakers. With the developing of deep learning approaches, much progress has been performed on monaural multi-speaker speech separation. Nevertheless, most studies in this area focus on a simple problem setup of laboratory environment, which background noises and room reverberations are not considered. In this paper, we propose a two-stage model based on conv-TasNet to deal with the notable effects of noises and interference speakers separately, where enhancement and separation are conducted sequentially using deep dilated temporal convolutional networks (TCN). In addition, we develop a new objective function named optimal scale-invariant signal-noise ratio (OSI-SNR), which are better than original SI-SNR at any circumstances. By jointly training the two-stage model with OSI-SNR, our algorithm outperforms one-stage separation baselines substantially.

研究の動機と目的

  • 背景ノイズや干渉スピーカーが性能を低下させる現実的でノイジーで混浊した環境下におけるモノラルマルチスピーカー音声分離の課題に対処すること。
  • 従来の手法が清浄でラボベースの環境に特化しており、現実世界の劣化要因を考慮しないという限界を克服すること。
  • 音声増強とスピーカー分離を別々に処理する2段階フレームワークを設計し、より高い耐障害性を実現すること。
  • 標準のSI-SNRを常に上回る性能を示す、新しい目的関数である最適SI-SNR(OSI-SNR)を開発すること。
  • 2段階モデルをOSI-SNRと共同で学習させることで、1段階型ベースラインに比べて顕著な性能向上が達成されることを示すこと。

提案手法

  • モデルは2段階アーキテクチャを採用:まず、TCNベースの増幅モジュールで混合音声を増幅し、その後分離モジュールで個々のスピーカーを分離する。
  • 両モジュールは、効率的な受容野を備えた拡張された時間的畳み込みネットワーク(TCNs)を用いて、長距離の時間的依存関係を捉える。
  • 提案されたOSI-SNR損失関数は、SI-SNRのより耐障害性の高い変種として導出され、変動する信号対ノイズ比(SNR)や干渉レベル下でも性能を維持できるように最適化されている。
  • OSI-SNRは信号の振幅スケーリングに対して不変であり、多様なノイジーサイド条件下でも安定した勾配を提供するように設計されている。
  • 全システムは、増幅と分離の両モジュールを同時に最適化できるように、OSI-SNR目的関数を用いてエンドツーエンドで共同学習される。
  • アーキテクチャはconv-TasNetをインspiredしているが、ノイズ低減とスピーカー分離の逐次処理に対応するように変更されている。

実験結果

リサーチクエスチョン

  • RQ11段階型モデルと比較して、ノイジーで混浊した環境下におけるモノラルマルチスピーカー音声分離の性能を向上させるために、2段階型ディーブラーニングフレームワークは有効であるか?
  • RQ2提案されたOSI-SNR損失関数は、多様なノイジーサイド条件下で、標準のSI-SNRよりも安定的かつ優れた最適化を実現するか?
  • RQ3増幅と分離の逐次処理は、現実的環境下でエンドツーエンド分離と比較して、より優れた性能を発揮するか?
  • RQ4OSI-SNRと共同で学習された2段階モデルは、音声品質および分離精度の観点から、1段階型ベースラインと比較してどのように異なるか?
  • RQ5標準のSI-SNRが失敗するような極端なノイズや干渉レベル下でも、OSI-SNRは耐障害性があり、有効に機能するか?

主な発見

  • OSI-SNRを搭載した2段階モデルは、音声分離品質およびノイズ耐性の観点で、1段階型分離ベースラインを顕著に上回っている。
  • OSI-SNRは、テストされたすべての信号対ノイズ比(SNR)条件下で、標準のSI-SNRを常に上回る性能を達成している。
  • 増幅と分離の逐次処理により、背景ノイズおよび干渉スピーカーに対する耐性が向上している。
  • 従来の手法がしばしば失敗する現実的でノイジーな環境下でも、本モデルは優れた一般化性能を示している。
  • 本稿では、提案手法がターゲットタスクで最先端の性能を達成していると報告しているが、要約では具体的な数値指標は提示されていない。
  • 本研究はINTERSPEECH 2020で却下されたが、大幅な見直しを経てAPSIPA ASC 2020に再提出されたことから、技術的厳密性と潜在的インパクトが裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。