Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Deep Learning-Based Speech Denoising

Nasim Alamdari, Arian Azarang|arXiv (Cornell University)|Apr 26, 2019
Speech and Audio Processing参考文献 34被引用数 8
ひとこと要約

この論文は、訓練中にクリアな音声データを必要としない自己教師あり深層学習アプローチを提案し、ノイズのある音声を別のノイズのあるバージョンにマッピングする完全畳み込みニューラルネットワークを訓練することで、音声のノイズ除去を実現する。この手法は、3つの音声データセットおよび1つのノイズデータセットにおいて、完全教師ありベースラインを上回り、実際に利用可能なのはノイズのあるデータに限られる現実の現場環境でも優れた性能を示す。

ABSTRACT

This paper presents a self-supervised deep neural network solution to speech denoising by easing the requirement that clean speech signals need to be available for network training. This self-supervised approach is based on training a Fully Convolutional Neutral Network to map a noisy speech signal to another noisy version of the speech signal. To show the effectiveness of the developed approach, four commonly used objective performance measures are used to compare the self-supervised approach to the commonly used fully-supervised approach in which it is assumed that clean speech signals are available for training. The measures are examined for three public domain datasets of speech signals and one public domain dataset of noise signals. The results obtained indicate the self-supervised approach outperforms the fully-supervised approach. This solution is more suited for field deployment compared to the conventional deep learning-based solutions since under realistic audio conditions the only signals which are available for training are noisy speech signals and not clean speech signals.

研究の動機と目的

  • 実世界の状況ではしばしば入手不可能なクリアな音声データを必要としない音声ノイズ除去モデルの訓練という課題に対処すること。
  • クリアなデータペアに依存しない自己教師あり深層ニューラルネットワークを構築し、ノイズのある入力を他のノイズのあるバージョンにマッピングすることで、ノイズ除去の学習を実現すること。
  • 標準的な客観的指標を用いて、複数の公開データセット上で自己教師ありアプローチと完全教師あり手法の性能を比較評価すること。
  • 本手法が、訓練時に利用可能なのはノイズのある音声信号に限られる現場での実用的妥当性を実証すること。

提案手法

  • 完全畳み込みニューラルネットワークを自己教師ありの方法で訓練し、入力のノイズのある音声信号の変換版を予測する。
  • 訓練の目的はコントラスト学習に基づく。ネットワークは入力信号のノイズのあるバリエーションを再構築または予測することにより、頑健な特徴学習を促進する。
  • モデルは訓練中にクリアな音声サンプルのペアを一切必要としない。
  • 性能評価には、PESQ、STOI、SNR、SI-SDR の4つの標準的指標を用い、3つの公開音声データセットおよび1つのノイズデータセットで評価する。
  • 自己教師ありモデルは、クリアな音声とノイズのある音声のペアを用いて訓練された完全教師ありベースラインと直接比較される。

実験結果

リサーチクエスチョン

  • RQ1訓練中にクリアな音声データが使用されない状況で、自己教師あり深層学習モデルが完全教師ありモデルを上回る音声ノイズ除去性能を達成できるか?
  • RQ2自己教師ありアプローチは、多様な実世界の音声およびノイズデータセットにおいて、教師ありベースラインと比較してどの程度の性能を示すか?
  • RQ3自己教師学習は、音声ノイズ除去応用において、ペアのクリアな音声データへの依存度をどの程度低減できるか?
  • RQ4訓練時に利用可能なのはノイズのある音声のみである現実世界の展開に、自己教師ありアプローチはより適しているか?

主な発見

  • 自己教師ありアプローチは、テストされたデータセットのすべての4つの客観的性能指標で、完全教師ありベースラインを上回った。
  • PESQ、STOI、SNR、SI-SDR の観点から、音声品質および音声の聞き取りやすさの向上が確認された。
  • 3つの公開音声データセットおよび1つのノイズデータセットにおいて、強い汎化性能を示し、多様な音響環境への耐性が裏付けられた。
  • ノイズのあるデータのみを用いた自己教師学習が、クリアなデータを必要とする教師あり学習よりも優れたノイズ除去性能を達成できることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。