Skip to main content
QUICK REVIEW

[論文レビュー] Speech Denoising by Accumulating Per-Frequency Modeling Fluctuations

Michael Michelashvili, Lior Wolf|arXiv (Cornell University)|Apr 16, 2019
Speech and Audio Processing参考文献 22被引用数 6
ひとこと要約

本稿では、1つのノイズ混入音声クリップを用いて訓練されたWaveUnetにおける周波数毎のモデリングの揺らぎを活用し、ノイズを特定・低減する非教師あり音声ノイズ除去手法を提案する。1つのノイズ混入音声クリップを入力としてネットワークを訓練し、時間周波数ビンごとに適合スコアを蓄積することで、古典的手法を用いてクリアな音声を回復する。この手法は、教師あり最先端手法と同等の性能を達成し、非定常ノイズ環境下では非教師ありベースラインを上回る性能を示す。

ABSTRACT

We present a method for audio denoising that combines processing done in both the time domain and the time-frequency domain. Given a noisy audio clip, the method trains a deep neural network to fit this signal. Since the fitting is only partly successful and is able to better capture the underlying clean signal than the noise, the output of the network helps to disentangle the clean audio from the rest of the signal. This is done by accumulating a fitting score per time-frequency bin and applying the time-frequency domain filtering based on the obtained scores. The method is completely unsupervised and only trains on the specific audio clip that is being denoised. Our experiments demonstrate favorable performance in comparison to the literature methods. Our code and samples are available at github.com/mosheman5/DNP and as supplementary. Index Terms: Audio denoising; Unsupervised learning

研究の動機と目的

  • 教師あり手法の進展にもかかわらず、音声ノイズ除去における非教師ありディープラーニングの進展が不足している問題に対処すること。
  • 無声部やノイズの定常性といったヒューリスティックな仮定に依存する従来の非教師あり手法の限界を克服すること。
  • クリアな参照信号や外部データセットを必要とせず、1つのノイズ混入音声クリップのみで動作する手法を開発すること。
  • ニューラルネットワークの適合不安定性を活用し、ノイズ成分を特定し、周波数ごとのスコア蓄積によってノイズ除去性能を向上させること。

提案手法

  • ランダムな潜在ベクトルを入力として用い、再構成誤差 $\|f_\theta(z) - y\|$ を最小化するように、WaveUnetを1つのノイズ混入音声クリップに適合させる。
  • 訓練の各イテレーションにおいて、モデルが最も適合に苦労する時間周波数ビンを特定し、ノイズ成分を示す。
  • 訓練中のモデリングの揺らぎの大きさに基づき、各時間周波数ビンごとに適合スコアを蓄積する。
  • 蓄積された適合スコアをマスクとして用い、時間周波数ドメインの古典的手法(例:ウィーナーまたはLSAフィルタ)を適用してノイズ成分を低減する。
  • 評価時にクリアな音声との比較に基づき、訓練イテレーション中の最良なネットワーク出力を最終的なノイズ除去信号として選ぶ。
  • 低周波数ノイズを除去するために、後処理としてハイパスフィルタ(60 Hzカットオフ周波数)を適用する。

実験結果

リサーチクエスチョン

  • RQ11つのノイズ混入音声クリップに訓練された深層ニューラルネットワークにおける周波数毎のモデリングの揺らぎを、ノイズとクリアな音声を効果的に区別するために利用できるか?
  • RQ2ノイズの定常性や無声部に依存する仮定に基づく従来の非教師ありノイズ除去アルゴリズムよりも、訓練の不安定性に着目した非教師あり手法が優れているか?
  • RQ3クリアな学習データにアクセスできない状況でも、このような手法が教師あり最先端モデルと同等の性能を達成できるか?
  • RQ4従来の非教師あり手法が失敗する非定常ノイズ環境下で、本手法の性能はいかがであるか?

主な発見

  • 本手法は、CSIG、CBAK、COVL、PESQ、SSNRの全指標において、MMSE-LSAを除きほとんどの非教師ありベースラインを上回る。CSIGおよびSSNRにおいてはMMSE-LSAに次ぐ2位の成績を示す。
  • 沈黙をトリミングした後など、無声部が存在しない状況では、本手法はMMSE-LSAを著しく上回り、ヒューリスティックな仮定に強く依存しない堅牢性を示す。
  • クリアな学習データが一切ないにもかかわらず、本手法は教師ありSEGANモデルと同等の性能を達成する。
  • DAP [18] よりも大きく性能を上回り、特にSNRが中程度以上の場合にDAPのハーモニック畳み込みがガウスノイズに類似したアーティファクトを引き起こすためである。
  • 訓練中における複数のネットワーク出力の平均化は、画像DIPとは異なり結果の向上に寄与しない。これは、音声信号と画像信号の挙動に根本的な違いがあることを示唆する。
  • 本手法の性能は安定的かつ汎用的であり、クリップ端のサイレントや無声部といった信号構造の仮定に依存しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。