Skip to main content
QUICK REVIEW

[論文レビュー] DeepFilterNet2: Towards Real-Time Speech Enhancement on Embedded Devices for Full-Band Audio

Hendrik Schröter, Alberto N. Escalante-B.|arXiv (Cornell University)|May 11, 2022
Speech and Audio Processing被引用数 11
ひとこと要約

DeepFilterNet2 は、音声の調波成分の知覚的モデリングと最適化されたトレーニングを活用した軽量で二段階の音声強調フレームワークであり、フルバンド(48 kHz)音声においてリアルタイム推論を伴いながら最先端の性能を達成している。Core-i5 CPU 上ではリアルタイム要因(RTF)を 0.04 まで低減し、Raspberry Pi 4 などの組み込みデバイスへのデプロイも可能で、RTF は 0.42 である。

ABSTRACT

Deep learning-based speech enhancement has seen huge improvements and recently also expanded to full band audio (48 kHz). However, many approaches have a rather high computational complexity and require big temporal buffers for real time usage e.g. due to temporal convolutions or attention. Both make those approaches not feasible on embedded devices. This work further extends DeepFilterNet, which exploits harmonic structure of speech allowing for efficient speech enhancement (SE). Several optimizations in the training procedure, data augmentation, and network structure result in state-of-the-art SE performance while reducing the real-time factor to 0.04 on a notebook Core-i5 CPU. This makes the algorithm applicable to run on embedded devices in real-time. The DeepFilterNet framework can be obtained under an open source license.

研究の動機と目的

  • 既存のディープラーニングベースの音声強調手法、特にフルバンド音声向けに高い計算複雑性と大きな時間的バッファを抱える問題に対処する。
  • リソース制限のある組み込みデバイス(例:Raspberry Pi 4)でリアルタイム推論を可能にする。
  • モデルの複雑性と推論遅延を低く保ちながら、音声強調の性能を向上させる。
  • モデルサイズを著しく増加させずに、収束性と耐性を向上させるためのトレーニング手順とデータ拡張を最適化する。
  • 効率的で知覚的に意味のある信号処理を組み込んだ DeepFilterNet フレームワークの拡張により、音声品質と聞き取りやすさを向上させる。

提案手法

  • 二段階のアーキテクチャを採用:第一段階では、実数値のゲインを用いて圧縮された ERB(知覚的)周波数領域で音声エンvelope を強調する。
  • 第二段階では、複素スペクトル領域でディープフィルタリング(DF)を適用し、5 kHz までの周期的音声成分を再構成する。
  • 両段階に共通するエンコーダーを用いて、ERB 特徴と複素スペクトル特徴を統合された埋め込みに統合する。
  • 時間領域の再構成と組み合わせたマルチスケールスペクトログラム損失を適用し、知覚的品質と一般化性能を向上させる。
  • 反復的なトレーニング最適化を実装:学習率のウォームアップにコサイン減衰を適用し、適応的重み減衰とバッチサイズを 8 から 96 に段階的にスケジューリングする。
  • 最終的な強調信号を精緻化するためのポストフィルタを導入し、客観的および主観的指標を向上させる。
Fig. 1 : Schematic overview of the DeepFilterNet2 speech enhancement process.
Fig. 1 : Schematic overview of the DeepFilterNet2 speech enhancement process.

実験結果

リサーチクエスチョン

  • RQ1二段階の音声強調フレームワークは、フルバンド音声で最先端の性能を達成しつつ、リアルタイム組み込みデプロイに適した計算効率を維持できるか?
  • RQ2学習率のウォームアップ、コサイン減衰、バッチサイズスケジューリングといった最適化されたトレーニング手順は、収束性とモデル性能にどのように影響するか?
  • RQ3マルチスケールスペクトログラム損失は、音声強調における知覚的品質と耐性をどの程度向上させるか?
  • RQ4極めてノイジーな状況下でも、ディープフィルタリングは計算オーバーヘッドを最小限に抑えつつ、従来の複素比マスクを上回る性能を示せるか?
  • RQ5低消費電力ハードウェア(例:Raspberry Pi 4)上で達成可能なリアルタイム要因はどの程度か?また、先行する最先端手法と比較してどうか?

主な発見

  • DeepFilterNet2 は Voicebank+Demand テストセットで PESQ スコア 3.08 を達成し、FRCRN や GaGNet といった先行の最先端手法を上回り、パラメータ数はわずか 2.3M にとどまる。
  • Core-i5 CPU 上ではリアルタイム要因(RTF)が 0.04 まで低下し、標準のノートブックでも効率的なリアルタイム推論が可能になる。
  • DNS4 ブラインドテストセットでは、DNSMOS スコアが SIGMOS 4.196、BAKMOS 4.427、OVLMOS 3.882 を記録し、クリアな参照セットの品質に近づいた。
  • Raspberry Pi 4 上でもリアルタイム要因 0.42 で動作し、組み込みデプロイの可能性を実証した。
  • ポストフィルタの追加により MOS スコアがわずかに向上し、OVLMOS は 3.896 に達し、全体的な音声品質の向上を示した。
  • パラメータ数がわずかに増加(2.306M)したものの、MACS は 0.356G を維持し、トレーニングおよびアーキテクチャの最適化により DeepFilterNet(RTF 0.11 → 0.04)を著しく上回った。
Fig. 2 : Learning rate, weight decay and batch size scheduling used for training.
Fig. 2 : Learning rate, weight decay and batch size scheduling used for training.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。