Skip to main content
QUICK REVIEW

[論文レビュー] Fast FullSubNet: Accelerate Full-band and Sub-band Fusion Model for Single-channel Speech Enhancement

Xiang Hao, Xiaofei Li|arXiv (Cornell University)|Dec 18, 2022
Speech and Audio Processing被引用数 5
ひとこと要約

本稿では、メル周波数ドメインで音声を処理し、帯域別特徴量に時間ドメインでのダウンサンプリングを適用することで、FullSubNetの処理を高速化する計算効率の高いアーキテクチャ、Fast FullSubNetを提案する。周波数帯域を257から64に削減し、帯域別特徴量の時間系列を2倍にダウンサンプリングすることで、Fast FullSubNetはFullSubNetの計算複雑度の13%、処理時間の16%にまで低減したが、DNS Challengeデータセット上での音声強調性能は維持または向上させた。

ABSTRACT

FullSubNet is our recently proposed real-time single-channel speech enhancement network that achieves outstanding performance on the Deep Noise Suppression (DNS) Challenge dataset. A number of variants of FullSubNet have been proposed, but they all focus on the structure design towards better performance and are rarely concerned with computational efficiency. For many speech enhancement applications, a key feature is that system runs on a real-time, latency-sensitive, battery-powered platform, which strictly limits the algorithm latency and computational complexity. In this work, we propose a new architecture named Fast FullSubNet dedicated to accelerating the computation of FullSubNet. Specifically, Fast FullSubNet processes sub-band speech spectra in the mel-frequency domain by using cascaded linear-to-mel full-band, sub-band, and mel-to-linear full-band models such that frequencies involved in the sub-band computation are vastly reduced. After that, a down-sampling operation is proposed for the sub-band input sequence to further reduce the computational complexity along the time axis. Experimental results show that, compared to FullSubNet, Fast FullSubNet has only 13\% computational complexity and 16\% processing time, and achieves comparable or even better performance. Code and audio samples are available at https://github.com/Audio-WestlakeU/FullSubNet.

研究の動機と目的

  • リアルタイムで遅延に敏感なバッテリー駆動アプリケーションにおいて、繰り返し発生する帯域別モデル推論による高コストな計算負荷を軽減すること。
  • 特にフルバンドおよび帯域別融合モデルにおいて、音声強調性能を損なわずに計算複雑度を低減すること。
  • 周波数帯域をメル周波数ドメインで処理することで、スペクトル情報をコンactに表現しつつも、知覚的品質を保持できるかを検証すること。
  • 他のFullSubNetバリアントや融合ベースの音声強調モデルに適用可能な柔軟で即座に統合可能な高速化フレームワークを設計すること。

提案手法

  • 周波数帯域を257から64に削減できるように、線形周波数STFT特徴量をメル周波数ドメインに変換することで、よりコンactな処理を可能にする。
  • 3段階のモデルを段階的に接続する:メル周波数ドメインでのフルバンドモデル、低周波数メルビンで動作する帯域別モデル、スペクトル再構成のためのメルから線形への変換モデル。
  • 帯域別特徴量の時間系列に対して時間ドメインでのダウンサンプリング(因子m=2)を適用し、時間的複雑度を低減。その後、メルから線形への変換モデルにより補間処理を実施。
  • 全モデルに一方向LSTM(隠れユニット数384~512)を採用し、DNS Challengeデータセット上でT=192フレーム(3秒)のMSE損失を用いて学習。
  • ダウンサンプリングされた帯域別出力を補間可能にするために、メルから線形への変換モデルを後処理として活用し、フルバンドスペクトルの効率的再構成を実現。
  • 帯域別モデリングにおける隣接周波数の数Nを5に設定し、局所的なスペクトル的文脈と計算負荷の両立を図る。

実験結果

リサーチクエスチョン

  • RQ1メル周波数ドメインで処理することで、音声強調性能に悪影響を与えることなく周波数帯域数を著しく削減できるか?
  • RQ2メルから線形への再構成モデルと組み合わせた場合、帯域別特徴量の時間ドメインでのダウンサンプリングが、有効な音声強調に十分な情報を保持しているか?
  • RQ3フルバンドおよび帯域別融合モデル(例:FullSubNet)において、計算複雑度と推論遅延をどの程度低減できるか?
  • RQ4性能指標と効率性の両面で、Fast FullSubNetはSOTA手法と比較してどの程度優れているか?

主な発見

  • ダウンサンプリング因子m=2のFast FullSubNetは、計算複雑度をFullSubNetの13%、推論時間を16%にまで低減したが、性能は維持または向上した。
  • m=1(時間ドメインでのダウンサンプリングなし)の場合、MACsは25%、RTFは29%にまで低減し、PESQ、STOI、SI-SDRスコアは同等または向上した。
  • メル周波数表現の使用により、線形周波数のフルバンドモデルよりも性能が向上した。これは、よりコンactかつ知覚的に関連性の高いスペクトル表現が得られているためと推測される。
  • m=2での帯域別ダウンサンプリングは、近似的に最適なトレードオフを達成した。mを4や8に引き上げると性能が低下し、m=∞(帯域別モデルを削除)の場合もm=8と同等の結果となった。
  • 高ダウンサンプリング因子での性能低下は、見通し範囲(look-ahead context)の減少に起因する。見通しフレーム数を増やすことで、より高いダウンサンプリング因子でも性能損なわずに実現可能である。
  • Fast FullSubNetの高速化戦略は一般化可能であり、他のFullSubNetバリアントにも適用可能で、フルバンドおよび帯域別融合モデルにおける効率化の即座に統合可能なソリューションを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。