Skip to main content
QUICK REVIEW

[論文レビュー] ICASSP 2021 Deep Noise Suppression Challenge: Decoupling Magnitude and Phase Optimization with a Two-Stage Deep Network

Andong Li, Wenzhe Liu|arXiv (Cornell University)|Feb 8, 2021
Speech and Audio Processing参考文献 32被引用数 8
ひとこと要約

本論文は、マグニチュードと位相最適化を分離する2段階のディーブニューラルネットワーク、TSCN-PPを提案し、リアルタイム音声強調を実現する。まず粗いマグニチュード推定を行い、次に2段階目でマグニチュードと位相の両方を精緻化した後、残存ノイズを抑制する軽量なポストプロセッシングモジュールを適用する。この手法は、ICASSP 2021 DNSチャレンジのリアルタイムトラックで3.38のMOSスコア(ITU-T P.808基準)を達成し、主観的品質が顕著に向上したが、客観的指標はわずかに劣化した。

ABSTRACT

It remains a tough challenge to recover the speech signals contaminated by various noises under real acoustic environments. To this end, we propose a novel system for denoising in the complicated applications, which is mainly comprised of two pipelines, namely a two-stage network and a post-processing module. The first pipeline is proposed to decouple the optimization problem w:r:t: magnitude and phase, i.e., only the magnitude is estimated in the first stage and both of them are further refined in the second stage. The second pipeline aims to further suppress the remaining unnatural distorted noise, which is demonstrated to sufficiently improve the subjective quality. In the ICASSP 2021 Deep Noise Suppression (DNS) Challenge, our submitted system ranked top-1 for the real-time track 1 in terms of Mean Opinion Score (MOS) with ITU-T P.808 framework.

研究の動機と目的

  • 多様なノイズタイプとリバーブを含む複雑な現実世界の音響環境における音声強調の課題に対処すること。
  • 特に低SNRおよび非理想状態下で、客観的指標だけでは捉えきれない主観的音声品質を向上させること。
  • トレーニングデータとテスト条件が一致しない場合に、非線形歪みに対処できない単一段階ネットワークの限界を克服すること。
  • 補聴器、ASR、通信システムへの適用に適したリアルタイムで低レイテンシのシステムを開発すること。
  • ポストプロセッシングが、客観的スコアがわずかに低下しても、主観的品質を向上させられることを検証すること。

提案手法

  • システムは2段階のネットワークを用いる:まず、ノイズ混在入力からスペクトルマグニチュードを粗く推定するための粗いマグニチュード推定ネットワーク(CME-Net)を実装する。
  • 次に、ノイズスペクトルと粗い推定値の両方を入力として受け取り、マグニチュードと位相を同時に精緻化する複素スペクトル精緻化ネットワーク(CSR-Net)を適用する。
  • CSR-Netは、粗い推定値とクリアなターゲットの差分のみを予測する残差学習を採用することで、安定性と精度を向上させる。
  • 2段階のネットワークの後に、不自然な残存ノイズ成分を抑制するための軽量なポストプロセッシング(PP)モジュールを適用する。
  • PPモジュールは、標準的指標では捉えきれないが、聴取者に不快に感じられる非音声的歪みに焦点を当てることで、主観的品質を向上させるように設計されている。
  • マグニチュードと位相の同時最適化を可能にするために、実部と虚部を用いた複素スペクトルドメインでモデルをトレーニングする。

実験結果

リサーチクエスチョン

  • RQ1マグニチュードと位相最適化を分離することで、複雑な現実世界の環境下での音声強調性能が向上するか?
  • RQ22段階ネットワークアーキテクチャは、困難なノイズとリバーブに対処する上で、単一段階モデルを上回るか?
  • RQ3軽量なポストプロセッシングモジュールは、客観的指標がわずかに低下しても、主観的音声品質を顕著に向上させられるか?
  • RQ4位相精緻化は、マグニチュードのみの推定を上回る主観的品質向上にどの程度寄与するか?
  • RQ5歌唱、トーナル、感情表現のあるようなレアまたは困難な発話タイプにおいて、システムの性能はいかがなっているか?

主な発見

  • TSCN-PPシステムは、ICASSP 2021 DNSチャレンジのリアルタイムトラックで平均意見評価(MOS)3.38を達成し、主観的品質でトップ1となった。
  • 最先端のベースラインDCCRNと比較して、テストセット全体で平均してPESQが0.14向上、ESTOIが1.77%向上した。
  • ABテストにおいて、ポストプロセッシングモジュールは一貫して主観的好みを向上させ、100%の被験者がTSCN-PPをTSCN単体よりも好んだ。
  • ポストプロセッシング後は客観的指標(PESQとESTOI)がわずかに低下したが、MOSスコアは上昇したため、客観的と主観的品質のギャップが示された。
  • アルゴリズム遅延は30ms(20msフレーム + 10msオーバーラップ)であり、リアルタイムのレイテンシ制約を満たしており、1フレームあたりの平均処理時間は4.80msであった。
  • ベースラインNSnet2と比較して、全体で0.17MOSポイントの向上を達成し、特に歌唱(3.14 vs. 3.10)や非英語話法(3.50 vs. 3.28)といった困難な状況でも顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。