Skip to main content
QUICK REVIEW

[論文レビュー] Joint Echo Cancellation and Noise Suppression based on Cascaded Magnitude and Complex Mask Estimation

Xiaofeng Shu, Yehang Zhu|arXiv (Cornell University)|Jul 20, 2021
Speech and Audio Processing参考文献 26被引用数 9
ひとこと要約

本論文は、音声エコーキャンセレーション(AEC)とノイズ抑制(NS)を統合して処理するための段階的マグニチュードおよび複素時系列畳み込みニューラルネットワーク(MC-TCN)を提案する。マグニチュードマスク推定に続いて複素比マスク(CRM)推定を実行することで、マグニチュードと位相の両方を向上させる。この手法は、INTERSPEECH2021 AECチャレンジのブレインドテストセットにおいて4.41のDECMOSスコアを達成し、ベースラインより0.54ポイント優れている。

ABSTRACT

Acoustic echo and background noise can seriously degrade the intelligibility of speech. In practice, echo and noise suppression are usually treated as two separated tasks and can be removed with various digital signal processing (DSP) and deep learning techniques. In this paper, we propose a new cascaded model, magnitude and complex temporal convolutional neural network (MC-TCN), to jointly perform acoustic echo cancellation and noise suppression with the help of adaptive filters. The MC-TCN cascades two separation cores, which are used to extract robust magnitude spectra feature and to enhance magnitude and phase simultaneously. Experimental results reveal that the proposed method can achieve superior performance by removing both echo and noise in real-time. In terms of DECMOS, the subjective test shows our method achieves a mean score of 4.41 and outperforms the INTERSPEECH2021 AEC-Challenge baseline by 0.54.

研究の動機と目的

  • リアルタイムのシナリオにおいて、エコーとノイズが同時に発生する状況で、分離されたAECおよびNS処理の限界を克服すること。
  • 深層学習を用いてエコーとノイズ抑制を統合的にモデル化することで、音声品質および聞き取りやすさを向上させること。
  • 既存手法を上回る性能を発揮する、軽量で並列処理可能なアーキテクチャを構築すること。
  • 音声歪みと残響を低減しつつ、リアルタイム推論能力を維持すること。

提案手法

  • MC-TCNモデルは2段階の段階的アーキテクチャを採用:最初の段階ではマグニチュードTCNが入力スペクトログラムからマグニチュードマスクを推定する。
  • 推定されたマグニチュードマスクは元の位相と組み合わせられ、2段階目のための複素数入力を形成する。
  • 2段階目では、複素数値TCNを用いて複素比マスク(CRM)を推定し、マグニチュードと位相の両方を同時に強化する。
  • 拡張畳み込みを用いた時系列畳み込みネットワーク(TCN)により、受容野を拡大し、長距離依存関係を効率的にモデル化する。
  • 信号近似を最適化する損失関数を用いて、エンド・トゥ・エンドで学習を実施し、頑健な特徴抽出を可能にする。
  • リアルタイムでのエコー経路推定とキャンセレーションを実現するため、システムにアダプティブフィルタを導入している。

実験結果

リサーチクエスチョン

  • RQ1段階的ディーブラーニングアーキテクチャは、分離処理パイプラインよりもエコーとノイズの両方をより効果的に抑制できるか?
  • RQ2マグニチュードマスク推定に続いて複素マスク推定を実行することで、音声強調性能がどのように向上するか?
  • RQ3TCNベースのモデルは、LSTMのような再帰的ネットワークに比べて、リアルタイムAECおよびNSタスクでどの程度優れた性能を発揮できるか?
  • RQ4モデルの深さ(ブロック数)が音声品質およびエコー抑制に与える影響はどの程度か?
  • RQ5近端および遠端音声が同時に発生するダブルトーク条件では、本手法はどの程度の性能を示すか?

主な発見

  • 提案されたMC-TCNモデルは、INTERSPEECH2021 AEC-Challengeのブレインドテストセットにおいて4.41のDECMOSスコアを達成し、全体で3位となった。
  • ベースラインより0.54 DECMOSポイント優れており、主観的音声品質の顕著な向上を示している。
  • ダブルトーク状況では、劣化音声のDECMOSが3.286、エコーMOSが3.968を記録し、高い耐障害性を示した。
  • 20ブロック(B=20)のモデルが、エコー抑制と音声品質の両面で最良のバランスを達成し、B=10およびB=15の設定を上回った。
  • MacBook Pro上での推論時間は1フレームあたり0.7460msであり、リアルタイム適用の可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。