Skip to main content
QUICK REVIEW

[論文レビュー] NeuralEcho: A Self-Attentive Recurrent Neural Network For Unified Acoustic Echo Suppression And Speech Enhancement

Meng Yu, Yong Xu|arXiv (Cornell University)|May 20, 2022
Speech and Audio Processing被引用数 5
ひとこと要約

NeuralEchoは、クロスチャネルの2次統計とマルチヘッドアテンションを活用してエコー、ノイズ、ターゲット音声のダイナミクスをモデル化する自己注意型再帰ニューラルネットワークを提案する。エコー抑制と音声強調を統合することで、音声品質、認識精度、モデル効率の面で最先端の性能を達成し、F-T-LSTMを上回る9.1%の相対的WER低減と13.7%のSI-SDR向上を達成しながら、より小型のモデルを用いている。

ABSTRACT

Acoustic echo cancellation (AEC) plays an important role in the full-duplex speech communication as well as the front-end speech enhancement for recognition in the conditions when the loudspeaker plays back. In this paper, we present an all-deep-learning framework that implicitly estimates the second order statistics of echo/noise and target speech, and jointly solves echo and noise suppression through an attention based recurrent neural network. The proposed model outperforms the state-of-the-art joint echo cancellation and speech enhancement method F-T-LSTM in terms of objective speech quality metrics, speech recognition accuracy and model complexity. We show that this model can work with speaker embedding for better target speech enhancement and furthermore develop a branch for automatic gain control (AGC) task to form an all-in-one front-end speech enhancement system.

研究の動機と目的

  • 非線形エコー、エコーパスの変化、非定常ノイズに対処する伝統的な適応フィルタリングおよびハイブリッドAECシステムの限界を克服すること。
  • 音声エコーキャンセリング(AEC)と音声強調を1つのディープラーニングフレームワークに統合し、耐障害性とエンドツーエンド最適化を向上させること。
  • 同じモデル内で自動利得制御(AGC)とターゲット発話者強調を共同で学習することで、音声認識精度を向上させること。
  • マイク、AEC出力、エコー推定チャネルの間の2次統計を活用して、エコー/ノイズ抑制とターゲット音声の保持を強化すること。
  • 発話者埋め込みとAGCを条件付き入力として統合し、リアルタイム通信におけるターゲット発話者分離と出力音量の一貫性を向上させること。

提案手法

  • 2段階のエンドツーエンドモデルを提案:まずエコーとAEC出力を推定し、その後、エコー/ノイズとターゲット音声の推定2次統計(共分散行列)を用いて音声強調フィルタを予測する。
  • 時間軸にわたるマルチヘッドアテンションを備えた自己注意型RNNを採用し、エコー推定、AEC出力、マイク入力チャネルの関連特徴を動的に強調する。
  • 特徴別線形調制(FiLM)を用いて発話者埋め込みベクトルをネットワークに条件付け、干渉信号からのターゲット音声分離を向上させる。
  • 前AGCおよび後AGC出力を同時に予測するAGCブランチの共同学習スキームを導入し、増幅信号の高弁別性と低歪みを保証する。
  • 入力信号を周波数領域に変換し、時間周波数ダイナミクスをモデル化するための学習可能フィルタを適用する。アテンション機構により時間的依存性を強化する。
  • クリアなターゲット音声に対する教師あり損失を用いてエンドツーエンドで学習し、AEC、強調、AGCの目的関数を統合最適化する。

実験結果

リサーチクエスチョン

  • RQ1既存のハイブリッドまたは2段階手法と比較して、統合的ディープラーニングフレームワークは、音声エコーと背景ノイズの抑制をより効果的に行えるか?
  • RQ2複数の信号チャネルにおける2次統計をモデル化することで、エコーおよびノイズ抑制性能がどのように向上するか?
  • RQ3発話者埋め込みを統合することで、ノイズが多くエコーのある環境下でのターゲット音声分離はどの程度向上するか?
  • RQ4メイン強調ネットワークとAGCを共同で学習することで、後処理によるAGCよりも音声認識性能が向上するか?
  • RQ5自己注意型RNNアーキテクチャは、標準的なRNNやLSTMに比べ、エコーおよびノイズの複雑な時間的ダイナミクスをより効果的に捉えることができるか?

主な発見

  • NeuralEchoは、F-T-LSTMを上回り、SI-SDRで13.7%の相対的向上、PESQで3.5%、WERで9.1%の改善を達成したが、モデルサイズはより小さい。
  • 発話者に特化したバージョンのNeuralEchoは、SI-SDR 11.98 dB、PESQ 2.99、WER 14.06%を達成し、ターゲット音声分離が向上した。
  • 統合されたAGCブランチを備えたNeuralEchoモデルは、後AGC出力で最良のWER 13.63%を達成し、F-T-LSTMと比較して16.8%の相対的低減を示した。
  • NeuralEchoとAGCブランチの共同学習は、後処理によるAGC(WER 14.75%)やAGC処理済みデータでの学習(WER 16.53%)と比較して、WERを顕著に改善した(13.63%)。エンドツーエンド最適化の利点を裏付けた。
  • 統合モデルの前AGC出力は、最高のPESQとWER性能を達成しており、AGC統合がコアな強調品質を損なわず、認識性能を向上させることを示している。
  • AGCと発話者埋め込みを共同で学習したモデルが最高の全体的性能を達成し、リアルタイム通信システムにおける統合的フロントエンド処理の有効性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。