Skip to main content
QUICK REVIEW

[論文レビュー] Deep model with built-in cross-attention alignment for acoustic echo cancellation

Evgenii Indenbom, Nicolae-Cătălin Ristea|arXiv (Cornell University)|Aug 24, 2022
Speech and Audio Processing被引用数 7
ひとこと要約

本論文は、外部の遅延推定を必要とせず、ネットワークアーキテクチャ内にクロスアテンションベースのアライメントを直接統合するリアルタイムのディーブラーニングモデル、Align-CRUSEを提案する。このモデルはAECチャレンジデータセットにおいて最先端の性能を達成し、ハードディレイケースではERLEを最大7 dB向上、AECMOSを0.24向上させる。また、Microsoft Teamsにおけるリアルタイム配備に適した低遅延・低計算コストを維持している。

ABSTRACT

With recent research advances, deep learning models have become an attractive choice for acoustic echo cancellation (AEC) in real-time teleconferencing applications. Since acoustic echo is one of the major sources of poor audio quality, a wide variety of deep models have been proposed. However, an important but often omitted requirement for good echo cancellation quality is the synchronization of the microphone and far end signals. Typically implemented using classical algorithms based on cross-correlation, the alignment module is a separate functional block with known design limitations. In our work we propose a deep learning architecture with built-in self-attention based alignment, which is able to handle unaligned inputs, improving echo cancellation performance while simplifying the communication pipeline. Moreover, we show that our approach achieves significant improvements for difficult delay estimation cases on real recordings from AEC Challenge data set.

研究の動機と目的

  • リアルタイムAECシステムにおけるマイク信号とフェアエンド信号の間の信号ミスアライメントという重要な課題に対処すること。これはエコーキャンセレーション性能を低下させる。
  • 動的環境下で誤差が多く発生し、計算コストが高いため、信頼性が低い外部古典的手法(例:相互相関)に依存しないようにすること。
  • 変動および長い遅延を特徴とするエコーキャンセレーションを、エンドツーエンドのソフトアライメントにより特徴空間で内蔵的に処理できる、低複雑性のリアルタイムディーブラーニングアーキテクチャを開発すること。
  • 長時間遅延、非線形エコーパス、ダブルトークなどの困難な状況下でもAEC性能を向上させつつ、推論遅延を低く保つこと。
  • Microsoft Teamsのような大規模生産システムにおける実用的配備を可能とすること。ここでは、数百万のユーザーにとって、耐障害性と低遅延が不可欠である。

提案手法

  • U-Netベースのエンコーダーデコーダーアーキテクチャに、CRUSEと同様の再帰的ブロックをボトルネック部に設け、それに加えて内蔵されたクロスアテンションモジュールを導入してアライメントを実現する。
  • クロスアテンション機構は、マイク信号とフェアエンド信号の時間周波数特徴量間のソフトアライメントを計算し、複数の時間ラグにわたる遅延分布を学習する。
  • 信号レベルの相互相関に依存するのではなく、深層特徴空間でアライメントを実行することで、非線形的かつ時間変動するエコーパスに対応可能になる。
  • マイク特徴量をクエリとして用い、フェアエンド特徴量に対するアテンションを計算し、信号を動的にアライメントする重み付きコンテキストを生成する。
  • エコーキャンセレーションを最適化する損失関数を用いてエンドツーエンドで学習し、AECMOSとERLEを主な評価指標とする。
  • 20msのハニング窓と10msのホップを用いることで、CPU上でリアルタイム推論が可能な20msのアルゴリズム遅延を維持している。

実験結果

リサーチクエスチョン

  • RQ1ディーブラーニングモデルは、外部の信号アライメントモジュールに依存せずに、強力なエコーキャンセレーションを達成できるか?
  • RQ2特徴空間におけるエンドツーエンドのクロスアテンションベースのアライメントは、古典的手法(相互相関)と比較して、エコーキャンセレーション性能と遅延推定誤差への耐性において優れているか?
  • RQ3内蔵されたアライメントは、長時間遅延や変動遅延といった困難な遅延状況下で、どの程度性能を向上させるか?
  • RQ4統合されたアライメントを備えたモデルは、大規模システムにおけるリアルタイム配備に適した低推論遅延と低計算複雑性を維持できるか?
  • RQ5ダブルトーク状況下での性能は、最先端のAECソリューションと比較してどうか?

主な発見

  • FEST-HDサブセット(困難な遅延推定ケースを含む)において、リアルタイムアライメント済みCRUSEベースラインと比較して、ERLEで7.22 dB、AECMOSで0.24向上を達成した。
  • 合成された長遅延データセット(LD-MおよびLD-H)では、グローバルアライメント済みCRUSE‡‡ベースラインを最大0.6 AECMOSおよび7 dBのERLE向上で上回った。
  • 推論時間はほぼ同一(≈2.5 ms/フレーム)であり、ベースCRUSEモデルと比較して追加パラメータはたった0.01Mにとどまり、低遅延のリアルタイム動作を確保している。
  • ダブルトークおよびFEST MOS評価では、CRUSE‡ベースラインを著しく上回り、AECチャレンジ優勝者と比較しても競争力のある結果を達成したが、5–7倍も高速であった。
  • Microsoft Teamsに正常に配備され、毎日の何百万もの通話において音声品質が向上した。これは、実世界でのスケーラビリティと耐障害性を示している。
  • アテンションマップの可視化により、モデルが意味のある遅延分布を学習し、複雑でノイズの多い、またはアライメントがずれた状況下でも信号を効果的にアライメントしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。