[論文レビュー] Residual acoustic echo suppression based on efficient multi-task convolutional neural network
本稿では、位相に敏感なマスクとダブルトーク状態の両方を同時に予測する効率的なマルチタスク畳み込みニューラルネットワーク(CNN)を用いたリアルタイム残響音声エコーキャンセレーション(RAES)手法を提案する。エコーキャンセレーションと近端音声の保持のバランスを取るために新規の抑制損失関数を導入し、40 dBを超えるERLEと優れたPESQ/STOIスコアを達成した。標準CPU上でのリアルタイム要因はわずか0.05であり、個人用デバイスへのデプロイが可能である。
Acoustic echo degrades the user experience in voice communication systems thus needs to be suppressed completely. We propose a real-time residual acoustic echo suppression (RAES) method using an efficient convolutional neural network. The double talk detector is used as an auxiliary task to improve the performance of RAES in the context of multi-task learning. The training criterion is based on a novel loss function, which we call as the suppression loss, to balance the suppression of residual echo and the distortion of near-end signals. The experimental results show that the proposed method can efficiently suppress the residual echo under different circumstances.
研究の動機と目的
- 従来のAECで非線形エコー成分が残存する場合に顕著な残響音声劣化が生じる問題に対処すること。
- AECシステムにおける従来の非線形プロセッサの主な制限であるダブルトーク期間中の近端音声歪みを低減すること。
- スマートフォンやノートPCなどのリソース制約のある個人用デバイスにデプロイ可能な計算効率の高いディープラーニングモデルを開発すること。
- マルチタスク学習フレームワークにおいてダブルトーク検出を補助タスクとして活用することで、マスク予測の精度を向上させること。
- 調整可能な抑制比αを有する新規の抑制損失関数を用いて、エコーキャンセレーションと音声品質の保持のバランスを取ること。
提案手法
- 計算コストを低減しつつ性能を維持するため、MobileNetV2を模倣したCNNアーキテクチャを採用し、ディープワイズ分離畳み込みを用いる。
- 入力特徴は、遠端信号と適応フィルタ出力誤差信号のログスペクトログラムであり、20フレームにわたって連結して時間的文脈を提供する。
- ネットワークはマルチタスク学習設定を採用:主タスクでは位相に敏感なマスク(PSM)を予測してエコーを抑制し、補助タスクでは条件付きアテンション機構を用いてダブルトーク状態を推定する。
- エコー抑制と近端信号歪みのバランスを取るために、調整可能な抑制比αを有する新規の抑制損失関数を導入する。
- 位相に敏感なマスクをターゲットとして用いることで、音声の位相情報を保持し、知覚的品質を向上させる。
- モデルはAdam最適化アルゴリズムを用いて学習し、初期学習率0.003、バッチサイズ1024で学習する。特徴量は正規化され、平方根ハニング窓を用いて窓関数処理が施される。
実験結果
リサーチクエスチョン
- RQ1マルチタスクディープラーニングフレームワークは、近端音声歪みを最小限に抑えながら、残響エコーキャンセレーション性能を向上させることができるか?
- RQ2補助タスクとしてダブルトーク検出器を統合することで、困難な音響条件下でも位相に敏感なマスク予測の精度が向上するか?
- RQ3軽量なCNNアーキテクチャは、エコーキャンセレーション性能や音声品質を損なわずに、標準的な個人用デバイスでリアルタイム性能を達成できるか?
- RQ4提案された抑制損失関数は、さまざまな信号対エコー比(SER)の条件下で、エコーキャンセレーションと近端信号保持のバランスをどの程度効果的に取れるか?
- RQ5位相に敏感なマスクは、従来の振幅マスクベースの手法に比べて、知覚的品質および話者の理解度の面でどの程度優れているか?
主な発見
- 提案されたRAES手法は、単一の遠端話者状況において40 dBを超えるERLEを達成し、エコーに音声と音楽が重複する状況でもAEC3(29.976 dB)およびDNNベース手法(31.492 dB)を大きく上回った。
- ダブルトーク状況では、α=0.5のRAESモデルが、音声のみでPESQスコア2.816、音声+音楽で2.864を達成し、AEC3(1.610および1.734)およびDNN(2.666および2.729)を上回った。
- RAES(α=0.5)のSTOIスコアは、0 dB SER条件下で音声のみで0.875、音声+音楽で0.872となり、AEC3(0.623および0.641)およびDNN(0.856および0.848)を大幅に上回った。
- 2.5 GHz x86_64 CPU上でのリアルタイム要因はわずか0.05であり、DNNモデルの0.89に比べて、個人用デバイスへのリアルタイムデプロイに非常に適している。
- ダブルトーク検出器は、訓練データで93.0%、検証データで90.3%のF1スコアを達成し、信頼性の高い検出性能を示しており、ダブルトーク時における正確なマスク予測を支援している。
- 抑制比αによりトレードオフを調整可能である:α=0.5ではより強いエコーキャンセレーションが得られるがやや高い歪みを伴い、α=1.0ではより優れた音声品質が得られるが抑制効果はわずかに低下する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。