Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Channel Target Speaker Extraction with Refinement: The WavLab Submission to the Second Clarity Enhancement Challenge

Samuele Cornell, Zhong-Qiu Wang|arXiv (Cornell University)|Feb 15, 2023
Speech and Audio Processing被引用数 5
ひとこと要約

本論文は、騒音が強く混らわせられた環境における補聴器向けに、iNeuBeフレームワークを拡張した新規のマルチチャネルターゲット話者抽出システムiNeuBe-Xを提案する。因果的で話者に条件づけられたMISO-TF-GridNetと、聴取者の聴力検査結果に配慮したファインチューニングステップを備える。本手法はCEC2開発セットにおいて0.942のHASPIスコアを達成し、厳密な5 msの遅延制約下でも最先端の性能を示した。

ABSTRACT

This paper describes our submission to the Second Clarity Enhancement Challenge (CEC2), which consists of target speech enhancement for hearing-aid (HA) devices in noisy-reverberant environments with multiple interferers such as music and competing speakers. Our approach builds upon the powerful iterative neural/beamforming enhancement (iNeuBe) framework introduced in our recent work, and this paper extends it for target speaker extraction. We therefore name the proposed approach as iNeuBe-X, where the X stands for extraction. To address the challenges encountered in the CEC2 setting, we introduce four major novelties: (1) we extend the state-of-the-art TF-GridNet model, originally designed for monaural speaker separation, for multi-channel, causal speech enhancement, and large improvements are observed by replacing the TCNDenseNet used in iNeuBe with this new architecture; (2) we leverage a recent dual window size approach with future-frame prediction to ensure that iNueBe-X satisfies the 5 ms constraint on algorithmic latency required by CEC2; (3) we introduce a novel speaker-conditioning branch for TF-GridNet to achieve target speaker extraction; (4) we propose a fine-tuning step, where we compute an additional loss with respect to the target speaker signal compensated with the listener audiogram. Without using external data, on the official development set our best model reaches a hearing-aid speech perception index (HASPI) score of 0.942 and a scale-invariant signal-to-distortion ratio improvement (SI-SDRi) of 18.8 dB. These results are promising given the fact that the CEC2 data is extremely challenging (e.g., on the development set the mixture SI-SDR is -12.3 dB). A demo of our submitted system is available at WAVLab CEC2 demo.

研究の動機と目的

  • 補聴器アプリケーションに一般的な複数話者、騒音が強く混らわせられた環境におけるターゲット話者抽出の課題に対処すること。
  • リアルタイム補聴器デプロイメントに適した低遅延(≤5 ms)システムの開発。
  • 聴取者固有の聴力検査結果をモデル学習に組み込むことで、聴覚障害者における音声の聞き取りやすさを向上させること。
  • iNeuBeフレームワークを拡張し、話者に条件づけられたディープラーニングを用いた話者抽出を可能とすること。
  • 外部データを用いず、耐障害性とリアルタイム実行可能性に焦点を当て、CEC2チャレンジで高い性能を達成すること。

提案手法

  • ターゲット話者抽出のための話者登録埋め込み条件付きの2段階DNNベースのシステムiNeuBe-Xを提案する。
  • 因果的自己注意、単方向LSTM、層正則化を用いて非因果的TF-GridNetを変更し、因果的でフレームオンラインなMISO-TF-GridNetを実装する。
  • DNN段階間で因果的マルチチャネルウィーナーフィルタ(MCWF)を統合し、低遅延のアルゴリズム的遅延を維持する。
  • FiLMモジュールを介して話者埋め込みをMISO-TF-GridNetに条件づけることで、ターゲット話者固有の強化を可能にする。
  • 2段階のトレーニング戦略を採用:まず話者埋め込みを用いてDNN 1を学習し、次に多解像度STFTマグニチュード損失を用いてDNN 2をファインチューニングする。
  • NAL-R適合とダイナミックレンジ圧縮を用いた聴取者適応型ファインチューニングステップを導入し、HASPIの向上を図る。

実験結果

リサーチクエスチョン

  • RQ1因果的で低遅延のマルチチャネル音声強調システムは、複雑で騒音の強い環境でも高品質なターゲット話者抽出を達成できるか?
  • RQ2埋め込みを用いた話者に条件づけられた学習は、複数話者・リバーブ環境下でのターゲット音声抽出をどのように改善するか?
  • RQ3トレーニング段階で聴取者固有の聴力検査結果を組み込むことで、HASPIで測定される音声の主観的品質はどの程度向上するか?
  • RQ4逐次ビームフォーミングとポストフィルタリングの組み合わせは、単一段階の強調を上回る性能向上をもたらすか?
  • RQ5非因果的最先端分離モデル(TF-GridNet)は、リアルタイムで因果的マルチチャネル処理に効果的に適応可能か?

主な発見

  • 提案されたiNeuBe-Xシステムは、CEC2開発セットにおいて0.942のHASPIスコアを達成し、チャレンジベースライン(0.245)を大きく上回り、オラクルミックス(0.998)に近い性能を示した。
  • 聴取者聴力検査結果に配慮したファインチューニングを追加したことで、SI-SDRiが18.082 dBから19.082 dBに向上し、パーソナライズド補正の有効性が裏付けられた。
  • 単方向LSTMとマスク付き自己注意を備えた因果的MISO-TF-GridNetの使用により、わずか4 msのアルゴリズム的遅延でフレームオンライン処理が可能となった。
  • システムは5 msの遅延制約を満たしており、公開の遅延検証コードにより確認されたため、リアルタイム補聴器デプロイメントに適している。
  • NAL-R適合によるファインチューニングによりHASPIが0.015向上し、聴取者固有の適応が主観的品質の向上に顕著に寄与することが示された。
  • DNN 2とNAL-Rファインチューニング後、STOIは0.947、PESQは2.269を達成し、高い音声品質と聞き取りやすさを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。