Skip to main content
QUICK REVIEW

[論文レビュー] RTF-steered binaural MVDR beamforming incorporating multiple external microphones

Nico Gößling, Wiebke Middelberg|arXiv (Cornell University)|Aug 13, 2019
Speech and Audio Processing参考文献 18被引用数 5
ひとこと要約

本稿では、外部マイクロホンから得られる複数のRTF推定値を3つの統合戦略(入力SNR選択、平均化、出力SNR最大化)を用いて統合する、新たなRTF駆動型バイノラルMVDR beamforming手法を提案する。出力SNR最大化の組み合わせが最先端手法を上回り、動く話者のいる混雑な室内環境におけるバイノラルSNRを10.7 dB向上させる。

ABSTRACT

The binaural minimum-variance distortionless-response (BMVDR) beamformer is a well-known noise reduction algorithm that can be steered using the relative transfer function (RTF) vector of the desired speech source. Exploiting the availability of an external microphone that is spatially separated from the head-mounted microphones, an efficient method has been recently proposed to estimate the RTF vector in a diffuse noise field. When multiple external microphones are available, different RTF vector estimates can be obtained by using this method for each external microphone. In this paper, we propose several procedures to combine these RTF vector estimates, either by selecting the estimate corresponding to the highest input SNR, by averaging the estimates or by combining the estimates in order to maximize the output SNR of the BMVDR beamformer. Experimental results for a moving speaker and diffuse noise in a reverberant environment show that the output SNR-maximizing combination yields the largest binaural SNR improvement and also outperforms the state-of-the art covariance whitening method.

研究の動機と目的

  • 補聴器におけるバイノラルノイズ低減を向上させるために、空間的に分離された複数の外部マイクロホンを活用すること。
  • 異なる外部マイクロホンから得られる複数のRTFベクトル推定値を統合する課題に対処すること。
  • 動的で混雑した環境におけるビームフォーマ性能を向上させるための統合戦略を開発・評価すること。
  • 共分散ホワイトニング法など既存手法を上回るバイノラルSNR向上を達成すること。

提案手法

  • 拡散ノイズの仮定の下、空間コherエンス(SC)法を用いて各外部マイクロホンの相対伝達関数(RTF)ベクトルを推定する。
  • 3つの統合戦略を適用する:入力SNRが最も高い外部マイクロホンからのRTF推定値を選択する、すべての推定値を平均化する、出力SNRを最大化するように線形結合する。
  • MVDRビームフォーマの重みを、統合RTFベクトルとノイズ共分散行列に基づいて計算する狭帯域ビームフォーミング定式化を用いる。
  • 入力およびノイズ共分散行列を再帰的に推定し、それぞれ時間定数250 msおよび1.5 sを設定する。
  • 時間領域におけるバイノラルSNR向上を評価するためにシャドウフィルタ法を採用する。
  • 時間および周波数平均のバイノラルSNR向上指標を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1複数の外部マイクロホンから得られる複数のRTF推定値を統合することで、単一推定値手法と比較してバイノラルMVDRビームフォーミング性能が向上するか?
  • RQ2入力SNR選択、平均化、出力SNR最大化のうち、どのRTFベクトル統合戦略が最も優れたバイノラルSNR向上を達成するか?
  • RQ3提案手法の出力SNR最大化組み合わせは、動的で混雑した環境において最先端の共分散ホワイトニング法を上回るか?
  • RQ4移動する話者の状況において、提案手法の性能は時間経過とともにどのように変化するか?

主な発見

  • 出力SNR最大化の組み合わせ(mSNR)は、10.7 dBのバイノラルSNR向上を達成し、最先端の共分散ホワイトニング法(10.4 dB)を顕著に上回った。
  • 入力SNRに基づく選択(iSNR)法は10.3 dBを達成し、共分散ホワイトニング法とほぼ同等の性能を示したが、計算複雑度は低かった。
  • 平均化(AV)法は僅か8.9 dBにとどまり、外部マイクロホン間での推定誤差の不一致が原因で性能が劣化することが示された。
  • 時間領域におけるSNR向上曲線から、mSNR組み合わせはiSNRおよびAVの両方をすべての時間点で上回った。
  • mSNR法はiSNR法よりも0.5 dBのSNR向上を達成しており、RTF統合におけるSNRベース最適化の有効性を示した。
  • mSNR法は3次元の固有値分解のみを必要とし、優れた性能にもかかわらず計算効率が非常に高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。