Skip to main content
QUICK REVIEW

[論文レビュー] Improving Noise Robustness In Speaker Identification Using A Two-Stage Attention Model

Yanpei Shi, Qiang Huang|arXiv (Cornell University)|Sep 24, 2019
Speech Recognition and Synthesis参考文献 37被引用数 4
ひとこと要約

本稿では、騒音環境下における話者認識のロバスト性を向上させるために、周波数と時間の順次的アテンションを適用する2段階アテンション機構を提案する。周波数ドメインで特徴を処理し、その後時間ドメインで処理することで、X-ベクトルやResNet-34といった強力なベースラインと比較して、複数のノイズタイプおよびSNRレベルで優れた性能を達成し、バブルノイズ下で0 dB SNRの条件下で最大92.0%の識別精度と4.81%のEERを達成した。

ABSTRACT

While the use of deep neural networks has significantly boosted speaker recognition performance, it is still challenging to separate speakers in poor acoustic environments. To improve robustness of speaker recognition system performance in noise, a novel two-stage attention mechanism which can be used in existing architectures such as Time Delay Neural Networks (TDNNs) and Convolutional Neural Networks (CNNs) is proposed. Noise is known to often mask important information in both time and frequency domain. The proposed mechanism allows the models to concentrate on reliable time/frequency components of the signal. The proposed approach is evaluated using the Voxceleb1 dataset, which aims at assessment of speaker recognition in real world situations. In addition three types of noise at different signal-noise-ratios (SNRs) were added for this work. The proposed mechanism is compared with three strong baselines: X-vectors, Attentive X-vector, and Resnet-34. Results on both identification and verification tasks show that the two-stage attention mechanism consistently improves upon these for all noise conditions.

研究の動機と目的

  • 騒音のある音響環境下での話者認識性能の低下という課題に対処すること。
  • 実世界のノイズ条件下における既存のディーブラーニング話者認識モデル(例:TDNN、CNN)のロバスト性を向上させること。
  • 騒音のある音声特徴における信頼性の高い時間的および周波数的成分を効果的に強調する2段階アテンション機構を設計すること。
  • アテンションの順序(周波数→時間対時間→周波数)および並列型対直列型構成のモデル性能への影響を調査すること。
  • 複数のノイズタイプおよびSNRレベルにおいて、強力なベースラインと比較して一貫した性能向上を示すこと。

提案手法

  • TDNNやCNN特徴の周波数次元に沿って自己アテンションを用いて重みを割り当てることで、最初に周波数アテンション機構を適用する。
  • 次に、学習されたアテンション層を用いてフレーム単位の重みを計算することで、時間アテンション機構を適用する。
  • 周波数→時間の順に段階的に処理することで、マルチステージフィルタリングプロセスを模倣する。
  • 直列構成(周波数→時間)を、両アテンションモジュールが独立に動作する並列アテンション設定と比較する。
  • 並列設定では、周波数アテンションと時間アテンションの寄与度を調整する学習可能な重みパラメータγを用いる。
  • AM-Softmax損失を用いたエンドツーエンド学習を維持しつつ、TDNNやResNet-34といった標準アーキテクチャに2段階アテンションモジュールを統合する。

実験結果

リサーチクエスチョン

  • RQ1単一アテンションまたはベースラインモデルと比較して、2段階アテンション機構は騒音環境下での話者認識のロバスト性を向上させるか?
  • RQ2周波数→時間(F-T)と時間→周波数(T-F)のどちらのアテンション順序が、さまざまなノイズ条件下でより優れた性能を示すか?
  • RQ3並列アテンション構成は直列構成と比較して、ノイズロバスト性および性能面でどのように異なるか?
  • RQ4周波数アテンションモジュールは時間アテンションモジュールと比較して、どの程度認識性能に寄与しているか?
  • RQ5提案されたアテンション機構は、TDNN や ResNet-34 といった既存の話者認識アーキテクチャに効果的に統合可能か?

主な発見

  • 2段階アテンションモデルは、識別および認証タスクの両方において、すべてのノイズタイプおよびSNRレベルでX-ベクトル、アテンショナルX-ベクトル、ResNet-34を上回る一貫した性能を示した。
  • 0 dB SNRのバブルノイズ下で、TDNNモデルではF-T(周波数→時間)構成がベースラインと比較して識別精度およびEERで3%の相対的改善を達成した。
  • TDNNベースのモデルでは、F-T構成が騒音条件下で元のVoxCeleb1テストセットで91.1%の識別精度と4.91%のEERを達成した。
  • CNNベースのモデルでは、同じ条件下で92.0%の識別精度と4.81%のEERを達成し、強いロバスト性を示した。
  • F-T構成はT-Fおよび並列(Para)設定をすべて上回り、TDNNではγ = 0.6、CNNではγ = 0.8の並列設定で最高の性能が観察された。
  • 結果から、周波数アテンションが時間アテンションよりも認識性能により顕著に寄与していることが示された。特に高ノイズ環境下で顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。