Skip to main content
QUICK REVIEW

[論文レビュー] Robust Speaker Recognition Using Speech Enhancement And Attention Model

Yanpei Shi, Qiang Huang|arXiv (Cornell University)|Jan 14, 2020
Speech Recognition and Synthesis参考文献 32被引用数 8
ひとこと要約

本稿では、音声強調と話者認識を段階的アテンション機構を用いて段階的に最適化する統合フレームワークを提案する。時間、周波数、チャネルアテンションを統合した1つのエンドツーエンドトレーニング可能なモデルに音声強調と話者検証を統合することで、さまざまなノイズ環境下でも、強力なベースラインと比較してVoxCeleb1で最高1%の上昇を示す。

ABSTRACT

In this paper, a novel architecture for speaker recognition is proposed by cascading speech enhancement and speaker processing. Its aim is to improve speaker recognition performance when speech signals are corrupted by noise. Instead of individually processing speech enhancement and speaker recognition, the two modules are integrated into one framework by a joint optimisation using deep neural networks. Furthermore, to increase robustness against noise, a multi-stage attention mechanism is employed to highlight the speaker related features learned from context information in time and frequency domain. To evaluate speaker identification and verification performance of the proposed approach, we test it on the dataset of VoxCeleb1, one of mostly used benchmark datasets. Moreover, the robustness of our proposed approach is also tested on VoxCeleb1 data when being corrupted by three types of interferences, general noise, music, and babble, at different signal-to-noise ratio (SNR) levels. The obtained results show that the proposed approach using speech enhancement and multi-stage attention models outperforms two strong baselines not using them in most acoustic conditions in our experiments.

研究の動機と目的

  • ノイズによって劣化する音響条件下での話者認識の耐性を向上させること。
  • 音声強調と話者認識モジュールを別々に訓練する方法の制限を解決し、最適でない特徴学習を回避すること。
  • 音声強調と話者認識を1つのエンドツーエンドフレームワークに統合し、共同最適化を行うこと。
  • 時間、周波数、チャネル次元における話者関連情報に焦点を当てるマルチステージアテンション機構を用いて特徴学習を強化すること。
  • 実際のノイズ条件(バラバラノイズ、音楽、一般ノイズ)と変動するSNRレベル下で、標準ベンチマーク上で提案手法を評価すること。

提案手法

  • モデルは、音声強調ネットワーク(SE-Net)に続く話者識別ネットワーク(SID-Net)を有するカスケードアーキテクチャを採用し、単一の損失関数により両者を共同最適化する。
  • SE-Netは、マルチステージアテンション(MS)ブロックを用いた11層の拡張畳み込み層を採用し、スペクトログラム入力からのノイズ抑制を実現する。
  • マルチステージアテンション機構は、チャネルアテンション、周波数アテンション、時間アテンションの3つの連続ブロックから構成され、関連する特徴を段階的に強調する。
  • SID-Netは、強化されたスペクトログラムからのロバストな話者埋め込みを抽出するために、8層の残差畳み込み層とマルチステージアテンションブロックを用いる。
  • アテンションモジュールは、SE-NetおよびSID-Netの各畳み込み層の後に挿入され、関連性に基づいて特徴を動的に重みづけする。
  • 全モデルは、基本学習率1e-3、エポックごとの減衰率0.9を用いたAdam最適化アルゴリズムで訓練される。

実験結果

リサーチクエスチョン

  • RQ1音声強調と話者認識の共同最適化は、別々の訓練と比較して、ノイズ環境下での性能向上をもたらすか?
  • RQ2マルチステージアテンション機構の統合は、さまざまなノイズタイプ下での話者認識の耐性をどのように向上させるか?
  • RQ3アテンション機構の配置(音声強調モジュール内か、話者認識モジュール内か)が性能に顕著な影響を及えるか?
  • RQ4提案手法は、さまざまな信号対ノイズ比(SNR)レベルおよびバラバラノイズ、音楽、一般ノイズなどのノイズタイプにおいて、どのように性能を示すか?
  • RQ5異なるモジュールにアテンションを統合したモデル(SE-MS+SID および SE+SID-MS)を組み合わせることで、さらに認識精度が向上するか?

主な発見

  • 提案されたSE+SID-MSモデルは、すべてのノイズ条件下でベースラインのSIDモデルと比較して、話者識別においてTop-1およびTop-5精度で2–3%の絶対的向上を達成した。
  • SE-NetおよびSID-Netの両方でマルチステージアテンションを使用したことで、低SNRレベル(例:0 dB)でも1–2%の相対的向上が得られ、ノイズ耐性が向上した。
  • 話者検証において、SE-MS+SIDモデルは他の構成を上回り、特に低SNRのバラバラノイズ下で、強調モジュール内のアテンション機構が性能優位性を示した。
  • SE-MS+SIDおよびSE+SID-MSモデルの線形結合により、より良い結果が得られ、特にバラバラノイズ下ではSE-MS+SID成分が精度向上により顕著に寄与した。
  • 事前学習済み話者モデルを用いた先行手法よりも、共同最適化フレームワークが優れた性能を示し、エンドツーエンド学習の利点を裏付けた。
  • 一般ノイズ、音楽、バラバラノイズのすべてのノイズタイプにおいて一貫した向上が確認され、多様な音響劣化状況下でもモデルの耐性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。