Skip to main content
QUICK REVIEW

[論文レビュー] Attention Mechanism in Speaker Recognition: What Does It Learn in Deep Speaker Embedding?

Qiongqiong Wang, Koji Okabe|arXiv (Cornell University)|Sep 25, 2018
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本稿では、深層スプーカー埋め込みネットワーク内で学習されたアテンションメカニズムが、他のスプーカー埋め込みシステム(例:i-ベクトルや非アテンションDNN)に分離・再利用可能かどうかを調査する。アテンション重みが1つのネットワークから学習された後、他のシステムに一般化して効果的に適用できることを示しており、i-ベクトルシステムへの適用でEERが9.0%低減され、min C_primaryが3.8%低減する。さらに、ソフト音声活動検出(VAD)と組み合わせることで性能が向上する。

ABSTRACT

This paper presents an experimental study on deep speaker embedding with an attention mechanism that has been found to be a powerful representation learning technique in speaker recognition. In this framework, an attention model works as a frame selector that computes an attention weight for each frame-level feature vector, in accord with which an utterancelevel representation is produced at the pooling layer in a speaker embedding network. In general, an attention model is trained together with the speaker embedding network on a single objective function, and thus those two components are tightly bound to one another. In this paper, we consider the possibility that the attention model might be decoupled from its parent network and assist other speaker embedding networks and even conventional i-vector extractors. This possibility is demonstrated through a series of experiments on a NIST Speaker Recognition Evaluation (SRE) task, with 9.0% EER reduction and 3.8% min_Cprimary reduction when the attention weights are applied to i-vector extraction. Another experiment shows that DNN-based soft voice activity detection (VAD) can be effectively combined with the attention mechanism to yield further reduction of minCprimary by 6.6% and 1.6% in deep speaker embedding and i-vector systems, respectively.

研究の動機と目的

  • 深層スプーカー埋め込みネットワーク内で学習されたアテンションメカニズムが、他のスプーカー埋め込みシステムに分離可能かどうかを調査すること。
  • i-ベクトルや非アテンションDNNのような異なる特徴表現間でのアテンション重みの一般化能力を評価すること。
  • アテンションメカニズムとソフト音声活動検出(VAD)の相乗効果が、より優れたスプーカー認識を実現するかを検討すること。
  • アテンション重みが、元のネットワークのフレームレベル特徴に強く依存しているのか、それとも一般化されたフレーム重要性を表しているのかを特定すること。

提案手法

  • アテンション重みをフレームレベル特徴ベクトルごとに計算し、発話レベル表現の重み付き平均を算出する深層スプーカー埋め込みネットワーク内にアテンションメカニズムを訓練する。
  • 事前に学習済みのアテンションモデルを親ネットワークから分離し、非アテンションDNNやi-ベクトル抽出器からのフレームレベル特徴にそのアテンション重みを適用する。
  • プーリング層でアテンション重みを用いてフレームレベル特徴の重み付き平均を計算し、標準的な統計プーリングやi-ベクトル抽出に代えてアテンション重み付き集約を実装する。
  • アテンション重みαₜと音声ポストリアリティqₜを乗算して、より優れたフレーム選択を実現する統合重み因子を形成することで、ソフトVADとアテンション重みを統合する。
  • SRE04-10、Switchboard、Fisherデータで学習した同一のアテンションモデルを用い、カントン語やタガログ語の発話などドメイン外データへの評価にアテンション重みを生成する。
  • Kaldiの非教師ありドメイン適応を用いて、ドメイン外およびドメイン内設定の両方でPLDAを微調整し、アテンションベースのプーリングの汎用性と耐障害性を検証する。

実験結果

リサーチクエスチョン

  • RQ1深層スプーカー埋め込みネットワーク内で学習されたアテンション重みは、非アテンションスプーカー埋め込みシステム(例:i-ベクトル)に効果的に転送可能か?
  • RQ2アテンションメカニズムが学習したフレーム重要性は、元のネットワークのフレームレベル特徴に強く依存しているのか、それとも異なる特徴抽出器間で一般化可能か?
  • RQ3アテンション重みとソフト音声活動検出(VAD)を組み合わせることで、x-ベクトルおよびi-ベクトルシステムにおけるスプーカー認識性能がさらに向上するか?
  • RQ4ドメインシフト(例:言語やチャネルの違い)はアテンション重みの一般化にどのように影響するか。また、ドメイン適応はその耐障害性を向上させるか?

主な発見

  • 親ネットワークからアテンションメカニズムを分離し、非アテンションDNNやi-ベクトルシステムに適用しても顕著な性能向上が得られ、EERが9.0%相対的に低減され、min C_primaryが3.8%低減する。
  • アテンション重みは異なる特徴表現間で良好に一般化されることから、特定のネットワークの内部特徴に強く依存しているのではなく、一般化されたフレーム重要性を捉えていることが示唆される。
  • アテンション重みとソフトVADを組み合わせることで性能がさらに向上し、x-ベクトルシステムではmin C_primaryが6.6%低減され、i-ベクトルシステムでは1.6%低減される。
  • 無作為なSRE’16データを用いたドメイン適応により、すべてのシステムで性能が著しく向上し、ドメイン外システムで観察された傾向がドメイン内システムでも維持される。
  • ドメイン適応、アテンション重み、ソフトVADを組み合わせた最良の性能が達成され、ドメイン内設定ではEERが7.85%、min C_primaryが0.620にまで低下する。
  • i-ベクトルシステムにDNNベースのスプーカー埋め込みモデルから得たアテンション重みを適用しても、EERが9.0%低減され、min C_primaryが3.8%低減される。これは、極めて強い一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。