Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Attention based Text-Dependent Speaker Verification

Shi-Xiong Zhang, Zhuo Chen|arXiv (Cornell University)|Jan 3, 2017
Speech Recognition and Synthesis参考文献 15被引用数 7
ひとこと要約

本稿では、ノイズに強いフレームレベル特徴を抽出するスピーカー判別型CNNを用い、その後に学習可能なアテンション機構によりそれらを統合して発話レベルの表現を生成する、エンド・ト・エンドのアテンションベースの音声依存型スピーカー認証システムを提案する。全システムは、各ターゲットスピーカーに対して最も類似した偽スピーカーを自動的に選択するエンド・ト・エンドの基準を用いて共同最適化され、Windows 10「Hey Cortana」タスクで4.1%の等誤差率(EER)を達成し、i-vector/PLDAベースラインより9%相対的に優れている。

ABSTRACT

A new type of End-to-End system for text-dependent speaker verification is presented in this paper. Previously, using the phonetically discriminative/speaker discriminative DNNs as feature extractors for speaker verification has shown promising results. The extracted frame-level (DNN bottleneck, posterior or d-vector) features are equally weighted and aggregated to compute an utterance-level speaker representation (d-vector or i-vector). In this work we use speaker discriminative CNNs to extract the noise-robust frame-level features. These features are smartly combined to form an utterance-level speaker vector through an attention mechanism. The proposed attention model takes the speaker discriminative information and the phonetic information to learn the weights. The whole system, including the CNN and attention model, is joint optimized using an end-to-end criterion. The training algorithm imitates exactly the evaluation process --- directly mapping a test utterance and a few target speaker utterances into a single verification score. The algorithm can automatically select the most similar impostor for each target speaker to train the network. We demonstrated the effectiveness of the proposed end-to-end system on Windows $10$ "Hey Cortana" speaker verification task.

研究の動機と目的

  • 中間表現を経由せずに発話から直接認証スコアを出力するエンド・ト・エンドのスピーカー認証システムの開発。
  • スピークァー判別型CNNによるフレームレベル特徴抽出を活用することで、音声依存型スピーカー認証におけるロバスト性と性能の向上。
  • スピークァーおよび発音的コンテンツに基づいて情報量の多いフレームに動的に重みを割り当てるアテンション機構を導入し、均等重み平均化に代えて発話レベルの表現学習を強化。
  • 実際の評価プロセスを模倣するエンド・ト・エンドの基準を用いて、全システムを共同で最適化し、各ターゲットスピーカーに対して最も挑戦的な偽スピーカーを自動的に選択。

提案手法

  • 3チャネルのCNNが、非対称なコンテキスト窓(t-25 ~ t+5)を用いて静的、デルタ、デルタ・デルタのMFCC特徴を処理し、スピークァー判別型のフレームレベル特徴を抽出する。
  • アテンション機構は、スピークァー判別型および発音的情報を用いてフレームレベル特徴の動的重みを学習し、コンactな発話レベルのスピークァー・ベクトルを生成する。
  • アテンション機構は、文脈に応じた重みを計算するスケーリングドット・プロダクト・アテンションモジュールに基づき、非負のアテンションスコアを保証するためのソフトプラス活性化関数を用いる。
  • CNNとアテンションネットワークを含む全システムは、テスト発話およびターゲットスピークァー発話から直接認証スコアを出力するエンド・ト・エンドの損失関数により、共同最適化される。
  • トレーニング中、スピークァー・ベクトルプールを用いて各ターゲットスピークァーに対して最も類似した偽スピークァーを自動的に選択し、実世界の拒否シナリオを模倣する。
  • ミニバッチ戦略を用い、1スピークァーあたりN=6の登録発話を使用し、負例対正例のサンプル比をT₁=1、T₂=5として、評価条件に一致させる。

実験結果

リサーチクエスチョン

  • RQ1エンド・ト・エンドのシステムが、特徴抽出とスコアリングを共同最適化することで、従来のパイプラインベースのアプローチを上回る性能を発揮できるか?
  • RQ2スピークァーおよび発音的コンテンツを同時に考慮するアテンション機構は、均等平均化と比較して、発話レベルのスピークァー表現の質をどのように向上させるか?
  • RQ3トレーニング中にスピークァー・ベクトルプールを用いて最も類似した偽スピークァーを自動選択することで、どのような影響が生じるか?
  • RQ4DNNやLSTMと比較して、CNNベースの特徴抽出器は、音声依存型スピークァー認証において性能とロバスト性の面でどのように差をつけるか?
  • RQ5全ネットワークアーキテクチャを共同最適化することで、実世界のキーワードトリガー型スピークァー認証タスクにおける認証精度はどの程度向上するか?

主な発見

  • 提案されたエンド・ト・エンドシステムは、Windows 10「Hey Cortana」スピークァー認証タスクで4.1%の等誤差率(EER)を達成し、i-vector/PLDAベースラインより9%相対誤差低減を達成した。
  • トレーニング中に最も類似した偽スピークァーをスピークァー・ベクトルプールから選択することで、EERはランダムサンプリング時の4.6%から4.1%に低下し、現実的な負例サンプリングの重要性が示された。
  • 学習可能な重みを用いた提案アテンション機構(後続スコアスケーリングアテンションとは対照的に)が最良の性能を発揮し、EERは4.1%に低下したのに対し、後続スコアスケーリングアテンションでは4.5%にとどまった。
  • 同じパラメータ数を有するDNNと比較して、CNNベースの特徴抽出器は6%相対誤差低減を達成し、CNNがスピークァー判別型表現学習に有効であることを示した。
  • エンド・ト・エンドシステムは、GMM-UBMおよびi-vector/PLDAベースラインよりそれぞれ25%および9%相対誤差低減を達成し、共同最適化の利点を示した。
  • 本システムは、実世界の短発話、キーワードトリガー型スピークァー認証タスクで最先端の性能を達成し、実用的応用の有効性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。