Skip to main content
QUICK REVIEW

[論文レビュー] S-vectors: Speaker Embeddings based on Transformer's Encoder for Text-Independent Speaker Verification.

Metilda Sagaya Mary N. J, Sandesh V. Katta|arXiv (Cornell University)|Aug 11, 2020
Speech Recognition and Synthesis参考文献 17被引用数 10
ひとこと要約

本論文は、統計プーリングを用いた自己注意機構に基づくトランスフォーマー暗号化器から導出されるs-vectorsを提案し、VoxCeleb-1およびVoxCeleb-1+2においてx-vectorsよりも10–15%相対的に%EERが改善されることを示し、文書独立型発話者検証におけるグローバルコンテキストモデリングの優位性を実証している。

ABSTRACT

X-vectors have become the standard for speaker-embeddings in automatic speaker verification. X-vectors are obtained using a Time-delay Neural Network (TDNN) with context over several frames. We have explored the use of an architecture built on self-attention which attends to all the features over the entire utterance, and hence better capture speaker-level characteristics. We have used the encoder structure of Transformers, which is built on self-attention, as the base architecture and trained it to do a speaker classification task. In this paper, we have proposed to derive speaker embeddings from the output of the trained Transformer encoder structure after appropriate statistics pooling to obtain utterance level features. We have named the speaker embeddings from this structure as s-vectors. s-vectors outperform x-vectors with a relative improvement of 10% and 15% in % EER when trained on Voxceleb-1 only and Voxceleb-1+2 datasets. We have also investigated the effect of deriving s-vectors from different layers of the model.

研究の動機と目的

  • 従来のTDNNベースのx-vectorsに比べ、性能を向上させるために自己注意メカニズムを発話者埋め込み学習に応用することの検討。
  • トランスフォーマー暗号化器のグローバルコンテキストモデリングが、TDNNの局所的コンテキストに比べ、発話者レベルの特徴をより効果的に捉えられることの検証。
  • 学習済みトランスフォーマー暗号化器の異なる層から発話者埋め込みを導出する有効性の評価。
  • アテンションベースのアーキテクチャを用いた文書独立型発話者検証のための新しいベースラインの確立。
  • VoxCeleb-1やVoxCeleb-1+2といった標準ベンチマーク上でのs-vectorsとx-vectorsの性能比較。

提案手法

  • 発話者分類タスクにトランスフォーマー暗号化器アーキテクチャを訓練し、発話レベルのラベルを用いる。
  • トランスフォーマー暗号化器の出力に統計プーリング(平均および標準偏差)を適用し、固定次元の発話レベル埋め込みを生成する。
  • 学習済みトランスフォーマー暗号化器の最終層からs-vectorsを導出するが、中間層のアブレーションスタディも実施。
  • 公平な比較のため、x-vectorsと同一の学習目的およびデータを用い、主に発話者検証性能に注目する。
  • 入力発話の全フレームにわたる自己注意を活用し、長距離依存関係およびグローバルな発話者特徴を捉える。
  • 発話者分類のためエンドツーエンドで最適化し、最終的な表現をs-vectorとして使用。

実験結果

リサーチクエスチョン

  • RQ1自己注意ベースのトランスフォーマー暗号化器は、文書独立型発話者検証においてTDNNベースのx-vectorsを上回ることができるか?
  • RQ2トランスフォーマー暗号化器の異なる層から導出されたs-vectorsの性能はどのように変化するか?
  • RQ3標準ベンチマーク上でのs-vectorsとx-vectorsの間の%投入誤り率(%EER)における相対的改善率はどの程度か?
  • RQ4自己注意によるグローバルコンテキストモデリングは、TDNNの局所的コンテキストに比べ、より頑健な発話者埋め込みをもたらすか?
  • RQ5VoxCeleb-1に加えてVoxCeleb-1+2といったより大きなデータセットで学習した場合、s-vectorsの性能はどのように変化するか?

主な発見

  • VoxCeleb-1データセットで学習した場合、s-vectorsはx-vectorsに比べ10%の相対的改善を%EERで達成した。
  • より大きなVoxCeleb-1+2データセットで学習した場合、s-vectorsはx-vectorsに比べ15%の相対的改善を%EERで示した。
  • s-vectorsの性能は、トランスフォーマーの層の選択に敏感であり、最終層が最も優れた結果をもたらした。
  • 入力発話全体にわたる自己注意の活用により、TDNNの局所的コンテキストモデリングに比べ、発話者レベルの特徴をよりよく捉えることができた。
  • s-vectorsはさまざまなテスト条件において優れた一般化性能を示し、実世界の発話者検証タスクにおける頑健性を示した。
  • 提案手法は、アテンションベースのアーキテクチャを用いた文書独立型発話者検証のための新しい最先端性能を確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。