Skip to main content
QUICK REVIEW

[論文レビュー] Triplet Based Embedding Distance and Similarity Learning for Text-independent Speaker Verification

Zongze Ren, Zhiyong Chen|arXiv (Cornell University)|Aug 6, 2019
Speech Recognition and Synthesis参考文献 17被引用数 4
ひとこと要約

本論文は、標準的なソフトマックス損失と組み合わせて、トリプレット距離損失と埋め込み類似度測定ネットワークを共同最適化する、テキスト非依存話者認証のためのトリプレットベースの学習フレームワークを提案する。二重ブランチDNNを導入して話者類似度を分類し、埋め込み距離を精緻化することで、NIST SRE16テストセットにおいて等誤差率(EER)と検出コスト関数(DCF)が9%相対的に低減され、ベースラインのx-vectorシステムを上回る性能を達成した。

ABSTRACT

Speaker embeddings become growing popular in the text-independent speaker verification task. In this paper, we propose two improvements during the training stage. The improvements are both based on triplet cause the training stage and the evaluation stage of the baseline x-vector system focus on different aims. Firstly, we introduce triplet loss for optimizing the Euclidean distances between embeddings while minimizing the multi-class cross entropy loss. Secondly, we design an embedding similarity measurement network for controlling the similarity between the two selected embeddings. We further jointly train the two new methods with the original network and achieve state-of-the-art. The multi-task training synergies are shown with a 9% reduction equal error rate (EER) and detected cost function (DCF) on the 2016 NIST Speaker Recognition Evaluation (SRE) Test Set.

研究の動機と目的

  • x-vectorシステムにおける学習目的と評価目的の不一致を解消することで、テキスト非依存話者認証の性能を向上させること。
  • トリプレットベースの最適化を用いて、話者内での埋め込み分散を低減し、話者間の分離を高めること。
  • 発話埋め込みのスコアリングのロバスト性を向上させるために、学習可能な類似度測定ネットワークを導入すること。
  • ソフトマックス、トリプレット距離、および類似度の複数の損失関数を共同で学習することで、相乗効果による性能向上を達成すること。

提案手法

  • アーキテクチャとポジティブ埋め込み間のユークリッド距離を最小化し、ネガティブ埋め込みとの距離を最大化するトリプレット損失を導入し、認証性能に直接最適化する。
  • 連結されたアーキテクチャとポジティブ/ネガティブ埋め込みを入力とし、それらの話者類似度を予測する、二次的なDNN(埋め込み類似度測定ネットワーク)を設計する。
  • マルチクラス交差エントロピー(ソフトマックス)、トリプレット距離損失、および類似度分類損失の3つの損失関数を、学習可能な重み係数βとγを用いて、x-vectorバックボーンと共同で学習する。
  • MUSANとRIRを用いたデータ拡張を適用し、訓練データの多様性とロバスト性を向上させる。
  • t-SNE可視化とDET曲線を用いて、埋め込みのクラスタリング状態とスコア分布の分析を行う。
  • スコアリングにはKaldiのPLDAバックエンドを用い、NIST SRE16テストセット上でEERとDCF16指標を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1トリプレットベースの距離最適化は、話者内分散を低減させ、テキスト非依存話者認証におけるEERを改善できるか?
  • RQ2学習可能な類似度測定ネットワークは、埋め込み間類似度をよりよくモデル化することでDCFを向上させられるか?
  • RQ3ソフトマックス、トリプレット距離、および類似度の複数損失関数を共同で学習することで、単一損失または二重損失学習よりも相乗効果による性能向上が得られるか?
  • RQ4異なる埋め込み層(A対B)および正規化手法が、提案手法の性能にどのように影響を与えるか?

主な発見

  • ソフトマックス、トリプレット距離、および類似度損失の共同学習を実施した本手法(システム5)は、SRE16テストセットで等誤差率(EER)と検出コスト関数(DCF)が9%相対的に低減された。
  • 埋め込み類似度測定ネットワーク単体(システム3)は、EERはわずかに上昇したものの、DCFが10.5%も低減され、スコアリング性能の向上が確認された。
  • トリプレット距離学習単体(システム4)は、EERの相対的低減率が最大の12.5%を達成し、話者内コンパクトネスの向上が示された。
  • トリプレット距離と類似度ネットワークの両方を共同で学習したシステム5(システム5)は、個々のモジュールを上回る性能を示し、ハイパーパramータ調整によるトレードオフの可能性を示した。
  • 類似度ネットワークのノンターゲットスコア分布は、ベースラインシステムよりもより負の値を示し、より優れた識別力が裏付けられた。
  • L2正規化は性能向上に寄与しなかった(システム7)、また、埋め込みBを埋め込みAに代えると性能が悪化した(システム8)ため、提案モジュールには埋め込みAがより適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。