Skip to main content
QUICK REVIEW

[論文レビュー] Margin Matters: Towards More Discriminative Deep Neural Network Embeddings for Speaker Recognition

Xu Xiang, Shuai Wang|arXiv (Cornell University)|Jun 18, 2019
Speech Recognition and Synthesis参考文献 25被引用数 22
ひとこと要約

この論文は、深層ニューラルネットワークにおける判別的発話者埋め込み学習を向上させるために、マージンに基づく損失関数(A-Softmax、AM-Softmax、AAM-Softmax)を提案する。クラス間のマージンとクラス内コンパクト性を明示的に強制することで、標準的な Softmax 損失と比較して、VoxCeleb1(2.238%)および SITW(2.761%)においてEERを25%〜30%低減し、最先端の性能を達成した。

ABSTRACT

Recently, speaker embeddings extracted from a speaker discriminative deep neural network (DNN) yield better performance than the conventional methods such as i-vector. In most cases, the DNN speaker classifier is trained using cross entropy loss with softmax. However, this kind of loss function does not explicitly encourage inter-class separability and intra-class compactness. As a result, the embeddings are not optimal for speaker recognition tasks. In this paper, to address this issue, three different margin based losses which not only separate classes but also demand a fixed margin between classes are introduced to deep speaker embedding learning. It could be demonstrated that the margin is the key to obtain more discriminative speaker embeddings. Experiments are conducted on two public text independent tasks: VoxCeleb1 and Speaker in The Wild (SITW). The proposed approach can achieve the state-of-the-art performance, with 25% ~ 30% equal error rate (EER) reduction on both tasks when compared to strong baselines using cross entropy loss with softmax, obtaining 2.238% EER on VoxCeleb1 test set and 2.761% EER on SITW core-core test set, respectively.

研究の動機と目的

  • 標準的な Softmax 損失が発話者埋め込みにおけるクラス間分離性とクラス内コンパクト性を促進する点に限界があることに対処すること。
  • 分類マージンを明示的にモデル化することで、深層発話者埋め込みシステムにおける一般化性能と判別力が向上するかを調査すること。
  • A-Softmax、AM-Softmax、AAM-Softmax の3つのマージンベースの損失関数の有効性を、標準的な発話者認識ベンチマークで評価すること。
  • x-vectorに基づくDNNを用いて、テキスト非依存発話者認識タスクで最先端の性能を達成すること。

提案手法

  • A-Softmax 損失を導入し、マージンパラメータ m を用いてログティスを変更することで、角度空間におけるマージンを強制する。
  • AM-Softmax 損失を提案し、重みベクトルと入力埋め込みの間のコサイン類似度に直接的にマージンを追加する。
  • AAM-Softmax 損失を導入し、角度空間にマージンを適用するとともに、コサイン空間でもマージンを維持する。
  • 標準的な x-vector DNN アーキテクチャ(時間遅延層、統計プーリング、バッチ正則化)を採用し、提案されたマージンベースの損失関数で訓練する。
  • データ拡張を適用し、確率的勾配降下法を最適化に用い、最終隠れ層から埋め込みを抽出する。
  • マージンパラメータ m を、クラス間分離性とクラス内コンパクト性のバランスを最適化するために調整する。

実験結果

リサーチクエスチョン

  • RQ1クラス間のマージンを明示的に強制することで、深層発話者埋め込みの判別的質が向上するか?
  • RQ2A-Softmax、AM-Softmax、AAM-Softmax の異なるマージンベースの損失関数は、埋め込み品質と認識性能においてどのように比較されるか?
  • RQ3マージンベースの損失関数は、テキスト非依存発話者認識タスクで標準的な Softmax 損失を上回るか?
  • RQ4マージンの大きさが未学習発話者に対する一般化性能に与える影響は何か?
  • RQ5マージンベースの学習は、VoxCeleb1 や SITW のような標準ベンチマークで最先端の結果を達成できるか?

主な発見

  • AAM-Softmax 損失は、VoxCeleb1 でEERを2.238%まで低減し、Softmaxベースラインと比較して相対的に30%のEER低減を達成した。
  • SITW コアコアテストセットでは、AAM-Softmax システムが2.761%のEERを達成し、Softmaxベースラインと比較して25%の相対的EER低減を示した。
  • A-Softmax、AM-Softmax、AAM-Softmax の3つのマージンベースの損失関数は、すべて標準的な Softmax 損失を顕著に上回り、両データセットで一貫したEER低減が確認された。
  • AAM-Softmax 損失は、クラス間分離性とクラス内コンパクト性の最良のトレードオフを達成し、未学習発話者に対する一般化性能が優れていた。
  • データ拡張なしでVoxCeleb2の開発セットでのみ学習した場合でも、AAM-Softmax システムはVoxCeleb1で16%、VoxCeleb1-Eで12%、VoxCeleb1-Hサブセットで6%のEER低減を達成した。
  • 結果から、マージンの強制が、より判別的な発話者埋め込みを学習する上で重要な要因であることが確認され、実世界の評価セットにおけるロバスト性と性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。