Skip to main content
QUICK REVIEW

[論文レビュー] The Phonexia VoxCeleb Speaker Recognition Challenge 2021 System Description

J. Slavicek, Albert Swart|arXiv (Cornell University)|Sep 5, 2021
Speech Recognition and Synthesis参考文献 15被引用数 6
ひとこと要約

本論文は、反復的クラスタリングと疑似ラベル、および対照的学習を用いて深層ニューラルネットワーク埋め込みを学習する、Phonexiaの自己教師付き発話者認識システムを、VoxCeleb 2021チャレンジ向けに提示する。スコア統合による5つのzt正規化されたコサインスコアから得られる4.986%のEERを達成し、コンペティションで2位となった。

ABSTRACT

We describe the Phonexia submission for the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21) in the unsupervised speaker verification track. Our solution was very similar to IDLab's winning submission for VoxSRC-20. An embedding extractor was bootstrapped using momentum contrastive learning, with input augmentations as the only source of supervision. This was followed by several iterations of clustering to assign pseudo-speaker labels that were then used for supervised embedding extractor training. Finally, a score fusion was done, by averaging the zt-normalized cosine scores of five different embedding extractors. We briefly also describe unsuccessful solutions involving i-vectors instead of DNN embeddings and PLDA instead of cosine scoring.

研究の動機と目的

  • トレーニング中に発話者ラベルにアクセスできない状況でも、競争力のある性能を示す自己教師付き発話者認識システムの開発。
  • 自己教師学習における埋め込み品質の向上に、反復的クラスタリングによる疑似発話者ラベルの有効性の調査。
  • 最終システム性能に与えるスコア正規化とモデル統合の影響の評価。
  • PLDA や iベクトルなどの代替スコアバックエンドの検討と、自己教師学習環境下での限界の特定。
  • タブララサトレーニングの可能性の評価と、外部ドメインのラベル付きデータを用いた適応ベースの代替手法の提案。

提案手法

  • トレーニングは、入力の拡張を唯一の監視信号として用いるモーメンタム対照的学習から開始され、対照的損失用の正例・負例ペアが生成される。
  • 反復的クラスタリングが適用される:前回のモデルからの埋め込みがk-meansおよび階層的凝集型クラスタリング(AHC)を用いて7,500の疑似発話者にクラスタリングされ、それが教師付き学習の疑似ラベルとして使用される。
  • 2つのニューラルネットワークを並列に訓練し、お互いの疑似ラベルを交互に用いて更新する。自己蒸留技術にインspiredされたアプローチである。
  • 反復ごとにトレーニング設定を変更する——学習率の調整、マージンm=0.3のAAM-Softmaxの使用、6秒のトレーニング例の使用など——により収束性と性能を向上させる。
  • 最終スコアは、5つの異なる埋め込み抽出器から得たzt正規化されたコサイン類似度の平均値として得られ、正規化にはトレーニングデータからのランダムコhortが使用される。
  • 最終反復には、一般化性能を向上させるためにBiTempered損失(t1=0.99、t2=1.01)が適用される。

実験結果

リサーチクエスチョン

  • RQ1反復的疑似ラベル付けとクラスタリングは、エンドツーエンドの対照的事前学習に比べて、自己教師付き発話者埋め込み品質を顕著に向上させ得るか?
  • RQ2ランダムコhortを用いたスコア正規化は、自己教師付き発話者検証におけるコサインスコアのロバスト性と正確性を向上させるか?
  • RQ3iベクトルとPLDAベースラインは、自己教師付き埋め込みを用いても性能向上を示さないが、その理由とこの設定下での限界は何か?
  • RQ4複数の独立して訓練された抽出器のモデル統合は、自己教師付き発話者認識における最終システム性能をどの程度向上させるか?
  • RQ5タブララサ自己教師付きトレーニングは真に実現可能かつ効果的であるか、それとも実世界の応用において大規模なラベル付きデータからの適応を推奨すべきか?

主な発見

  • 最終システムは、5つの異なるモデルからのzt正規化されたコサインスコアを統合した結果、VoxSRC-21検証セットで4.986%のEERを達成した。
  • 最も優れた個別モデル(iter15bt)は、統合前のEERが5.319%であったが、zt正規化を施すと4.885%に改善された。
  • zt正規化付きスコア統合により、最良の単一モデルに比べてEERが0.38%低下し、アンサンブルスコアリングの有効性が裏付けられた。
  • 反復的クラスタリングプロセスでは、反復10回目以降に収益の逓減が顕著に現れ、反復8回目以降は改善が著しく鈍化した。
  • 広範な実験にもかかわらず、iベクトルとPLDAバックエンドは、単純なコサインスコアリングを上回る性能を示せず、iベクトルは20%を超えるEERを記録した。
  • 最終システムはコンペティションで2位となり、後日撤回されたチームに次ぐ成績を達成し、VoxSRC-2021におけるトップクラスの自己教師付きシステムの一つとされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。