Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Speaker Recognition with Loss-gated Learning

Ruijie Tao, Kong Aik Lee|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本論文は、学習中に低い損失値を示すサンプルをフィルタリングすることで、信頼性の高い疑似ラベルを動的に選択する自己教師付き発話者認識手法であるLoss-gated Learning (LGL) を提案する。ニューラルネットワークが信頼性の高いラベルをより速く適合させるという観察に基づき、LGLは性能を向上させ、VoxCeleb1 で 1.66% の等誤差率を達成し、LGL を使用しないベースラインと比較して 46.3% の改善を示した。

ABSTRACT

In self-supervised learning for speaker recognition, pseudo labels are useful as the supervision signals. It is a known fact that a speaker recognition model doesn't always benefit from pseudo labels due to their unreliability. In this work, we observe that a speaker recognition network tends to model the data with reliable labels faster than those with unreliable labels. This motivates us to study a loss-gated learning (LGL) strategy, which extracts the reliable labels through the fitting ability of the neural network during training. With the proposed LGL, our speaker recognition model obtains a $46.3\%$ performance gain over the system without it. Further, the proposed self-supervised speaker recognition with LGL trained on the VoxCeleb2 dataset without any labels achieves an equal error rate of $1.66\%$ on the VoxCeleb1 original test set. Code has been made available at: https://github.com/TaoRuijie/Loss-Gated-Learning.

研究の動機と目的

  • 自己教師付き発話者認識における信頼性の低い疑似ラベルの問題に取り組み、モデル性能を低下させることを目的とする。
  • トレーニング中にニューラルネットワークが信頼性の高い疑似ラベルを、信頼性の低いラベルよりも速く適合させるかを調査することを目的とする。
  • 高信頼度の予測に注目することで、モデルの一般化性能を向上させる動的ラベル選択戦略を開発することを目的とする。
  • 人為的ラベルを一切使用せずに、VoxCeleb1 で最先端の性能を達成することを目的とする。

提案手法

  • LGL は、損失値が低いサンプルを信頼性の高い疑似ラベルを持つと仮定し、しきい値ベースのフィルタリング機構を用いてトレーニングサンプルを選択する。
  • 動的しきい値 τ を適用し、繰り返しを経るごとに段階的に増加させることで、訓練が進むにつれてより多くのサンプルを段階的に含める。
  • 各反復において、フィルタリングされたサンプル(低損失)のみを用いて、AAM-softmax損失を通じて発話者エンコーダーを更新する。
  • フレームワークは2段階のトレーニングプロセスに従う:対照的事前学習(第I段階)の後、LGL を用いた反復的疑似ラベルの最適化(第II段階)。
  • 発話者エンコーダーは、前段階の埋め込みを用いてk-meansクラスタリングにより生成された疑似ラベルを用いて更新される。
  • 最終モデルは1024チャネルの発話者エンコーダーを採用し、AAM-softmax損失でマージン=0.2、スケーリング=30 でトレーニングされる。

実験結果

リサーチクエスチョン

  • RQ1自己教師付きトレーニング中に、ニューラルネットワークは信頼性の高い疑似ラベルを、信頼性の低いラベルよりも速く適合させるか?
  • RQ2損失に基づくフィルタリングは、高信頼度の疑似ラベルを選択することで、発話者認識性能を効果的に向上させられるか?
  • RQ3クラスタ数やしきい値 τ などのハイパーパrameter の変化に対して、提案手法 LGL はどれほど頑健か?
  • RQ4LGL は反復的自己教師付きトレーニングにおけるクラスタリング品質と収束速度にどのような影響を与えるか?

主な発見

  • LGL は VoxCeleb1 のオリジナルテストセットで 1.66% の等誤差率(EER)を達成し、既存の最高性能手法よりも 20.95% の改善を示した。
  • LGL を使用しないベースラインと比較して、性能が 46.3% 向上し、精度の顕著な向上を示した。
  • LGL はすべての反復で一貫して性能を向上させ、特に信頼性の低いラベルが最も多く存在する初期段階で最大の向上が観察された。
  • クラスタ数(3,000 から 9,000)の変化に対しても LGL は頑健であり、すべての設定でベースラインを一貫して上回った。
  • しきい値ハイパーパrameter τ に対しても LGL は頑健であり、全テスト値(1~5)が、フィルタリングなしのベースライン(τ=∞)と比較して顕著な性能向上を示した。
  • 後続分析の結果、LGL が選択したデータの正規化相互情報量(NMI)は 0.78 であり、全体の NMI(0.62)よりも顕著に高いことが確認され、信頼性の高い疑似ラベルの効果的なフィルタリングが行われたことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。