Skip to main content
QUICK REVIEW

[論文レビュー] The DKU-MSXF Speaker Verification System for the VoxCeleb Speaker Recognition Challenge 2023

Ze Li, Yuke Lin|arXiv (Cornell University)|Aug 17, 2023
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本論文は、VoxCeleb Speaker Recognition Challenge 2023 用に開発された DKU-MSXF システムを提示する。Track 1 では、完全教師あり設定における性能向上を目的としたクロスエイジ QMF 学習戦略を導入し、Track 3 では、三重しきい値とサブセンター精錬を用いた新規擬似ラベル付け手法を採用して、半教師ありドメイン適応を実現した。本システムは、mDCF 0.1243(Track 1)、0.1165(Track 2)、EER 4.952%(Track 3)を達成した。

ABSTRACT

This paper is the system description of the DKU-MSXF System for the track1, track2 and track3 of the VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC-23). For Track 1, we utilize a network structure based on ResNet for training. By constructing a cross-age QMF training set, we achieve a substantial improvement in system performance. For Track 2, we inherite the pre-trained model from Track 1 and conducte mixed training by incorporating the VoxBlink-clean dataset. In comparison to Track 1, the models incorporating VoxBlink-clean data exhibit a performance improvement by more than 10% relatively. For Track3, the semi-supervised domain adaptation task, a novel pseudo-labeling method based on triple thresholds and sub-center purification is adopted to make domain adaptation. The final submission achieves mDCF of 0.1243 in task1, mDCF of 0.1165 in Track 2 and EER of 4.952% in Track 3.

研究の動機と目的

  • 完全教師あり設定における発話者識別性能を、クロスエイジデータ拡張を用いて向上させること。
  • ミックスファインチューニングを用いて大規模な VoxBlink-clean データセットを統合することで、モデルの一般化性能を向上させること。
  • 半教師あり発話者識別におけるドメインシフトを、しきい値ベースのクラスタリングとサブセンター精錬を組み合わせた新規擬似ラベル付け戦略により効果的に処理すること。
  • VoxCeleb Speaker Recognition Challenge 2023 の Track 1、2、3 において最先端の性能を達成すること。

提案手法

  • 発話者埋め込み抽出に、SimAM および fwSE モジュールを備えた ResNet100 ベースのバックボーンが用いられた。
  • Track 1 では、年齢層をまたがる一般化性能の向上を目的としたクロスエイジ QMF 学習が適用された。
  • Track 2 では、VoxCeleb2 および VoxBlink-clean データの両方を用いたミックスファインチューニング(Mix-FT)が適用された。
  • 三段階の擬似ラベル付けパイプラインが提案された:T1 を用いた KNN グラフ構築、T2 を用いたクラス純度推定、T3 を用いたクラス統合。
  • サブセンター精錬は、サブセンター ArcFace 分類器からの選択確率を分析することで、低純度クラスを削除するために適用された。
  • QMF および 20,000 個のラベルなしターゲットドメイン発話文を含むコhort を用いて、スコア補正および正規化が行われた。

実験結果

リサーチクエスチョン

  • RQ1クロスエイジ QMF 学習は、完全教師あり設定における発話者識別性能をどのように向上させるか?
  • RQ2ミックスファインチューニングを用いて VoxBlink-clean データセットを統合することで、モデルのロバスト性および精度はどの程度向上するか?
  • RQ3しきい値ベースの擬似ラベル付け戦略にサブセンター精錬を組み合わせることで、半教師あり発話者識別におけるドメインシフトを効果的に処理できるか?
  • RQ4提案手法は、VoxSRC-2023 チャレンジ、特に Track 3 において、先行手法と比較してどのように優れているか?

主な発見

  • DKU-MSXF システムは、Track 1 の評価セットで mDCF 0.1243 を達成し、ベースラインシステムに比べ顕著な向上を示した。
  • Track 2 では、mDCF 0.1165 を達成し、Track 1 のベースラインに比べ 10% 以上の相対的性能向上を示した。
  • Track 3 では、公式評価セットで EER 4.952% を達成し、前年度の優勝結果(EER 7.03%)を上回った。
  • Track 1 および Track 2 における複数モデルのアンサンブルにより、検証セットでの EER はそれぞれ 2.079% および 2.029% に低下した。
  • サブセンター精錬ステップは、ノイズの多いクラス割り当てを効果的に低減させ、半教師あり学習における擬似ラベルデータの信頼性を向上させた。
  • VoxBlink-clean データを用いた Mix-FT の適用により、スクラッチからの学習に比べて Track 2 で 10% 以上の相対的改善が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。