Skip to main content
QUICK REVIEW

[論文レビュー] The DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022

Xiaoyi Qin, Na Li|arXiv (Cornell University)|Oct 11, 2022
Speech Recognition and Synthesis被引用数 6
ひとこと要約

本論文は、VoxCeleb Speaker Recognition Challenge 2022 の DKU-Tencent システムを提示し、トラック1(クロスエイジ検証)に対してデータ拡張、マルチバックボーンモデル、品質認識スコアキャリブレーションを組み合わせたハイブリッドアプローチを提案する。トラック3では、サブセンターアークフェイスを用いた疑似ラベル化による半教師付きドメイン適応を実施する。システムはトラック1で0.107 mDCF、トラック3で7.135% EERを達成し、QMFベースのキャリブレーションと頑健なトレーニングプロトコルにより顕著な向上を示した。

ABSTRACT

This paper is the system description of the DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC22). In this challenge, we focus on track1 and track3. For track1, multiple backbone networks are adopted to extract frame-level features. Since track1 focus on the cross-age scenarios, we adopt the cross-age trials and perform QMF to calibrate score. The magnitude-based quality measures achieve a large improvement. For track3, the semi-supervised domain adaptation task, the pseudo label method is adopted to make domain adaptation. Considering the noise labels in clustering, the ArcFace is replaced by Sub-center ArcFace. The final submission achieves 0.107 mDCF in task1 and 7.135% EER in task3.

研究の動機と目的

  • トラック1におけるクロスエイジ発話者認識の課題に応えるために、年齢層をまたがる一般化を向上させる。
  • 未ラベルのターゲットドメインデータを活用して、トラック3における効果的な半教師付きドメイン適応を実現する。
  • クラスタリングベースのドメイン適応におけるノイズの多い疑似ラベルの影響を低減する。
  • 品質測定関数(QMF)およびスコア正規化を活用して、システムの頑健性を向上させる。
  • 完全教師ありおよび半教師ありの両トラックにおいて、VoxCeleb2022ベンチマークで最先端のパフォーマンスを達成する。

提案手法

  • MUSANおよびRIRノイズを用いたオンザフライデータ拡張に加え、スピード変更およびボリューム変更を実施し、トレーニングの多様性を向上させる。
  • 複数のバックボーンネットワーク(SimAM-ResNet34、ResNet101、ResNet152、Res2Net101)を用いてフレームレベル特徴を抽出し、その後、統計プーリング、標準偏差プーリング、またはアテンション統計プーリングによりセグメントレベル埋め込みを生成する。
  • 最初のトレーニング段階では、マージン0.2、スケール32を用いたArcFace損失を適用し、その後、マージンを0.5に増加させ、データ拡張を減少させた大マージン微調整(LMFT)を実施する。
  • スコアキャリブレーションに、発話時間および埋め込みの大きさに基づく品質測定関数(QMF)と、適応的対称スコア正規化(AS-Norm)を適用する。
  • トラック3では、未ラベルのターゲットデータに対してK-meansクラスタリング(K=1600–2000)を実施し、エルボー法により最適なK値を決定し、疑似ラベルを生成する。また、ノイズの多いラベルの影響を軽減するために、Sub-center ArcFaceを用いる。
  • 最終システムでは、8種類の多様なアーキテクチャを統合し、長時間の発話を20秒に切り詰め、20,000件のターゲットドメインサンプルを用いたコhortベースの正規化を実施する。

実験結果

リサーチクエスチョン

  • RQ1データ拡張とモデルアーキテクチャの多様性は、クロスエイジ発話者検証性能をどのように向上させるか?
  • RQ2持続時間および大きさに基づく品質測定関数(QMF)は、クロスエイジ状況におけるスコアキャリブレーションをどの程度向上させるか?
  • RQ3クラスタリングを用いた疑似ラベル化は、発話者認識における半教師付きドメイン適応を効果的に可能にするか?
  • RQ4アーキテクチャをArcFaceからSub-center ArcFaceに置き換えることで、クラスタリングベースの適応におけるノイズの多い疑似ラベルへの感受性は低下するか?
  • RQ5クロスドメイン発話者認識において、一般化と頑健性をバランスさせる最適なトレーニングプロトコルは何か?

主な発見

  • ベースラインのSimAM-ResNet34モデルは、Vox-Oで0.542% EERおよび0.034 mDCFを達成したが、評価セットでは顕著な性能低下を示し、ドメインシフトの問題を浮き彫りにした。
  • QMFベースのスコアキャリブレーションを適用することで、Vox-CAテストセットのmDCFは0.263から0.139に低下し、相対的に30%の改善が得られた。
  • 最終のアンサンブルシステムは、トラック1評価で0.107 mDCFを達成し、マルチモデルアンサンブルとQMFキャリブレーションの有効性を示した。
  • トラック3では、疑似ラベル化にSub-center ArcFaceを適用することで、AS-NormおよびQMFを経た後、EERは8.680%から8.090%に低下し、ノイズの多いラベルに対して頑健であることが示された。
  • 最終システムは、トラック3評価セットで7.135% EERを達成し、提出結果では一貫して7.153% EERを示しており、優れた一般化性能を示した。
  • 2回目の微調整により性能が低下したため、トラック3の全モデルで1回のクラスタリングおよび微調整プロトコルに限定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。