Skip to main content
QUICK REVIEW

[論文レビュー] The DKU-DukeECE Diarization System for the VoxCeleb Speaker Recognition Challenge 2022

Weiqing Wang, Xiaoyi Qin|arXiv (Cornell University)|Oct 4, 2022
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本論文は、VoxCeleb Speaker Recognition Challenge 2022、Track 4向けに開発されたDKU-DukeECEシステムを提示する。このシステムは、階層的凝集型クラスタリング(AHC)フレームワーク内に、マルチモデル音声活動検出(VAD)、ターゲットスピーカーVAD(TS-VAD)および改善されたスピーカー埋め込みモデルを統合することで、4.75%のダイアライゼーションエラー率(DER)を達成した。DOVER-Lapを用いた4つの異なる設定の統合により、VADおよび重複領域の取り扱いが向上し、DERが顕著に低減された。

ABSTRACT

This paper discribes the DKU-DukeECE submission to the 4th track of the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC-22). Our system contains a fused voice activity detection model, a clustering-based diarization model, and a target-speaker voice activity detection-based overlap detection model. Overall, the submitted system is similar to our previous year's system in VoxSRC-21. The difference is that we use a much better speaker embedding and a fused voice activity detection, which significantly improves the performance. Finally, we fuse 4 different systems using DOVER-lap and achieve 4.75 of the diarization error rate, which ranks the 1st place in track 4.

研究の動機と目的

  • マルチスピーカーで重複話声が発生する状況におけるスピーカー・ダイアライゼーション性能の向上を目的とし、頑健な音声活動検出(VAD)および重複検出を用いる。
  • VADモデルの強化とターゲットスピーカーVAD(TS-VAD)の統合により、重複領域の検出を改善することで、ダイアライゼーションエラー率(DER)を低減することを目的とする。
  • トレーニングデータ(VoxCeleb)とテストデータ(VoxConverse)の間のドメインギャップを、疑似ラベル付けとスピーカー埋め込みのファインチューニングにより低減することを目的とする。
  • DOVER-Lapを用いた複数のダイアライゼーションシステムの統合により、システムの頑健性と一般化性能を向上させることを目的とする。
  • VoxSRC 2022 Speaker Recognition Challenge、Track 4で最先端のパフォーマンスを達成することを目的とする。

提案手法

  • ResNet34ベース、Conformerベース、pyannote.audio 2.0、ASRベースの4つの異なるVADモデルをメジャリティ投票により統合し、誤報および見逃しを低減する。
  • SimAM-ResNet34ベースのスピーカー埋め込みモデルをArcFace損失を用いて学習し、疑似ラベルが付与されたVoxConverse開発セットを用いてファインチューニングすることでドメインギャップを低減する。
  • スピーカー埋め込みを用いて特定のターゲットの話声セグメントを検出するターゲットスピーカーVAD(TS-VAD)モデルを導入。シミュレートされたLibrispeechデータで学習し、VoxConverseでファインチューニングする。
  • DOVER-Lap統合を用いて4つのシステムバージョンを統合:重複検出付きAHC、部分的/完全割り当て付きTS-VAD付きAHC、TS-VAD付きLSTMベースのスペクトルクラスタリング。
  • MUSANおよびRIRを用いたオンラインデータ拡張を適用し、多様な音響環境下での頑健性を向上させる。
  • ハイブリッド推論戦略を採用:AHCベースの結果に対して、TS-VAD出力を部分的に適用してスピーカーの混同や過剰推定を是正する。

実験結果

リサーチクエスチョン

  • RQ1複数のVADモデルを効果的に統合することで、マルチスピーカー状況下でのダイアライゼーションエラー率(DER)をどのように低減できるか?
  • RQ2標準的なVADや重複専用検出と比較して、ターゲットスピーカーVAD(TS-VAD)は、重複検出および全体的なダイアライゼーションパフォーマンスにどの程度寄与するか?
  • RQ3VoxCelebで事前学習されたスピーカー埋め込みモデルを、VoxConverseテストセットに効果的に適応させることで、ドメインギャップを低減しDERを改善できるか?
  • RQ4多様なダイアライゼーションシステムのDOVER-Lap統合は、スピーカーの混同や過剰推定の影響を受けても、どのように頑健性を向上させ、DERを低減するか?
  • RQ5MUSANおよびRIRを用いたデータ拡張は、VADおよびダイアライゼーションモデルの一般化性能にどのような影響を与えるか?

主な発見

  • 統合されたVADシステムは、個々のVADモデルと比較してDERを0.3%低減し、VoxConverseテストセットで3.97%の誤差率を達成した。
  • TS-VADを統合したAHCベースのダイアライゼーションシステムは、VoxConverseおよびコンテストテストセットの両方で4.85%のDERを達成し、リーダーボードで1位を獲得した。
  • 4つの異なるシステムをDOVER-Lapで統合することで、DERは4.75%に低下し、VoxSRC 2022 Track 4で1位の順位を獲得した。
  • TS-VADモデルは、ベースラインのAHCに標準的な重複検出を適用した場合と比較して、DERを約0.6%低減した。これは、重複話声の処理において有効であることを示している。
  • AHCオンリーベースラインは、10人のスピーカーが登場するセグメントに対し30人以上を予測するなど、スピーカー数を過剰に推定していたが、部分的なTS-VAD割り当てにより誤りが是正された。
  • VoxConverseでファインチューニングを行ったにもかかわらず、スピーカー埋め込みモデルはコンテストテストセットで事前学習済みのVoxCeleb2モデルよりパフォーマンスが悪かったため、最終推論には後者を採用した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。