Skip to main content
QUICK REVIEW

[論文レビュー] The DKU-DukeECE-Lenovo System for the Diarization Task of the 2021 VoxCeleb Speaker Recognition Challenge

Weiqing Wang, Danwei Cai|arXiv (Cornell University)|Sep 5, 2021
Speech Recognition and Synthesis参考文献 23被引用数 19
ひとこと要約

本論文は、2021年 VoxCeleb 話者認識チャレンジ向けに、音声活動検出(VAD)、話者埋め込み、クラスタリング、および新しい重複検出手法を統合したハイブリッド話者デイアライゼーションシステムを提示する。主なイノベーションは、2人の話者ペア間の重複話声を特定する2人用ターゲット話者音声活動検出(TS-VAD)モデルであり、誤って検出されない話者エラーを顕著に低減し、テストセットで5.07%のデイアライゼーション誤り率(DER)を達成し、チャレンジで1位を獲得した。

ABSTRACT

This report describes the submission of the DKU-DukeECE-Lenovo team to the VoxCeleb Speaker Recognition Challenge (VoxSRC) 2021 track 4. Our system including a voice activity detection (VAD) model, a speaker embedding model, two clustering-based speaker diarization systems with different similarity measurements, two different overlapped speech detection (OSD) models, and a target-speaker voice activity detection (TS-VAD) model. Our final submission, consisting of 5 independent systems, achieves a DER of 5.07% on the challenge test set.

研究の動機と目的

  • 実世界の重複話声状況におけるデイアライゼーション誤り率(DER)を低減するため、重複検出を改善すること。
  • 従来のデイアライゼーションシステムが重複話声を検出できないために生じる誤って検出されない話者エラーを解消すること。
  • 固定された話者数を仮定しない、柔軟で話者に依存しない重複検出手法を開発すること。
  • マルチモデル統合とデータ拡張を用いて、システムのロバスト性を向上させること。
  • 特に重複話声の処理において、SOTAのパフォーマンスを達成すること、2021年 VoxSRC チャレンジでその実現をめざす。

提案手法

  • VAD、重複検出、TS-VADに共通してResNet34-BiLSTMアーキテクチャを用い、フレーム単位の音声確率を求めるために統計的プーリングとシグモイド出力を採用する。
  • 2人用TS-VADモデルを提案する。話者埋め込みのペアをTS-VADネットワークに供給することで、2人の話者間の重複話声領域を検出可能とし、事前に話者数を知る必要がない。
  • 話者埋め込みは、VoxCeleb 1および2で学習されたResNet34フロントエンドとグローバル統計プーリング、ArcFace損失を用いて抽出する。
  • 凝集的階層型クラスタリング(AHC)とLSTMベースの類似度、スペクトルクラスタリングを用いて話者クラスタリングを実施し、DEV402でハイパーパrameterを最適化する。
  • TS-VADのためのマルチステージトレーニング戦略を採用:シミュレートされたLibrispeechで事前学習し、VoxConverseに転移し、DEV402でMUSANとRIRを用いたデータ拡張を伴いながら微調整する。
  • DOVER-Lapとランクベース重み付けによるシステム統合により、5つの独立したシステムを統合し、ロバスト性と最終的なDERの向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1固定された話者数を仮定せず、任意の話者ペア間の重複話声領域を2人用TS-VADモデルが効果的に検出できるか?
  • RQ2VAD、TS-VAD、2人用TS-VADといった複数の重複検出手法を統合することで、全体のデイアライゼーションパフォーマンスがどのように向上するか?
  • RQ3MUSANとRIRを用いたデータ拡張は、実世界のデイアライゼーション設定におけるモデルの一般化性能をどの程度向上させるか?
  • RQ4多様なシステムを統合するDOVER-Lap統合は、個々のシステムやバリデーションセットで過学習の兆候を示した以前の統合手法よりも、より良い一般化性能と低いDERを達成できるか?
  • RQ5マルチステージトレーニングと転移学習戦略により、シミュレートされたデータから実世界データへのTS-VADモデルの適応が有効に可能か?

主な発見

  • 提案された2人用TS-VADモデルは、任意の話者ペア間の重複話声を効果的に検出でき、事前に話者数を知る必要がない状況でも検出が可能である。
  • DOVER-Lapとランクベース重み付けによる5つの独立モデルの統合により、VoxSRC 2021のテストセットで5.07%のデイアライゼーション誤り率(DER)を達成し、チャレンジで1位を獲得した。
  • 2人用TS-VAD手法により、誤って検出されない話者エラーが顕著に低減され、正確な重複領域の特定が全体のパフォーマンス向上に大きく貢献した。
  • DOVER-Lapによる統合によりロバスト性と一般化性能が向上し、個々のシステムやバリデーションセットで過学習の兆候を示した以前の統合手法を上回った。
  • マルチステージトレーニング戦略(Librispeechで事前学習 → VoxConverseに転移 → DEV402で微調整)により、TS-VADモデルが実世界の状況に効果的に適応できた。
  • MUSANとRIRを用いたデータ拡張により、多様な音響条件下でのモデルのロバスト性が向上し、特にVADおよびTS-VADモデルに好影響を与えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。