Skip to main content
QUICK REVIEW

[論文レビュー] HLT-NUS Submission for NIST 2019 Multimedia Speaker Recognition Evaluation

Rohan Kumar Das, Ruijie Tao|arXiv (Cornell University)|Oct 8, 2020
Speech and Audio Processing参考文献 40被引用数 4
ひとこと要約

本論文は、2019年NISTマルチメディア・スプーカー認識評価用にHLT-NUSが開発したマルチモーダル・スプーカー認識システムを提示する。x-vectorに基づく音声システムとResNet/InsightFaceに基づく視覚システムをスコアレベル統合することで、最終的なシステムは評価セットでEER 0.88%、actDCF 0.026を達成し、評価後の最適化によってチャレンジ参加時よりも顕著に優れた性能を示した。

ABSTRACT

This work describes the speaker verification system developed by Human Language Technology Laboratory, National University of Singapore (HLT-NUS) for 2019 NIST Multimedia Speaker Recognition Evaluation (SRE). The multimedia research has gained attention to a wide range of applications and speaker recognition is no exception to it. In contrast to the previous NIST SREs, the latest edition focuses on a multimedia track to recognize speakers with both audio and visual information. We developed separate systems for audio and visual inputs followed by a score level fusion of the systems from the two modalities to collectively use their information. The audio systems are based on x-vector based speaker embedding, whereas the face recognition systems are based on ResNet and InsightFace based face embeddings. With post evaluation studies and refinements, we obtain an equal error rate (EER) of 0.88% and an actual detection cost function (actDCF) of 0.026 on the evaluation set of 2019 NIST multimedia SRE corpus.

研究の動機と目的

  • 実世界の悪条件下でも、音声と視覚的特徴を活用できる耐障害性の高いスプーカー認識システムの開発を目的とする。
  • 混合帯域幅音声処理と音声強調(WPE)が、ノイズ多きいまたはチャネル状態が変動する環境下でのスプーカー認識性能に与える影響を調査すること。
  • 深層学習ベースの顔認識モデル(ResNet-101およびInsightFace)がマルチモーダル・スプーカー認証の文脈で視覚的スプーカー識別にどの程度有効であるかを評価すること。
  • 音声と視覚システムの出力を最適に統合するスコアレベル統合戦略が、単一モodalシステムに比べて性能をどのように向上させるかを検討すること。
  • 評価後における高度なモデルとキャリブレーション技術の適用により、2019年NISTマルチメディアSREベンチマークで最先端の性能を達成するためのシステム性能の向上を図ること。

提案手法

  • 耐障害性を高めるために、8 kHz(狭帯域)および16 kHz(広帯域)音声データを用いた複数のx-vectorベース音声システムを開発した。
  • 音声入力のノイズ低減を目的に、重み付き予測誤差(WPE)音声強調を適用し、スプーカー埋め込み抽出のための特徴品質を向上させた。
  • 深層畳み込みネットワークを用いて判別性の高い顔特徴を学習するため、ResNet-101ベースの顔認識モデルを訓練・評価し、視覚的スプーカー埋め込み抽出を実施した。
  • 最先端の顔検出および認識モデルを活用した、より高度なInsightFaceベースの視覚システムを開発し、ResNet-101ベースラインに比べて精度を向上させた。
  • 複数の音声および視覚モデルの出力をキャリブレーション済みスコアで統合することで、スコアレベル統合を実施し、全体の検出性能を向上させた。
  • 実世界への適用を最適化するため、統合システムにキャリブレーション技術を適用し、実際の検出コスト関数(actDCF)を最小化した。

実験結果

リサーチクエスチョン

  • RQ1狭帯域および広帯域音声処理の統合が、悪条件下でのスプーカー認識性能にどのように寄与するか?
  • RQ2WPEによる音声強調処理が、ノイズ多きいまたは劣化した音声入力におけるスプーカー認識精度にどの程度の効果をもたらすか?
  • RQ3マルチモーダル設定下で、最新の深層顔認識モデル(ResNet-101およびInsightFace)は、視覚的スプーカー識別においてどの程度の性能を示すか?
  • RQ4音声と視覚システム間のスコアレベル統合が、全体のスプーカー認識性能に与える影響は何か?
  • RQ5高度なモデルとキャリブレーション技術を用いた評価後のシステム最適化により、チャレンジ参加時よりも顕著に性能を向上させられるか?

主な発見

  • 最終的な音声・視覚統合システムは、2019年NISTマルチメディアSRE評価セットで等誤差率(EER)0.88%、実際の検出コスト関数(actDCF)0.026を達成した。
  • 評価後のInsightFaceベースの視覚システムは、EER 1.55%、actDCF 0.085を達成し、ResNet-101ベースの視覚システム(EER: 6.16%、actDCF: 0.343)を顕著に上回った。
  • WPE強調処理を施したx-vectorシステム(x-vector_8k-WPE)は、評価セットで最高の個別音声性能を示し、EER 7.02%、actDCF 0.529を達成した。
  • 評価後の音声・視覚統合システムでは、actDCFがチャレンジ参加時の0.136から0.026に低下し、相対的に81%の改善が達成された。
  • 最終統合システムは、2019年NISTマルチメディアSREの上位2系統と同等の性能を示し、マルチモーダル統合と評価後の最適化の有効性を裏付けた。
  • 開発セットは評価セットよりも困難であることが判明した。すべてのシステムが評価セットでより高い性能を示したため、ドメインシフトまたはデータ分布の違いが存在する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。