Skip to main content
QUICK REVIEW

[論文レビュー] Towards robust audio spoofing detection: a detailed comparison of traditional and learned features

Balamurali BT, Kin Wah Edward Lin|arXiv (Cornell University)|May 28, 2019
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本稿では、従来の音声特徴(例:MFCC、CQCC、スペクトログラム)と自己符号化器で学習された特徴を組み合わせたハイブリッドアプローチを用いた、頑健な音声スプーフィング検出システムを提案する。両方の特徴タイプを統合し、自己符号化器による訓練データの拡張を施すことで、ASVspoof 2017 データセット上で等誤り率(EER)10.8を達成し、既知の特徴のみ、または学習済み特徴のみを用いたモデルを上回り、未知のリプレイスプーフィング攻撃への一般化性能を高めるために特徴の多様性が重要であることを示している。

ABSTRACT

Automatic speaker verification, like every other biometric system, is vulnerable to spoofing attacks. Using only a few minutes of recorded voice of a genuine client of a speaker verification system, attackers can develop a variety of spoofing attacks that might trick such systems. Detecting these attacks using the audio cues present in the recordings is an important challenge. Most existing spoofing detection systems depend on knowing the used spoofing technique. With this research, we aim at overcoming this limitation, by examining robust audio features, both traditional and those learned through an autoencoder, that are generalizable over different types of replay spoofing. Furthermore, we provide a detailed account of all the steps necessary in setting up state-of-the-art audio feature detection, pre-, and postprocessing, such that the (non-audio expert) machine learning researcher can implement such systems. Finally, we evaluate the performance of our robust replay speaker detection system with a wide variety and different combinations of both extracted and machine learned audio features on the `out in the wild' ASVspoof 2017 dataset. This dataset contains a variety of new spoofing configurations. Since our focus is on examining which features will ensure robustness, we base our system on a traditional Gaussian Mixture Model-Universal Background Model. We then systematically investigate the relative contribution of each feature set. The fused models, based on both the known audio features and the machine learned features respectively, have a comparable performance with an Equal Error Rate (EER) of 12. The final best performing model, which obtains an EER of 10.8, is a hybrid model that contains both known and machine learned features, thus revealing the importance of incorporating both types of features when developing a robust spoofing prediction model.

研究の動機と目的

  • 攻撃手法の詳細を事前に把握しない状態でも、未知のリプレイスプーフィング攻撃に一般化可能な頑健な音声スプーフィング検出システムの開発。
  • MFCC、CQCC、スペクトログラムなどの広範な従来型音声特徴と自己符号化器で学習された特徴の性能を、統合的な検出フレームワーク内で評価すること。
  • 非専門家向けの機械学習研究者にも再現可能な、事前処理、特徴抽出、後処理のパイプラインを提供すること。
  • 自己符号化器による再構成を用いたデータ拡張が、スプーフィング検出の頑健性向上に与える影響を調査すること。
  • 既知の特徴と学習済み特徴を組み合わせることで、単独で使用する場合に比べて優れた性能が得られるかどうかを特定すること。

提案手法

  • システムは、ASVspoof 2017 の「ウェルカム・イン・ザ・ワイルド」データセットからの音声記録を用いて訓練された、GMM-UBM分類器をコア検出モデルとして使用する。
  • 従来型音声特徴には、MFCC、CQCC、LPCC、RFCC、LFCC、IMFCC、SCMC、SCFC、CCC、およびスペクトログラムが含まれる。これらはすべて標準化された前処理を経て抽出される。
  • 自己符号化器は、訓練セット上でエンドツーエンドに訓練され、音声特徴のコンactかつ低次元の表現を学習し、これを利用した追加の学習済み特徴として用いる。
  • 自己符号化器は、元のデータを再構成して拡張することで、合成された訓練サンプルを生成する目的にも用いられ、データセットの多様性が向上する。
  • 複数のモデルを訓練する:従来型特徴のみを用いたモデル、学習済み特徴のみを用いたモデル、および両方を組み合わせたハイブリッドモデル。
  • モデル出力をロジスティック回帰を用いて統合することで検出性能を向上させ、EERを最適化するためのキャリブレーションを適用する。

実験結果

リサーチクエスチョン

  • RQ1リプレイスプーフィング検出において、MFCC や CQCC などの従来型音声特徴は、自己符号化器で学習された特徴と比較してどの程度の性能を示すか?
  • RQ2未知のリプレイスプーフィング構成に一般化する際、自己符号化器ベースの特徴学習は検出の頑健性を向上させるか?
  • RQ3自己符号化器による再構成を用いたデータ拡張は、スプーフィング検出性能にどのような影響を与えるか?
  • RQ4従来型特徴と学習済み特徴を組み合わせたハイブリッドモデルは、単一の特徴タイプのみを用いたモデルを上回る性能を示すか?
  • RQ5ASVspoof 2017 データセット上で検出精度を最大化するために、複数の特徴セットを統合する最適な戦略は何か?

主な発見

  • 従来型音声特徴(例:MFCC、CQCC、スペクトログラム)のみを用いたシステムは、EER 12.2 を達成し、強力なベースライン性能を示した。
  • 自己符号化器で学習された特徴のみを用いたシステムは、EER 12.6 を達成し、学習済み表現のみでも競争力はあるが、従来型特徴に比べてわずかに効果が低いことが示された。
  • 従来型特徴と学習済み特徴の両方を組み合わせたハイブリッドモデルは、EER 10.8 を達成し、すべての個別モデルを上回る最良の性能を示した。
  • 異なる特徴セットで訓練されたモデルの出力をロジスティック回帰で統合することで、性能が顕著に向上した。これは、多様な特徴空間の価値を裏付けた。
  • 自己符号化器による再構成を用いたデータ拡張を施した最終的なハイブリッドシステムは、ベースラインの GMM-UBM システムと比較して、EER で20%の相対的改善を達成し、最先端の性能に近づいた。
  • 結果から、実世界の多様なデータセットにおいて、既知の特徴と学習済み特徴を統合することが、頑健で一般化可能なスプーフィング検出システムを構築する上で不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。