[論文レビュー] The SYSU System for the Interspeech 2015 Automatic Speaker Verification Spoofing and Countermeasures Challenge
本論文は、MFCC、MGDCC、およびフォンエム後続確率(PPP)特徴量から得られるi-vector表現と、OpenSMILEのプロソディック特徴量を組み合わせた、複数特徴量・スコアレベル融合型スプーフィング検出システムを提示する。多項式カーネルSVMとワンクラスPLDAバックエンドを用いることで、既知および未知のスプーフィング攻撃に対して優れた耐性を示し、開発セットでは0.29%のEER、テストセットでは0.38%のEERを達成した。
Many existing speaker verification systems are reported to be vulnerable against different spoofing attacks, for example speaker-adapted speech synthesis, voice conversion, play back, etc. In order to detect these spoofed speech signals as a countermeasure, we propose a score level fusion approach with several different i-vector subsystems. We show that the acoustic level Mel-frequency cepstral coefficients (MFCC) features, the phase level modified group delay cepstral coefficients (MGDCC) and the phonetic level phoneme posterior probability (PPP) tandem features are effective for the countermeasure. Furthermore, feature level fusion of these features before i-vector modeling also enhance the performance. A polynomial kernel support vector machine is adopted as the supervised classifier. In order to enhance the generalizability of the countermeasure, we also adopted the cosine similarity and PLDA scoring as one-class classifications methods. By combining the proposed i-vector subsystems with the OpenSMILE baseline which covers the acoustic and prosodic information further improves the final performance. The proposed fusion system achieves 0.29% and 3.26% EER on the development and test set of the database provided by the INTERSPEECH 2015 automatic speaker verification spoofing and countermeasures challenge.
研究の動機と目的
- 音声変換や音声合成などのスプーフィング攻撃に対して脆弱な自動発話者認証のための耐性のあるスプーフィング対策システムの開発。
- 音声的、位相的、および音声的特徴量をi-vectorレベルで統合することのスプーフィング検出への有効性の調査。
- 特に教師ありSVMとワンクラス手法(コサインスコアリングやPLDAなど)を用いたバックエンド分類器の性能を、既知および未知のスプーフィング条件下で評価。
- 複数のi-vectorサブシステムとOpenSMILEプロソディック特徴量をスコアレベルで統合することで、一般化性能の向上を図ること。
提案手法
- 本システムは、4種類の特徴量(MFCC(音声的)、MGDCC(位相ドメイン)、PPP(音声的タンドム)、およびそれらの特徴量の組み合わせ)に対してi-vectorモデリングを適用する。
- MFCCとPPP、MGDCCとPPPの特徴量レベル統合をi-vector抽出の前に行い、識別性能を向上させる。
- 教師あり分類器として多項式カーネルSVM(LIBPOLY)を用い、すべての特徴量に最小/最大正規化を適用する。
- 未知のスプーフィング攻撃に対する耐性を評価するため、コサイン類似度や簡略化PLDAを含むワンクラス分類手法を検証する。
- スコアレベル統合では重み付き和を用い、複数のサブシステムの出力を統合し、重みは開発セットで最適化する。
- OpenSMILEを用いて追加の音声的およびプロソディック特徴量を抽出し、i-vectorスコアと統合することで全体の性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1音声的、位相的、および音声的i-vector特徴量を統合することで、単一特徴量システムに比べてスプーフィング検出性能が向上するか?
- RQ2複数のi-vectorサブシステムとOpenSMILE特徴量のスコアレベル統合は、システムの耐性および一般化性能にどのように影響するか?
- RQ3多項式カーネルSVMは、コサインスコアリングやPLDAなどのワンクラス分類手法よりも、既知のスプーフィング攻撃を検出する際に優れた性能を示すか?
- RQ4訓練時に見られなかった未知のスプーフィング攻撃に対して、異なるバックエンド分類器はどのように性能を発揮するか?
主な発見
- MFCC-PPP i-vectorサブシステムが最も優れた個別性能を示し、開発セットで1.06%のEERを達成し、ベースラインのMFCC i-vector(6.63%のEER)を著しく上回った。
- 提案されたスコアレベル統合システムは、開発セットで0.29%のEERを達成し、複数のi-vectorおよびOpenSMILEサブシステムを統合することの有効性を示した。
- 多項式カーネルSVM(LIBPOLY)は、開発セットで0.29%のEERを達成し、線形SVMや他のバックエンド手法を上回った。
- 簡略化PLDAワンクラス分類器は、訓練時に見られなかったスプーフィングタイプ(条件3および4)をテストした際、0.20%および0.20%のEERを達成し、優れた耐性を示した。
- 統合システムは、すべての既知の攻撃に対してテストセットで0.38%のEERを達成し、未知攻撃に対しては6.15%のEERを示した。特にS3およびS4(未知の合成ベースのスプーフィング)で最高の性能を発揮した。
- MFCCとPPPの特徴量レベル統合は、MFCC単体よりも性能を向上させ、音声的情報がスプーフィング検出に寄与することを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。