Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Attacks on Spoofing Countermeasures of automatic speaker verification

Songxiang Liu, Haibin Wu|arXiv (Cornell University)|Oct 19, 2019
Speech Recognition and Synthesis参考文献 31被引用数 16
ひとこと要約

本論文は、自動話者認証(ASV)における高性能なスプーフィング対策手法が、FGSMおよびPGD手法を用いた敵対的攻撃に対してどれほど脆弱であるかを調査する。白ボックスおよびブラックボックス攻撃の両方がモデル性能を著しく低下させることを示しており、特にPGDがより効果的であることが判明した。これは、最高水準の対策手法ですら敵対的例の影響を受ける可能性があることを示している。

ABSTRACT

High-performance spoofing countermeasure systems for automatic speaker verification (ASV) have been proposed in the ASVspoof 2019 challenge. However, the robustness of such systems under adversarial attacks has not been studied yet. In this paper, we investigate the vulnerability of spoofing countermeasures for ASV under both white-box and black-box adversarial attacks with the fast gradient sign method (FGSM) and the projected gradient descent (PGD) method. We implement high-performing countermeasure models in the ASVspoof 2019 challenge and conduct adversarial attacks on them. We compare performance of black-box attacks across spoofing countermeasure models with different network architectures and different amount of model parameters. The experimental results show that all implemented countermeasure models are vulnerable to FGSM and PGD attacks under the scenario of white-box attack. The more dangerous black-box attacks also prove to be effective by the experimental results.

研究の動機と目的

  • 最先端のスプーフィング対策手法がASVにおける敵対的攻撃に対してどれほど耐性があるかを評価すること。
  • スプーフィング検出モデルに対するホワイトボックスおよびブラックボックス攻撃の両方の有効性を評価すること。
  • 異なるアーキテクチャおよびパラメータ数を持つモデル間での攻撃効果を比較すること。
  • あるモデルから生成した敵対的例が、特にブラックボックス環境下で他のモデルに対しても効果を発揮するかどうかを調査すること。
  • 再現可能性およびASVシステムにおける敵対的耐性分野の今後の研究を支援するため、オープンソースコードを提供すること。

提案手法

  • ASVspoof 2019チャレンジから得られた3つの高性能なスプーフィング対策モデル(LCNN-big、LCNN-small、SENet12)を実装した。
  • 異なる摂動の大きさ(ε)を用いたFGSMおよびPGD手法を用いて、ホワイトボックス攻撃を実施し、敵対的音声サンプルを生成した。
  • ブラックボックス攻撃のために、ターゲットモデルの入出力挙動を学習した代替モデルを訓練し、それらから敵対的例を生成した。
  • 攻撃の成功度を評価する主な指標としてEER(等誤差率)を用い、元の評価セットのEERにおける作動点を設定した。
  • スペクトログラムの生成および主観的XAB聴取テストを実施し、敵対的摂動が元の音声と認識上区別できないことを検証した。
  • 異なるモデルアーキテクチャおよびパラメータスケール間での攻撃効果を比較し、敵対的例の転送性を分析した。

実験結果

リサーチクエスチョン

  • RQ1ホワイトボックス条件下において、ASVにおける高性能なスプーフィング対策手法は敵対的攻撃に対して脆弱であるか?
  • RQ2入出力へのアクセスのみが可能である状況下で、ブラックボックス敵対的攻撃がスプーフィング対策モデルを効果的にだますことができるか?
  • RQ3モデルアーキテクチャおよびパラメータ数は、ブラックボックス攻撃における敵対的例の転送性および有効性にどのように影響するか?
  • RQ4大きなモデル(例:LCNN-big)から生成した敵対的例は、より小さなモデル(例:LCNN-small、SENet12)に対してより効果的に転送されるか?
  • RQ5敵対的摂動は元の音声とどれほど認識上区別がつかないか、攻撃の隠蔽性を保っているか?

主な発見

  • 実装した3つのスプーフィング対策モデル(LCNN-big、LCNN-small、SENet12)は、すべてホワイトボックスのFGSMおよびPGD攻撃において成功裏に攻撃を受け、ε = 5の条件下でEERが50%に近づくか、それを上回った。
  • PGD攻撃はFGSM攻撃を常に上回り、ε = 5の条件下でLCNN-bigではEERが85%を超えた。これは検出能力の完全な崩壊を示している。
  • ブラックボックス攻撃は非常に効果的であり、LCNN-bigから生成した敵対的例がLCNN-smallおよびSENet12の両方のモデルを効果的に攻撃し、高いEERを達成した。
  • より大きなモデル(LCNN-big)から生成した敵対的例は、より小さなモデル(LCNN-small、SENet12)よりも転送性が高く、特に大きなターゲットに対して効果的であった。
  • ソースモデルとターゲットモデルのアーキテクチャが類似している場合、攻撃成功率が高くなる傾向が見られ、LCNN-bigの例を用いてLCNN-smallを攻撃した際のEERは、RESNet12を攻撃した場合よりも高かった。
  • 主観的XAB聴取テストの結果、敵対的摂動が元の音声と認識上区別がつかないことが確認され、攻撃の隠蔽性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。