Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Attacks and Defenses for Speaker Identification Systems.

Sonal Joshi, Jesús Villalba|arXiv (Cornell University)|Jan 22, 2021
Adversarial Robustness in Machine Learning参考文献 62被引用数 8
ひとこと要約

この論文は、最先端の発話者識別(SID)システムが敵対的攻撃—特にFGSM、BIM、CW—に対してどれほど脆弱であるかを調査し、反復的かつ適応的攻撃において極めて高い感受性を示すことを示している。本研究では、ランダム化スムージングとWaveGAN音声生成器を組み合わせたハイブリッド防御を提案し、ブラックボックス条件下で93%の精度を達成するとともに、可視なノイズ(L≥0.01)を伴うホワイトボックス攻撃に対しても、わずかな精度低下で97%の耐性を維持する。

ABSTRACT

Research in automatic speaker recognition (SR) has been undertaken for several decades, reaching great performance. However, researchers discovered potential loopholes in these technologies like spoofing attacks. Quite recently, a new genre of attack, termed adversarial attacks, has been proved to be fatal in computer vision and it is vital to study their effects on SR systems. This paper examines how state-of-the-art speaker identification (SID) systems are vulnerable to adversarial attacks and how to defend against them. We investigated adversarial attacks common in the literature like fast gradient sign method (FGSM), iterative-FGSM / basic iterative method (BIM) and Carlini-Wagner (CW). Furthermore, we propose four pre-processing defenses against these attacks - randomized smoothing, DefenseGAN, variational autoencoder (VAE) and WaveGAN vocoder. We found that SID is extremely vulnerable under Iterative FGSM and CW attacks. Randomized smoothing defense robustified the system for imperceptible BIM and CW attacks recovering classification accuracies ~97%. Defenses based on generative models (DefenseGAN, VAE and WaveGAN) project adversarial examples (outside manifold) back into the clean manifold. In the case that attacker cannot adapt the attack to the defense (black-box defense), WaveGAN performed the best, being close to clean condition (Accuracy>97%). However, if the attack is adapted to the defense - assuming the attacker has access to the defense model (white-box defense), VAE and WaveGAN protection dropped significantly-50% and 37% accuracy for CW attack. To counteract this,we combined randomized smoothing with VAE or WaveGAN. We found that smoothing followed by WaveGAN vocoder was the most effective defense overall. As a black-box defense, it provides 93% average accuracy. As white-box defense, accuracy only degraded for iterative attacks with perceptible perturbations (L>=0.01).

研究の動機と目的

  • 最新の発話者識別(SID)システムが、FGSM、BIM、CWなどの敵対的攻撃に対してどれほど脆弱であるかを評価すること。
  • 前処理防御—ランダム化スムージング、DefenseGAN、VAE、WaveGAN—が敵対的摂動を軽減する効果を評価すること。
  • 攻撃者がモデルへのアクセス権を持たないブラックボックス状況と、防御モデルの詳細を把握しているホワイトボックス状況の両方における防御のパフォーマンスを調査すること。
  • ランダム化スムージングと生成モデルを組み合わせたハイブリッド防御戦略を設計・評価し、適応的攻撃に対する耐性を高めること。
  • 摂動の大きさ(L≥0.01)を変化させた場合の、耐性と音声品質のトレードオフを定量すること。

提案手法

  • 標準的な敵対的攻撃手法—FGSM、反復的FGSM(BIM)、Carlini-Wagner(CW)—を用いて、SIDシステムを標的とする敵対的音声サンプルを生成した。
  • 4つの前処理防御を実装した:入力にノイズを追加するランダム化スムージング、生成モデルに基づくノイズ除去のDefenseGAN、変分オートエノード(VAE)、波形再構築に用いるWaveGANボコーダ。
  • 攻撃者が防御の詳細を知らないブラックボックス状況と、防御モデルに適応した攻撃を仕掛けるホワイトボックス状況の両方で防御を評価した。
  • ハイブリッド防御戦略を採用:ランダム化スムージングをVAEやWaveGANに入力する前に適用し、適応的攻撃に対する耐性を向上させた。
  • 敵対的サンプルに対する分類精度を測定して防御の有効性を評価し、可視な(L≥0.01)および見えない摂動の両方を焦点にした。
  • 自然音声が低次元多様体上に存在すると仮定し、生成モデル(VAE、WaveGAN、DefenseGAN)を用いて敵対的サンプルを元のクリアな音声多様体に戻した。

実験結果

リサーチクエスチョン

  • RQ1最先端の発話者識別システムは、FGSM、BIM、CWなどの敵対的攻撃に対してどれほど脆弱であるか?
  • RQ2ランダム化スムージング、DefenseGAN、VAE、WaveGANといった前処理防御は、敵対的攻撃下で分類精度を回復させるのにどれほど効果的か?
  • RQ3これらの防御において、ブラックボックスとホワイトボックス攻撃状況の間で性能差はどの程度か?
  • RQ4ランダム化スムージングと生成モデル(VAEまたはWaveGAN)を組み合わせることで、適応的攻撃、特にホワイトボックス攻撃に対する耐性は向上するか?
  • RQ5摂動の大きさ(L≥0.01)が、ホワイトボックス状況下での防御システムの精度にどのように影響するか?

主な発見

  • SIDシステムは反復的FGSMおよびCW攻撃に対して極めて脆弱であり、ホワイトボックス状況下では分類精度が著しく低下した。
  • ランダム化スムージング防御は、見えないBIMおよびCW攻撃に対して約97%の分類精度を回復させ、非適応的攻撃に対して強い耐性を示した。
  • ブラックボックス状況では、WaveGANベースの防御が97%を超える精度を達成し、クリアな状態の性能に非常に近い結果を得た。
  • ホワイトボックス攻撃下では、VAEおよびWaveGAN防御はCW攻撃に対してそれぞれ50%および37%の精度に低下し、適応的攻撃者に対して極めて感受性が高いことが示された。
  • ランダム化スムージングに続いてWaveGANボコーダを適用するハイブリッド防御は、ブラックボックス状況で平均93%の精度を達成し、可視な摂動(L≥0.01)を伴うホワイトボックス反復攻撃に対しても、精度の低下を最小限に抑え、高い耐性を維持した。
  • スムージングとWaveGANの組み合わせが、最も効果的な総合的防御であった。両攻撃状況において強く耐性を示し、目に見えるノイズが加わっても高いパフォーマンスを維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。