Skip to main content
QUICK REVIEW

[論文レビュー] Real-time, Universal, and Robust Adversarial Attacks Against Speaker Recognition Systems

Yi Xie, Cong Shi|arXiv (Cornell University)|Mar 4, 2020
Adversarial Robustness in Machine Learning参考文献 15被引用数 11
ひとこと要約

本論文は、DNNベースの多クラス話者認識システムに対する、初めてのリアルタイムで、普遍的かつ頑健な標的攻撃を提案する。音声に依存しない普遍的摂動を生成し、部屋のインパulse応答(RIR)推定を用いて空中音響歪みをモデル化することで、攻撃は90%以上の成功率を達成し、非普遍的アプローチに比べ100倍速い展開が可能になる。

ABSTRACT

As the popularity of voice user interface (VUI) exploded in recent years, speaker recognition system has emerged as an important medium of identifying a speaker in many security-required applications and services. In this paper, we propose the first real-time, universal, and robust adversarial attack against the state-of-the-art deep neural network (DNN) based speaker recognition system. Through adding an audio-agnostic universal perturbation on arbitrary enrolled speaker's voice input, the DNN-based speaker recognition system would identify the speaker as any target (i.e., adversary-desired) speaker label. In addition, we improve the robustness of our attack by modeling the sound distortions caused by the physical over-the-air propagation through estimating room impulse response (RIR). Experiment using a public dataset of 109 English speakers demonstrates the effectiveness and robustness of our proposed attack with a high attack success rate of over 90%. The attack launching time also achieves a 100X speedup over contemporary non-universal attacks.

研究の動機と目的

  • 多クラスDNNベースの話者認識システムに対するリアルタイムで、普遍的かつ頑健な対抗的攻撃の欠如を解消すること。
  • 個々の音声に最適化を要する従来の攻撃では、リアルタイム利用に不適切なほど遅いという制限を克服すること。
  • 部屋のインパulse応答(RIR)推定を用いて空中音響歪みをモデル化することで、物理的環境における攻撃の頑健性を向上させること。
  • 1つの再利用可能な摂動を用いて、任意の話者を所望の攻撃対象話者として誤認証させること。
  • 実際の音響条件下で、109人の話者を含む公開データセットを用いて、高い有効性と効率性を実証すること。

提案手法

  • 入力音声の内容に依存しない普遍的摂動を設計し、登録済み話者の発話に適用可能にする。
  • 固定長の普遍的ノイズを繰り返し再生することで、可変長の音声入力に適応する。
  • 模擬音響環境から部屋のインパulse応答(RIR)を推定することで、物理的空中歪みをモデル化する。
  • RIR推定チャネル応答を用いて普遍的対抗的摂動を訓練し、実世界での再生時における頑健性を向上させる。
  • 標的攻撃の目的関数を最適化することで、被害者話者を事前に定義されたターゲット話者として誤分類させる。
  • デシベル(dB)単位の信号対雑音比(SNR)指標を用いて摂動の不顕著性を定量化し、事実上見えない音声歪みを確保する。

実験結果

リサーチクエスチョン

  • RQ11つの普遍的対抗的摂動を設計することで、最先端のDNNベースの話者認識システムが任意の話者をターゲット話者として誤認証させることは可能か?
  • RQ2部屋の反射や伝搬によって引き起こされるような、物理的空中音響歪みの下でも、攻撃はどの程度有効か?
  • RQ3従来の個別対抗的攻撃手法に比べ、著しく短縮された時間で実行可能なリアルタイム攻撃が可能か?
  • RQ4RIRに基づくモデル化は、実世界の展開状況における対抗的例の頑健性をどの程度向上させるか?
  • RQ5実際の音響条件下で、摂動の強度(ノイズレベル)と攻撃成功率のトレードオフはどの程度か?

主な発見

  • 提案された普遍的攻撃は、-18.84 dBのノイズレベルで平均99.95%の攻撃成功率を達成し、高い有効性を示した。
  • 極めて低いノイズレベルである-33.96 dBですら、平均成功率が80%以上を維持しており、事実上見えない摂動であることが示された。
  • RIRに基づく頑健性訓練を施した場合、空中シミュレーションでの平均成功率は90.19%に達したが、RIRモデルなしではたった1.33%にとどまった。
  • 攻撃の実行時間は0.015秒にまで短縮され、従来の非普遍的アプローチ(1インスタンスあたり約15秒)に比べ100倍の高速化が達成された。
  • 109人の話者にわたる一般化が成功しており、多様な音声入力にわたる摂動の普遍性とスケーラビリティが確認された。
  • 結果から、RIR推定が物理世界における頑健性を顕著に向上させ、攻撃が実際の展開環境で実用可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。