Skip to main content
QUICK REVIEW

[論文レビュー] Decision-based Universal Adversarial Attack

Jing Wu, Mingyi Zhou|arXiv (Cornell University)|Sep 15, 2020
Adversarial Robustness in Machine Learning参考文献 62被引用数 9
ひとこと要約

本稿では、モデルアーキテクチャや勾配情報にアクセスせずに、トップ-1の予測ラベルのみを用いて、1つのストライプ状の摂動を生成する意思決定ベースのユニバーサル adversarial 攻撃であるDUAttackを提案する。このアプローチは、モデル間およびタスク間で優れた転送性を達成し、白ボックスおよび実世界のブラックボックス設定の両方で、転送ベースおよびクエリベースの手法を上回る性能を示す。また、複数の防御機構に対しても有効である。

ABSTRACT

A single perturbation can pose the most natural images to be misclassified by classifiers. In black-box setting, current universal adversarial attack methods utilize substitute models to generate the perturbation, then apply the perturbation to the attacked model. However, this transfer often produces inferior results. In this study, we directly work in the black-box setting to generate the universal adversarial perturbation. Besides, we aim to design an adversary generating a single perturbation having texture like stripes based on orthogonal matrix, as the top convolutional layers are sensitive to stripes. To this end, we propose an efficient Decision-based Universal Attack (DUAttack). With few data, the proposed adversary computes the perturbation based solely on the final inferred labels, but good transferability has been realized not only across models but also span different vision tasks. The effectiveness of DUAttack is validated through comparisons with other state-of-the-art attacks. The efficiency of DUAttack is also demonstrated on real world settings including the Microsoft Azure. In addition, several representative defense methods are struggling with DUAttack, indicating the practicability of the proposed method.

研究の動機と目的

  • モデルの出力に最小限のアクセスで動作するブラックボックス設定でのユニバーサル adversarial 攻撃の開発。
  • トップ畳み込み層の感度を利用し、画像に依存しないストライプ状のテクスチャを持つ1つの摂動を生成する。
  • 勾配情報や代替モデルの情報に依存せずに、モデルおよびビジョンタスク間でのユニバーサル摂動の転送性を向上させる。
  • アドバルサリ訓練や入力前処理などの一般的な防御機構に対する攻撃の耐性を評価する。
  • Microsoft Azure などの実世界のデプロイメントプラットフォームで、モデルアーキテクチャが不明な状況でも有効性を検証する。

提案手法

  • 本手法は、ターゲットモデルのトップ-1予測ラベルのみを用いてユニバーサル摂動を生成し、勾配やモデルアーキテクチャへのアクセスを回避する。
  • 意思決定フィードバックに従う反復的最適化を採用し、更新方向として事前に定義された直交行列をサンプリングすることで摂動の形状を制御する。
  • 初期畳み込み層がこのようなパターンに感受性であることに着目し、ストライプ状のテクスチャを持つ摂動を設計する。
  • 成功した誤分類シグナルに基づき、摂動ベクトルの更新とその方向の最適化を交互に繰り返す。
  • 収束性と摂動強度のバランスを図るため、ステップサイズと反復回数(それぞれ0.2および1000)を用いる。
  • モデルの内部構造を事前に把握せずに、Microsoft Azure のオンラインサービスなどの実世界モデルに直接適用可能である。

実験結果

リサーチクエスチョン

  • RQ1勾配情報やモデルアーキテクチャへのアクセスなしに、トップ-1ラベルのフィードバックのみでユニバーサル adversarial 攻撃を構築可能か?
  • RQ2ユニバーサル摂動にストライプ状のテクスチャを組み込むことで、モデルおよびタスク間での転送性が向上するか?
  • RQ3本手法が、実世界のブラックボックス設定において、転送ベースおよびクエリベースの攻撃と比較してどのように性能を発揮するか?
  • RQ4本手法は、アドバルサリ訓練や入力前処理といった一般的な防御機構を回避可能か?
  • RQ5多様なモデルおよびタスクで高い欺瞞率を達成するために必要な最小摂動サイズは何か?

主な発見

  • Microsoft Azure の MNIST モデルにおいて、未ターゲット攻撃で83.08%の欺瞞率を達成した。これは、白ボックス手法のPGD(67.41%)やUAP(56.24%)を上回る結果であり、PGDでさえも本手法に劣る。
  • ターゲット攻撃では、Azure で40.47%の欺瞞率を達成し、SimBA(46.56%)やPGD(23.74%)を上回り、優れたブラックボックス性能を示した。
  • 攻撃はモデルやタスク間で強く転送性を維持しており、あるモデルで摂動を計算しても他のモデルに適用した場合でも高い成功率を示した。
  • アドバルサリ訓練(AT)や全変動最小化(TVM)といった防御は部分的に有効であったが、摂動ノルムが16に達した段階でモデル精度は約20%まで低下し、深刻なモデル劣化が生じた。
  • 空間平滑化(SS)およびJPEG圧縮(JC)といった入力レベルの防御に対しても、本手法は効果を示し、耐性を示した。
  • 実験により、摂動にストライプ状のテクスチャを組み込むことで、ランダムノイズベースの摂動と比較して、一般化性能と攻撃成功確率が顕著に向上することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。