Skip to main content
QUICK REVIEW

[論文レビュー] There are No Bit Parts for Sign Bits in Black-Box Attacks

Abdullah Al-Dujaili, Una-May O’Reilly|arXiv (Cornell University)|Feb 19, 2019
Adversarial Robustness in Machine Learning参考文献 36被引用数 14
ひとこと要約

この論文では、勾配の大きさではなくその符号のみを推定する新しいブラックボックス敵対的攻撃であるSignHunterを紹介する。これにより、最先端のクエリ効率が達成された。勾配の符号推定に特化したアプローチにより、ハミング距離の最小化を通じて敵対的攻撃を二値最適化問題に再定式化し、クエリの複雑さを低減した。MNIST、CIFAR10、ImageNetにおいて、1回の攻撃あたり10,000クエリの制約下で、従来手法と比較して失敗率が3.8倍低く、クエリ数が2.5倍少ない結果が得られた。

ABSTRACT

We present a black-box adversarial attack algorithm which sets new state-of-the-art model evasion rates for query efficiency in the $\ell_\infty$ and $\ell_2$ metrics, where only loss-oracle access to the model is available. On two public black-box attack challenges, the algorithm achieves the highest evasion rate, surpassing all of the submitted attacks. Similar performance is observed on a model that is secure against substitute-model attacks. For standard models trained on the MNIST, CIFAR10, and IMAGENET datasets, averaged over the datasets and metrics, the algorithm is 3.8x less failure-prone, and spends in total 2.5x fewer queries than the current state-of-the-art attacks combined given a budget of 10, 000 queries per attack attempt. Notably, it requires no hyperparameter tuning or any data/time-dependent prior. The algorithm exploits a new approach, namely sign-based rather than magnitude-based gradient estimation. This shifts the estimation from continuous to binary black-box optimization. With three properties of the directional derivative, we examine three approaches to adversarial attacks. This yields a superior algorithm breaking a standard MNIST model using just 12 queries on average!

研究の動機と目的

  • 連続的な勾配推定に依存する既存のブラックボックス敵対的攻撃が抱える高いクエリ複雑性に対処すること。
  • 勾配の符号のみを推定することで、マグニチュードに基づく勾配推定と比較して著しく少ないクエリ数で同等またはより優れた敵対的成功を達成できるかどうかを調査すること。
  • ハイパーパramータのチューニングが不要で、データ依存の事前知識や勾配へのアクセスを必要としない、クエリ効率の高いブラックボックス攻撃を開発すること。
  • 敵対的攻撃を二値(符号に基づく)探索問題として扱うことで、ゼロ次最適化の新しいパラダイムを確立すること。

提案手法

  • ブラックボックス敵対的攻撃を、真の勾配符号ベクトルとのハミング距離の最小化として再定式化することで、連続的最適化から二値最適化にシフトする。
  • 方向微分の3つの性質(分離可能性、対称性、単調性)を活用して、効率的な符号推定を設計する。
  • 分離可能性に基づく分割統治戦略を採用し、探索空間を2^nからO(n)の符号ベクトルに削減する。
  • 損失クエリの有限差分近似を用いて方向微分を推定し、勾配符号ビットを推論する。
  • 最小限のクエリで正しい符号パターンに到達するようガイドするハミング距離オラクルを導入する。
  • クエリ予算に応じた適応戦略を採用し、損失変化に大きな影響を与える座標を優先する。

実験結果

リサーチクエスチョン

  • RQ1勾配符号の推定のみで、マグニチュードに基づく勾配推定と比較して著しく少ないクエリ数で高い敵対的成功が達成可能か?
  • RQ2符号に基づくブラックボックス攻撃は、クエリ効率と回避率の両面で、既存の最先端手法を上回るか?
  • RQ3ハイパーパramータのチューニングやデータ依存の事前知識を回避する方法でも、ブラックボックス攻撃で優れたパフォーマンスを達成可能か?
  • RQ4敵対的攻撃における符号に基づく勾配推定の理論的クエリ複雑度の下限は何か?
  • RQ5ブラックボックス制約下で、符号に基づく攻撃のパフォーマンスは、FGSMのような完全な勾配に基づく手法と比較してどうか?

主な発見

  • SignHunterは、2つの公開ブラックボックス攻撃チャレンジで最高の回避率を達成し、提出されたすべての攻撃を上回った。
  • MNIST、CIFAR10、ImageNetで訓練された標準モデルに対して、10,000クエリの予算下で、最先端手法と比較して失敗率が3.8倍低く、合計クエリ数が2.5倍少なかった。
  • 平均12クエリで標準MNISTモデルを効果的に欺き、FGSM(完全な勾配アクセスを必要とする)を上回る性能を示した。
  • SignHunterはハイパーパramータのチューニングやデータ・タイム依存の事前知識を一切必要とせず、実装が容易で耐障害性に優れている。
  • 代替モデル攻撃に対して保護されたモデルに対しても高いパフォーマンスを維持しており、優れた一般化能力を示した。
  • クエリ数の増加に伴い、推定された勾配符号と真の勾配符号とのハミング類似度が急速に上昇し、効果的な符号回復が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。