Skip to main content
QUICK REVIEW

[論文レビュー] Local Black-box Adversarial Attacks: A Query Efficient Approach

Tao Xiang, Hangcheng Liu|arXiv (Cornell University)|Jan 4, 2021
Adversarial Robustness in Machine Learning参考文献 38被引用数 12
ひとこと要約

本論文は、モデルの解釈可能性と adversarial examples の転送性を活用して、画像の識別的領域にのみ攻撃を向けるクエリ効率の良いブラックボックス攻撃フレームワークを提案する。参照モデルの Grad-CAM を用いてキーフィーチャーを同定し、転送可能な adversarial ノイズで事前摂動することで、クエリコストを最大50%まで削減しながら、限られたクエリ数でも98%を超える高い攻撃成功率を維持する。

ABSTRACT

Adversarial attacks have threatened the application of deep neural networks in security-sensitive scenarios. Most existing black-box attacks fool the target model by interacting with it many times and producing global perturbations. However, global perturbations change the smooth and insignificant background, which not only makes the perturbation more easily be perceived but also increases the query overhead. In this paper, we propose a novel framework to perturb the discriminative areas of clean examples only within limited queries in black-box attacks. Our framework is constructed based on two types of transferability. The first one is the transferability of model interpretations. Based on this property, we identify the discriminative areas of a given clean example easily for local perturbations. The second is the transferability of adversarial examples. It helps us to produce a local pre-perturbation for improving query efficiency. After identifying the discriminative areas and pre-perturbing, we generate the final adversarial examples from the pre-perturbed example by querying the targeted model with two kinds of black-box attack techniques, i.e., gradient estimation and random search. We conduct extensive experiments to show that our framework can significantly improve the query efficiency during black-box perturbing with a high attack success rate. Experimental results show that our attacks outperform state-of-the-art black-box attacks under various system settings.

研究の動機と目的

  • 全ピクセルに摂動を加えるグローバルブラックボックス攻撃における高いクエリコストと視覚的不自然さの問題を解決すること。
  • ホワイトボックスアクセスや高コストのセグメンテーションモデルを必要とせずに、ブラックボックス環境下での局所的 adversarial 攻撃を可能にすること。
  • モデルの解釈可能性と adversarial examples の転送性を活用してクエリ効率を向上させること。
  • 局所的摂動に特化させることで、目立つ摂動を最小限に抑えながら高い攻撃成功率を達成すること。
  • 実世界のAPIベースの脅威シナリオに適用可能な実用的で効率的かつ不審な痕跡を残さないブラックボックス攻撃フレームワークを提供すること。

提案手法

  • ターゲットモデルの内部パrameterにアクセスせずに、参照モデルの Grad-CAM を用いて識別的画像領域を同定する。
  • adversarial examples の転送性を活用し、参照モデル上で事前摂動された例を生成することで、攻撃をターゲットモデルの意思決定境界に近い初期状態に設定する。
  • 事前摂動された例に対して、勾配推定とランダムサーチの2つのクエリベース攻撃手法を用いて最終的な adversarial サンプルを生成する。
  • 識別的領域の局所化と adversarial 事前摂動を組み合わせることで、意思決定境界を越えるために必要なクエリ数を削減する。
  • 複数の参照モデルが利用可能な場合、それらのバイナリマップの和集合を用いて、より頑健な識別的領域を定義する。
  • 修正された更新則を適用する:$\mathbf{x}_{t+1} = \text{clip}(\mathbf{x}_t + \epsilon_1 \cdot (\text{sign}(\nabla_{\mathbf{x}_t}H) \otimes \text{sign}(UBM)))$、ここで $H$ は複数の参照モデルからのログティの集約、$UBM$ はそれらのバイナリマップの和集合である。

実験結果

リサーチクエスチョン

  • RQ1識別的画像領域に限定された局所的摂動は、ブラックボックス攻撃におけるクエリ効率を向上させ得るか?
  • RQ2Grad-CAM などのモデル解釈技術は、参照モデルからターゲットブラックボックス環境に適切に転送可能か?
  • RQ3参照モデルからの adversarial 例を用いてクリーン画像を事前摂動することで、ターゲットモデルをだますために必要なクエリ数を削減できるか?
  • RQ4本手法は、最先端のグローバルブラックボックス攻撃と比較して、クエリ効率および攻撃成功率の面で優れているか?
  • RQ5複数の参照モデルを用いることで、攻撃のクエリ効率と頑健性がさらに向上するか?

主な発見

  • ResNet-50 を参照モデルとして使用した場合、ImageNet でたった 204 クエリで 98% の攻撃成功率を達成し、GRS よりも成功確率とクエリ効率の両面で優れている。
  • ResNet-1000 を参照モデルとして使用した場合、わずか 71 クエリで 100% の成功確率に達し、より優れた参照モデルと併せてスケーラビリティが顕著に向上している。
  • ベースラインのグローバル攻撃と比較して、クエリ数を最大50%まで削減しながらも、高い攻撃成功率を維持している。
  • 弱い参照モデル(ResNet-50)でさえ、426 クエリで 79% の成功率を達成しており、参照モデルの品質に依存しない頑健性を示している。
  • 複数の参照モデルを用いることで、初期段階でターゲットモデルの意思決定境界に近い adversarial 例を生成する確率が上昇し、さらに効率が向上する。
  • 視覚的に優れた摂動を生成しており、従来の局所的攻撃で見られるように、全ピクセルを (255,255,255) に一様に摂動させるような目立つノイズパターンを回避している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。