Skip to main content
QUICK REVIEW

[論文レビュー] Decision-based Black-box Attack Against Vision Transformers via Patch-wise Adversarial Removal

Yucheng Shi, Yahong Han|arXiv (Cornell University)|Dec 6, 2021
Adversarial Robustness in Machine Learning被引用数 13
ひとこと要約

この論文は、領域固有のノイズ感受性に基づいて、適応的にアドバーシャルノイズのパッチを1パッチずつ除去することで、ビジョントランスフォーマー(ViTs)に対するノイズ圧縮効率を向上させる意思決定ベースのブラックボックス攻撃であるPatch-wise Adversarial Removal(PAR)を提案する。PARは、ベースライン手法と比較してはるかに低い摂動量と少ないクエリ数で効果を発揮し、ViTsおよびCNNsの両方において他の攻撃の初期化に用いることで、さらなる効率向上が可能である。

ABSTRACT

Vision transformers (ViTs) have demonstrated impressive performance and stronger adversarial robustness compared to Convolutional Neural Networks (CNNs). On the one hand, ViTs' focus on global interaction between individual patches reduces the local noise sensitivity of images. On the other hand, the neglect of noise sensitivity differences between image regions by existing decision-based attacks further compromises the efficiency of noise compression, especially for ViTs. Therefore, validating the black-box adversarial robustness of ViTs when the target model can only be queried still remains a challenging problem. In this paper, we theoretically analyze the limitations of existing decision-based attacks from the perspective of noise sensitivity difference between regions of the image, and propose a new decision-based black-box attack against ViTs, termed Patch-wise Adversarial Removal (PAR). PAR divides images into patches through a coarse-to-fine search process and compresses the noise on each patch separately. PAR records the noise magnitude and noise sensitivity of each patch and selects the patch with the highest query value for noise compression. In addition, PAR can be used as a noise initialization method for other decision-based attacks to improve the noise compression efficiency on both ViTs and CNNs without introducing additional calculations. Extensive experiments on three datasets demonstrate that PAR achieves a much lower noise magnitude with the same number of queries.

研究の動機と目的

  • ビジョントランスフォーマー(ViTs)に対する既存の意思決定ベースのブラックボックス攻撃が非効率である理由を解消する。これは、ノイズ感受性が領域によって異なるにもかかわらず、すべての画像領域を均一に扱うためである。
  • ViTsのパッチ単位のアーキテクチャと全体的なノイズ感受性の低さのため、Boundary Attackのような現在の攻撃がViTsにおけるノイズ圧縮に限界を示す理由を分析する。
  • 動的に感受性の高い画像パッチを選択し、ノイズを圧縮することで圧縮効率を向上させる、新しい意思決定ベースの攻撃、Patch-wise Adversarial Removal(PAR)を設計する。
  • PARが他の意思決定ベースの攻撃のための有効なノイズ初期化手法として機能できることを示し、ViTsおよびCNNsの両方において、追加の計算コストなしに性能を向上させることを目的とする。

提案手法

  • PARは入力画像を重複のないパッチに分割し、粗いから細かいスケールへの探索を段階的に実行することで、ノイズ感受性の推定を精緻化する。
  • 2つのマスクを維持する:1つは各パッチのノイズ量を追跡するためのもので、もう1つはクエリフィードバックに基づいて各パッチのノイズ感受性を推定するためのものである。
  • 各ステップで、クエリ値が最も高いパッチ(感受性が高いために成功確率が高いため)を選択し、ノイズ圧縮を実行する。
  • 選択されたパッチに対して、意思決定ベースの最適化戦略を用いて反復的にノイズ圧縮を実行し、最小パッチサイズに達するか攻撃に成功するまで繰り返す。
  • ViTsの構造的特性(個々のパッチ内のノイズが最終分類に与える影響が小さい)を活用し、感受性の低い領域での無駄なクエリを回避することで、感受性の高い領域に注力する。
  • PARは他の意思決定ベースの攻撃のノイズ初期化手法としても利用可能であり、初期点を改善し、全体の圧縮効率を向上させることができる。

実験結果

リサーチクエスチョン

  • RQ1なぜ、アドバーシャルロバストネスが強いにもかかわらず、既存の意思決定ベースのブラックボックス攻撃はビジョントランスフォーマー(ViTs)に対しては性能を発揮しないのか?
  • RQ2ViTsにおけるノイズ感受性は、画像の異なる領域でどのように変動するのか? そして、その変動をどのように活用して攻撃効率を向上させられるか?
  • RQ3パッチ単位で感受性に配慮したノイズ除去戦略は、ViTsに対する意思決定ベースの攻撃において、均一なノイズ圧縮と比較して優れているか?
  • RQ4PARを初期化手法として用いることで、他の意思決定ベースの攻撃の性能はどの程度向上するか?
  • RQ5圧縮効率とクエリコストのバランスを考慮した場合、PARの最適な最小パッチサイズは何か?

主な発見

  • PARは、ImageNet-2012においてBoundary Attackと比較して、中央値のアドバーシャル摂動量を最大78%まで低減し、わずか60クエリでL2ノルム2.218を達成した。
  • 初期化手法として用いた場合、ImageNet-2012ではBoundary Attackの平均ノイズ量を8.134から4.335に、ImageNet-21kでは15.687から8.55に削減した。
  • 同じクエリ予算内において、PARは1クエリあたり0.673のノイズ単位の圧縮効率を達成し、Evo(0.035)とBoundary(0.040)を大きく上回った。
  • PARを初期化手法として用いることで、Sign-OPT、SurFree、CAB攻撃の平均ノイズ量がImageNet-2012で最大75%まで削減された。
  • 最小パッチサイズを1に設定しても、PARは高い効率を維持するが、クエリコストが顕著に増加するため、解像度と効率のトレードオフが生じていることが示された。
  • 時間コスト分析では、PARは1クエリあたり0.037秒の高い効率を示し、他の攻撃の初期化に用いることで、わずかな追加計算コストで全体の圧縮効率を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。