Skip to main content
QUICK REVIEW

[論文レビュー] CorrAttack: Black-box Adversarial Attack with Structured Search

Zhichao Huang, Yao‐Wei Huang|arXiv (Cornell University)|Oct 3, 2020
Adversarial Robustness in Machine Learning参考文献 30被引用数 6
ひとこと要約

CorrAttackは、時間変動する文脈的バンディットを用いた構造的探索により、スコアベースのブラックボックス敵対的攻撃を実現し、画像ブロックを特徴量でモデル化することでベイジアン最適化を効率的に駆動し、高い成功率と高いクエリ効率を達成する。ImageNetおよびGoogle Cloud Vision APIにおいて、従来の手法(BayesOptやBayes-Attackを含む)を上回る最先端のクエリ効率と成功率を達成している。

ABSTRACT

We present a new method for score-based adversarial attack, where the attacker queries the loss-oracle of the target model. Our method employs a parameterized search space with a structure that captures the relationship of the gradient of the loss function. We show that searching over the structured space can be approximated by a time-varying contextual bandits problem, where the attacker takes feature of the associated arm to make modifications of the input, and receives an immediate reward as the reduction of the loss function. The time-varying contextual bandits problem can then be solved by a Bayesian optimization procedure, which can take advantage of the features of the structured action space. The experiments on ImageNet and the Google Cloud Vision API demonstrate that the proposed method achieves the state of the art success rates and query efficiencies for both undefended and defended models.

研究の動機と目的

  • モデルスコアのみが利用可能で完全なモデルアクセスが得られない状況における、効率的なブラックボックス敵対的攻撃の課題に対処すること。
  • モデルの類似性に依存する転送ベース攻撃の限界を克服し、性質の異なるネットワーク間で低転送性を示す問題を解決すること。
  • 画像ブロックの局所的相関性とスロー・ヴァリィング特性を活用することで、スコアベース攻撃のクエリ効率と成功率を向上させること。
  • 高次元の勾配推定を回避する低次元のブロック特徴に焦点を当てることで、従来のベイジアン最適化手法よりも高速な最適化を実現するスケーラブルな手法の開発。

提案手法

  • 各画像ブロックを特徴量を有するアームとして扱う時間変動する文脈的バンディット問題として、スコアベース敵対的攻撃を定式化する。
  • ブロック特徴量上でのガウス過程回帰を用いて報酬(損失低減)をモデル化し、構造的アクション空間における効率的なベイジアン最適化を可能にする。
  • 繰り返し攻撃ステップにおける時間変動する報酬関数に適応するため、ガウス過程に忘れらる戦略を組み込む。
  • 空間的位置や局所的勾配パターンなどのブロックレベル特徴量を用いて、将来の報酬を推定し、アクション選択をガイドする。
  • 局所的相関性とスロー・ヴァリィングな報酬ダイナミクスを活用するために、アクション空間を画像ブロックに制限し、学習効率を向上させる。
  • 構造的特徴量を用いたベイジアン最適化を適用し、期待される報酬低減が最大となるブロックを優先して選択することで、クエリ数を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1画像ブロックにおける構造的探索は、ランダム探索や座標単位探索と比較して、ブラックボックス敵対的攻撃におけるクエリ効率を向上させるか?
  • RQ2画像ブロックの特徴量を用いて報酬関数をモデル化することで、敵対的攻撃におけるベイジアン最適化の性能がどのように向上するか?
  • RQ3バンディット問題の時間変動性が標準的なベイジアン最適化の有効性に与える影響はどの程度で、どのように緩和できるか?
  • RQ4CorrAttackは、BayesOpt、Bayes-Attack、ZOOといった最先端の手法と比較して、標準的および防御付きモデルにおいて性能と効率で優れているか?
  • RQ5提案手法は、クエリコストが高く、モデル挙動が未知の現実世界のブラックボックスAPI(例:Google Cloud Vision)においても、高い成功率を達成できるか?

主な発見

  • CorrAttack ${}_{\text{Flip}}$ は、ImageNetにおけるResNet50に対する非ターゲット攻撃で平均1,036クエリで79.15%の成功率を達成し、すべてのベースラインを上回った。
  • Google Cloud Vision APIでは、CorrAttack ${}_{\text{Flip}}$ が平均155クエリで80.00%の成功率を達成し、NAttack(70.00%)やBayesOpt(30.00%)を著しく上回った。
  • 防御付きモデル(ResNeXt DenoiseAll)では、10枚の画像に対して平均206クエリで60.00%の成功率を達成し、BayesOptおよびBayes-Attackを上回った。
  • アブレーションスタディの結果、ブロック特徴量の次元削減にPCAを用いることで攻撃効率が向上し、特徴表現の重要性が裏付けられた。
  • CorrAttackは、さまざまな摂動予算($\varepsilon = 0.04$, $0.05$, $0.06$)においても優れた性能を維持しており、攻撃強度の変動に対してロバストであることが示された。
  • 従来のベイジアン最適化手法(BayesOptやBayes-Attack)が1,000枚の画像を攻撃するのに数万時間かかることを考慮すると、低次元特徴に基づく最適化により、CorrAttackは著しく高速であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。