Skip to main content
QUICK REVIEW

[論文レビュー] Improving Adversarial Transferability via Neuron Attribution-Based Attacks

Jianping Zhang, Weibin Wu|arXiv (Cornell University)|Mar 31, 2022
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿では、完全なニューロン帰属割り当てを用いてより正確なニューロン重要度推定を実現することで、転送性を向上させる、新しい特徴レベル転送ベースの adversarial 攻撃である Neuron Attribution-based Attack (NAA) を提案する。効率的な帰属割り当ての近似と、モデル出力への寄与度に基づくニューロンの重み付けにより、NAA は複数のベンチマークで最先端の転送性を達成し、既存手法を顕著に上回る性能を示す。

ABSTRACT

Deep neural networks (DNNs) are known to be vulnerable to adversarial examples. It is thus imperative to devise effective attack algorithms to identify the deficiencies of DNNs beforehand in security-sensitive applications. To efficiently tackle the black-box setting where the target model's particulars are unknown, feature-level transfer-based attacks propose to contaminate the intermediate feature outputs of local models, and then directly employ the crafted adversarial samples to attack the target model. Due to the transferability of features, feature-level attacks have shown promise in synthesizing more transferable adversarial samples. However, existing feature-level attacks generally employ inaccurate neuron importance estimations, which deteriorates their transferability. To overcome such pitfalls, in this paper, we propose the Neuron Attribution-based Attack (NAA), which conducts feature-level attacks with more accurate neuron importance estimations. Specifically, we first completely attribute a model's output to each neuron in a middle layer. We then derive an approximation scheme of neuron attribution to tremendously reduce the computation overhead. Finally, we weight neurons based on their attribution results and launch feature-level attacks. Extensive experiments confirm the superiority of our approach to the state-of-the-art benchmarks.

研究の動機と目的

  • 既存の特徴レベル転送ベース攻撃におけるニューロン重要度推定の不正確さによる転送性の制限を是正すること。
  • 深層ニューラルネットワークの中間層におけるニューロン重要度をより正確に測定する手法を開発すること。
  • 完全なニューロン帰属割り当ての計算コストを著しく削減する効率的な近似を設計し、計算コストを抑えつつ精度を維持すること。
  • 特徴レベル攻撃において、帰属割り当てに基づくニューロン重みを活用することで、ブラックボックス設定における adversarial 例の転送性を向上させること。

提案手法

  • 本手法は、中間層の各ニューロンにモデル出力への寄与値を割り当てることで、完全性と正確性を確保する完全なニューロン帰属割り当てを用いる。
  • 完全なニューロン帰属割り当ての計算コストを著しく削減する近似スキームを導入し、実用的導入を可能にする。
  • ニューロン帰属割り当てを、その符号と大きさに基づき正の寄与と負の寄与に分離する。
  • 攻撃は、正負の寄与の重み付き組み合わせを最小化するように設計され、両極性に等しい重みが与えられる。
  • 重み付き特徴マップを摂動させることで、複数のモデル間で転送性を保持する adversarial 例を生成する。
  • 浅い層や深い層に過剰に適合しないよう、中間層(例:Mix4a/Mix5b)にアプローチを適用する。

実験結果

リサーチクエスチョン

  • RQ1特徴レベル攻撃において、既存手法に比べてニューロン帰属割り当てがより正確かつ完全なニューロン重要度測定を可能にするか。
  • RQ2ニューロン帰属割り当ての近似が攻撃の効率性と転送性に与える影響は何か。
  • RQ3ネットワーク内のどの層が、転送性の観点から特徴レベル攻撃において最も効果的か。
  • RQ4転送可能な adversarial 例を生成するための、正負のニューロン帰属割り当ての最適なバランスは何か。
  • RQ5帰属割り当て値の変換関数を異なる関数で変更した場合、攻撃性能にどのような影響を与えるか。

主な発見

  • NAA は ImageNet ベンチマークで最先端の転送性を達成し、NRDM や FDA や FIA といった既存の特徴レベル攻撃を顕著に上回る。
  • 中間層(例:Mix4a/Mix5b)を攻撃対象とすることで、浅い層や深い層よりも高い転送性が得られ、ソースモデルの特徴に過剰に適合するのを回避できる。
  • 統合ステップ数(n)を増やすことで転送性が向上し、n=30 が性能と計算コストのバランスにおいて良好なトレードオフを示す。
  • γ=1 に設定した場合、正負の帰属割り当てに等しい重みを割り当てた結果、攻撃成功率が最高に達し、両極性が重要であることが示された。
  • 帰属割り当て値(fp および fn)に線形関数を用いることで最良の性能が得られ、高値または低値に偏った重み付けが不要であることが示された。
  • 線形変換とバランスの取れた帰属割り当て重み付けの組み合わせが、防御なしモデルおよび adversarially 訓練済みモデルの両方で最高の平均攻撃成功率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。