Skip to main content
QUICK REVIEW

[論文レビュー] Intermediate Level Adversarial Attack for Enhanced Transferability

Qian Huang, Zeqi Gu|arXiv (Cornell University)|Nov 20, 2018
Adversarial Robustness in Machine Learning参考文献 19被引用数 4
ひとこと要約

本稿では、ソースモデルの特定の中間層での摂動を最大化するように微調整することで、敵対的例のブラックボックス転送性を向上させるための中間レベル攻撃(ILA)を提案する。複数のモデルに共通する汎用的な特徴を持つ層を標的にすることで、ターゲットモデルの知識を必要とせずに転送成功率を向上させ、CIFAR-10ベンチマークで最先端の転送性を達成した。

ABSTRACT

Neural networks are vulnerable to adversarial examples, malicious inputs crafted to fool trained models. Adversarial examples often exhibit black-box transfer, meaning that adversarial examples for one model can fool another model. However, adversarial examples may be overfit to exploit the particular architecture and feature representation of a source model, resulting in sub-optimal black-box transfer attacks to other target models. This leads us to introduce the Intermediate Level Attack (ILA), which attempts to fine-tune an existing adversarial example for greater black-box transferability by increasing its perturbation on a pre-specified layer of the source model. We show that our method can effectively achieve this goal and that we can decide a nearly-optimal layer of the source model to perturb without any knowledge of the target models.

研究の動機と目的

  • 既存の敵対的攻撃がソースモデルのアーキテクチャに過剰適合するという限界を是正し、ブラックボックス転送性を向上させること。
  • 特に、共通で汎用的な特徴を持つ中間層に摂動を加えることで、多様なモデル間での転送性が向上するかどうかを調査すること。
  • ハイパーパramータチューニング中にターゲットモデルの評価を必要とせずに、攻撃に最適な中間層を選択する手法を開発すること。
  • 中間層内の高分散チャンネルに焦点を当てることで、共有される情報に干渉し、転送性がさらに向上することを実証すること。

提案手法

  • 元の摂動方向を維持しつつ、指定された中間層での活性化差のL2ノルムを最大化する反復的最適化目的関数を定式化する。
  • 正規化された摂動の大きさと元の摂動方向とのコサイン類似度の重み付き和として損失関数を定義し、構造的一致性を確保する。
  • 事前に生成された敵対的例に対して、反復的勾配更新を用いて選択された層での摂動を微調整する形で攻撃を適用する。
  • 層出力を個々のチャンネル出力に置き換えることでチャンネルレベルの標的指定を可能とし、攻撃に最も情報の多いチャンネルを選択できるようにする。
  • データセット全体におけるチャンネル活性化の分散を用いて、複数のモデルに共通する可能性の高い高情報チャンネルを特定するための代理指標とする。
  • ハイパーパramータ探索中にターゲットモデルの評価を回避するため、ソースモデルの層の摂動統計のみを用いて最適な層を選択する。

実験結果

リサーチクエスチョン

  • RQ1最終層に焦点を当てる標準的攻撃と比較して、ソースモデルの中間層に標的を定めることで、敵対的例のブラックボックス転送性が向上するか?
  • RQ2多様なターゲットモデルにわたってより高い転送性をもたらすような、特定の中間層が存在するか?
  • RQ3ターゲットモデルの評価を一切行わずに、ソースモデルの内部統計のみを用いて最適な層を特定できるか?
  • RQ4中間層内の高分散チャンネルに標的を定めることで、共有されやすい汎用的特徴を攪乱することで、さらに転送性が向上するか?
  • RQ5ILA損失関数の方向維持成分は、微調整された敵対的例のロバスト性および転送性にどのように影響するか?

主な発見

  • ILAは複数のソース・ターゲットモデルの組み合わせにおいてブラックボックス転送性を顕著に向上させ、ベースライン攻撃と比較して平均で最大10.5パーセンテージポイントの上昇を達成した。
  • ResNet18をソースモデルとして用いた場合、ILAはGoogLeNetに対して55.9%の攻撃成功率を達成したのに対し、標準的I-FGSMでは47.3%にとどまり、8.6パーセンテージポイントの向上を示した。
  • 活性化分散が最も高い情報量の多いチャンネルに標的を定めた場合、ILAで生成された敵対的例はGoogLeNetで34.5%の攻撃成功率を示し、低分散チャンネル攻撃を上回った。
  • 攻撃に最適な層は、通常ネットワークの中盤に位置し、特徴表現がまだモデル間で一般化可能で共通している層であることが一貫して確認された。
  • ハイパーパramータチューニング中にターゲットモデルの評価を一切行わず、ソースモデルの層の摂動曲線のみを用いても、近似的に最適な層を効果的に同定できた。
  • 損失関数の方向維持成分のおかげで、微調整された敵対的例は元の敵対的構造を保持しており、ソースモデルにおける性能の劣化を防いでいる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。