[論文レビュー] Regional Homogeneity: Towards Learning Transferable Universal Adversarial Perturbations Against Defenses
本稿では、敵対的摂動における領域均一性を活用することで、防御モデルに対する転送可能なユニバーサル敵対的攻撃を生成する新規手法、領域均一摂動(RHP)を提案する。軽量な勾配変換モジュールを用い、過小適合を誘発することで、明示的なユニバーサル損失を用いずにユニバーサル摂動を生成する。9つの防御モデルに対して平均14.0%の精度低下を達成し、最先端手法を最大19.2%上回る性能を発揮した。
This paper focuses on learning transferable adversarial examples specifically against defense models (models to defense adversarial attacks). In particular, we show that a simple universal perturbation can fool a series of state-of-the-art defenses. Adversarial examples generated by existing attacks are generally hard to transfer to defense models. We observe the property of regional homogeneity in adversarial perturbations and suggest that the defenses are less robust to regionally homogeneous perturbations. Therefore, we propose an effective transforming paradigm and a customized gradient transformer module to transform existing perturbations into regionally homogeneous ones. Without explicitly forcing the perturbations to be universal, we observe that a well-trained gradient transformer module tends to output input-independent gradients (hence universal) benefiting from the under-fitting phenomenon. Thorough experiments demonstrate that our work significantly outperforms the prior art attacking algorithms (either image-dependent or universal ones) by an average improvement of 14.0% when attacking 9 defenses in the transfer-based attack setting. In addition to the cross-model transferability, we also verify that regionally homogeneous perturbations can well transfer across different vision tasks (attacking with the semantic segmentation task and testing on the object detection task). The code is available here: https://github.com/LiYingwei/Regional-Homogeneity.
研究の動機と目的
- 最先端の防御モデルに対する転送可能な敵対的例を生成する課題に対処すること。
- 既存のユニバーサル攻撃が防御に対して効果的に転送できない理由を解明し、敵対的摂動における構造的差異を同定すること。
- 勾配変換モジュールの過小適合によって、本質的にユニバーサル摂動を生成する手法を開発すること。
- 提案手法のモデル間およびタスク間の転送性を検証すること。
- 領域均一摂動が、標準的なノイズ型または画像依存型摂動よりも防御に対してより効果的であることを示すこと。
提案手法
- 勾配変換モジュールを用いて、標準的な敵対的摂動を領域均一型に変換するパラダイムを提案する。
- 3×3畳み込み層とK個の領域パーティションを用い、合計12 + 2Kの学習可能なパラメータを持つ軽量な勾配変換モジュールを設計する。
- 過小適合(高バイアス、低分散)を誘発するように勾配変換モジュールを訓練することで、入力に依存しない勾配が得られ、結果としてユニバーサル摂動が生成される。
- 垂直、水平、グリッド、スラッシュなどの領域分割関数を用い、摂動空間における局所的相関構造を定義する。
- 訓練済みの変換モジュールを用いて、明示的なユニバーサル性の制約なしにユニバーサル敵対的例を生成する。
- セグメンテーションから検出へのタスク間攻撃を含め、モデルおよびタスク間での転送性を評価する。
実験結果
リサーチクエスチョン
- RQ1なぜ標準的なユニバーサル敵対的摂動は防御モデルに対して効果的に転送されないのか?
- RQ2敵対的摂動における領域均一性を活用することで、防御に対する転送性を向上させられるか?
- RQ3過小適合で訓練された勾配変換モジュールは、明示的なユニバーサル損失なしに自然にユニバーサル敵対的摂動を生成するか?
- RQ4領域均一摂動は、セグメンテーションから検出への異なるビジョンタスク間でも転送可能か?
- RQ5提案手法は、防御モデル上で既存のユニバーサルおよび画像依存型攻撃手法と定量的に比較してどのように優れているか?
主な発見
- RHPは、転送ベースの設定下で9つの防御モデルを攻撃した際、先行研究比平均14.0%の攻撃成功率向上を達成した。
- RHPは、SOTAのユニバーサル攻撃UAPに対して19.2%、GAPに対して15.6%のトップ1誤差率改善で上回った。
- RHPは画像依存型攻撃に対しても優位である:FGSMに対して12.9%、MIMに対して12.6%、DIMに対して9.58%の改善を示した。
- RHPは強力なタスク間転送性を示し、セグメンテーションモデルを攻撃した際、Faster R-CNNのmAPを69.2から31.6まで低下させた。
- 異なる領域分割関数(グリッド、スラッシュなど)は同等の転送性を示し、定性的な証拠から、異なる低レベルの視覚的パターンを標的としていることが示唆された。
- 勾配変換モジュールは、明示的なユニバーサル損失や最適化を用いずに、過小適合によって偶然的にユニバーサルな振る舞いを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。