Skip to main content
QUICK REVIEW

[論文レビュー] Reverse Engineering of Imperceptible Adversarial Image Perturbations

Yifan Gong, Yuguang Yao|arXiv (Cornell University)|Mar 26, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本稿では、クラス判別的ノイズ除去と空間的データ拡張を統合することで、敵対的画像から目に見えない敵対的摂動を回復する、新しいフレームワークであるDeceptionの逆方向設計(RED)を提案する。提案手法CDD-REDは、FGSM、PGD、CW、AutoAttack、および適応的攻撃を含む、複数の評価指標および攻撃タイプにおいて、ベースラインのノイズ除去手法を著しく上回り、摂動回復における優れた汎化性と耐性を示している。

ABSTRACT

It has been well recognized that neural network based image classifiers are easily fooled by images with tiny perturbations crafted by an adversary. There has been a vast volume of research to generate and defend such adversarial attacks. However, the following problem is left unexplored: How to reverse-engineer adversarial perturbations from an adversarial image? This leads to a new adversarial learning paradigm--Reverse Engineering of Deceptions (RED). If successful, RED allows us to estimate adversarial perturbations and recover the original images. However, carefully crafted, tiny adversarial perturbations are difficult to recover by optimizing a unilateral RED objective. For example, the pure image denoising method may overfit to minimizing the reconstruction error but hardly preserve the classification properties of the true adversarial perturbations. To tackle this challenge, we formalize the RED problem and identify a set of principles crucial to the RED approach design. Particularly, we find that prediction alignment and proper data augmentation (in terms of spatial transformations) are two criteria to achieve a generalizable RED approach. By integrating these RED principles with image denoising, we propose a new Class-Discriminative Denoising based RED framework, termed CDD-RED. Extensive experiments demonstrate the effectiveness of CDD-RED under different evaluation metrics (ranging from the pixel-level, prediction-level to the attribution-level alignment) and a variety of attack generation methods (e.g., FGSM, PGD, CW, AutoAttack, and adaptive attacks).

研究の動機と目的

  • 敵対的画像から敵対的摂動を推定するためのDeceptionの逆方向設計(RED)問題を形式化すること。
  • 一般化可能なRED性能を可能にする主な原則(特にクラス判別能力と空間的データ拡張)を同定すること。
  • ピクセル、予測、アトリビューションのレベルでRED性能を測定する包括的な評価パイプラインを構築すること。
  • 未学習の攻撃タイプに対しても一般化できる、デノイザーを支援とするREDフレームワークを構築すること。

提案手法

  • 与えられた敵対的画像から敵対的摂動を推定する逆学習タスクとしてRED問題を形式化する。
  • 摂動回復中に分類に寄与する特徴を保持するために、デノイジングネットワークにクラス判別的損失を統合する。
  • トレーニング中に空間的データ拡張(例:回転、反転)を適用することで、REDモデルの耐性と一般化性能を向上させる。
  • 画像再構成と元の分類器との予測整合性を同時に最適化するCDD-REDフレームワークを設計する。
  • 事前学習済み分類器(例:VGG19)を用いてREDプロセスをガイドし、回復された摂動が敵対的性質を維持することを保証する。
  • ピクセルレベルの再構成誤差、予測レベルの整合性(PA)、およびアトリビューションレベルのサリエンシー領域回復という、多段階の指標を用いてRED性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ノイズ除去ベースのアプローチを用いて、敵対的画像から敵対的摂動を効果的に逆方向設計できるか?
  • RQ2一般化可能なRED性能を達成するために不可欠な設計原則(例:クラス判別性、データ拡張)は何か?
  • RQ3提案手法CDD-REDは、AutoAttack や適応的攻撃といった未観測の攻撃タイプに対してもどれほど一般化できるか?
  • RQ4REDは真の敵対的サリエンシー領域をどれほど正確に回復でき、元のモデルの予測行動をどれほど正確に維持できるか?
  • RQ5学習されたログィット空間相関を用いて、異なる敵対的攻撃タイプ間の関係を推定できるか?

主な発見

  • CDD-REDは、特徴攻撃(Feature Attack)においてベースライン(DS)比で36.51%高い予測整合性(PA)を達成し、適応的攻撃(Adaptive Attack)では27.64%高いPAを示した。
  • 標準攻撃よりもはるかに耐性の高いAutoAttackに対しても、強力な性能を維持しており、複雑で未観測の攻撃タイプに対しても一般化できることを示している。
  • CDD-REDは、すべての評価対象攻撃手法において、ピクセルレベルの再構成と予測レベルの整合性の両面で、標準的ノイズ除去(DO)および空間的拡張付きノイズ除去(DS)を上回った。
  • CDD-REDの推定から得られたログィットの相関行列は、真値と密接に一致しており、敵対的行動および攻撃タイプ間の関係が正確に回復されていることを示している。
  • CDD-REDは、転送可能な攻撃能力を有しており、REDで合成された摂動が効果的な転送攻撃として利用可能であるため、意味的整合性が保たれていることが示された。
  • 敵対者がREDモデルを把握していると仮定される適応的攻撃に対しても、フレームワークは良好に一般化しており、最悪の状況下でも耐性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。