Skip to main content
QUICK REVIEW

[論文レビュー] Imperceptible Adversarial Examples for Fake Image Detection

Quanyu Liao, Yuezun Li|arXiv (Cornell University)|Jun 3, 2021
Adversarial Robustness in Machine Learning参考文献 19被引用数 4
ひとこと要約

本稿では、複数の畳み込み層の特徴マップを用いて特定された最も重要なピクセルに焦点を当てることで、人間の目にはほとんど感知されない悪意ある例を生成する、新たな手法であるキーリージョントラブル(KRA)を提案する。KRAは摂動の$L_0$および$L_2$ノルムを最小化することで、従来の手法と比較して著しく感知されにくく、同時に最先端の攻撃成功率を達成する。

ABSTRACT

Fooling people with highly realistic fake images generated with Deepfake or GANs brings a great social disturbance to our society. Many methods have been proposed to detect fake images, but they are vulnerable to adversarial perturbations -- intentionally designed noises that can lead to the wrong prediction. Existing methods of attacking fake image detectors usually generate adversarial perturbations to perturb almost the entire image. This is redundant and increases the perceptibility of perturbations. In this paper, we propose a novel method to disrupt the fake image detection by determining key pixels to a fake image detector and attacking only the key pixels, which results in the $L_0$ and the $L_2$ norms of adversarial perturbations much less than those of existing works. Experiments on two public datasets with three fake image detectors indicate that our proposed method achieves state-of-the-art performance in both white-box and black-box attacks.

研究の動機と目的

  • 全画像に摂動を適用する従来の悪意ある攻撃手法が引き起こす感知可能性の増加と計算コストの増大という限界を是正すること。
  • 悪意ある摂動の$L_0$および$L_2$ノルムを同時に低減させることで、より感知されにくくすること。
  • 偽物検出器が分類に依存している最も意味的に関連性の高いピクセルのみを特定し、標的とすること。
  • さまざまな攻撃手法(例:FGSM、DeepFool)を統合できる柔軟なフレームワークを構築し、効率的かつ効果的な回避を実現すること。
  • 白ボックスおよびブラックボックスの両設定において高い攻撃成功率を達成するとともに、感知されにくさを維持すること。

提案手法

  • KRAは、複数の畳み込み層からのヒートマップを統合することで、検出に不可欠な領域を特定する、マルチレイヤーキーセマンティックリージョントリビューション(MLSKRS)を用いてキーピクセルを特定する。
  • MLSKRSは、浅い層および深い層の両方の空間的および勾配情報を利用し、キーピクセルのコンactで高効果なマスク$\mathcal{M}$を生成する。
  • 本手法は攻撃問題を再定式化し、$||r||_2 + ||\mathcal{M}||_0$の最小化を目指す。ここで$r$は摂動、$\mathcal{M}$はキーピクセルの集合である。これにより、スパarsityと低歪みが保証される。
  • KRAは、標準的な悪意ある攻撃手法(例:PGD、DeepFool)を統合するコンテナとして設計されており、選択されたキーピクセル上でのみ摂動を生成する。
  • フレームワークはマスクされたキーリージョントリビューションでのみ勾配最適化を実行するため、変更されるピクセル数と計算コストが著しく削減される。
  • 閾値処理戦略を用い、パラメータ$t_\alpha = 0.8$、$t' = 0.1$、および$\beta = 0.1$を用いて最終的なキーピクセルマスクを最適化する。

実験結果

リサーチクエスチョン

  • RQ1わずかなキーピクセルのセットにのみ攻撃を適用することで、偽物画像検出を著しく攪乱させつつ、感知されにくさを最小限に抑えることができるか?
  • RQ2複数の畳み込み層からの特徴マップを組み合わせることで、最終層のみを用いる場合と比較して、キーピクセル検出の正確性とスパarsityが向上するか?
  • RQ3摂動の$L_0$および$L_2$ノルムを両方低減させることで、攻撃成功率を損なわず、より感知されにくくなる悪意ある例が得られるか?
  • RQ4提案手法はブラックボックス攻撃の状況でも高い転送性を示すか?
  • RQ5PGD、DeepFoolなどの異なる攻撃アルゴリズムをキーピクセルに制限して統合した場合、性能にどのような影響を与えるか?

主な発見

  • KRAは、白ボックス攻撃において最先端の攻撃成功率を達成し、3つの偽物検出器(Xception、Inception-v3、ResNet)の精度を0.01未満にまで低下させた。
  • KRAが生成する摂動の$L_2$ノルムは、PGDベースの攻撃と比較して10倍小さく、$L_2$を最小化するベースラインと比較して100倍小さくなった。
  • KRAの摂動の$L_0$ノルムは、$L_0$ベースの攻撃手法と比較して10倍も低く、著しくスパースな摂動であることが示された。
  • ブラックボックス攻撃では、KRAは攻撃転送比(ATR)が50% ± 15%の範囲に保たれ、優れた一般化性能を示した。
  • 定性的な結果から、摂動がキーリージョントリビューションにのみ局在しており、ヒトの観察者にとってもほとんど感知されないことが確認された([0,255]に正規化された場合でも同様)。
  • 本手法は、摂動を意味のある小さなピクセルサブセットに制限することで、計算コストと感知されにくさの両方を著しく低減させ、高い効率性を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。