Skip to main content
QUICK REVIEW

[論文レビュー] Detection Defense Against Adversarial Attacks with Saliency Map

Dengpan Ye, Chuanxi Chen|arXiv (Cornell University)|Sep 6, 2020
Adversarial Robustness in Machine Learning参考文献 45被引用数 6
ひとこと要約

本論文は、解釈可能性を向上させるとともに予測の不一致を用いて敵対的摂動を検出するため、類似マップを活用した新たな検出防御を提案する。色反転やゼロ平均などの追加ノイズ技術と組み合わせることで、ImageNetおよびCIFAR-10においてFGSMおよびC&W攻撃に対して90%を超える検出精度を達成し、主要ベンチマークで最先端の特徴圧縮を上回る性能を示した。

ABSTRACT

It is well established that neural networks are vulnerable to adversarial examples, which are almost imperceptible on human vision and can cause the deep models misbehave. Such phenomenon may lead to severely inestimable consequences in the safety and security critical applications. Existing defenses are trend to harden the robustness of models against adversarial attacks, e.g., adversarial training technology. However, these are usually intractable to implement due to the high cost of re-training and the cumbersome operations of altering the model architecture or parameters. In this paper, we discuss the saliency map method from the view of enhancing model interpretability, it is similar to introducing the mechanism of the attention to the model, so as to comprehend the progress of object identification by the deep networks. We then propose a novel method combined with additional noises and utilize the inconsistency strategy to detect adversarial examples. Our experimental results of some representative adversarial attacks on common datasets including ImageNet and popular models show that our method can detect all the attacks with high detection success rate effectively. We compare it with the existing state-of-the-art technique, and the experiments indicate that our method is more general.

研究の動機と目的

  • 安全で重要なアプリケーションにおいて誤分類を引き起こす、目に見えない敵対的摂動に対する深層ニューラルネットワークの脆弱性を是正すること。
  • モデルの再トレーニングやアーキテクチャの変更を必要としない、一般的で侵入性のない検出防御を開発すること。
  • 類似マップによる可視化により、元の入力と摂動を加えた入力の間の不一致を検出することで、モデルの解釈可能性を向上させること。
  • ImageNetおよびCIFAR-10などの標準データセット上で、FGSM、C&W、OSPAを含む多様な敵対的攻撃に対して、検出の頑健性を向上させること。
  • 攻撃に特化したチューニングを要する従来の特徴圧縮防御の代替として、より一般的で効果的な選択肢を提供すること。

提案手法

  • 分類活性マッピング(CAM)を用いて、モデルの予測に最も影響を与える画像領域を強調する類似マップを生成する。
  • 元の入力とノイズを追加した変更版(例:色反転やゼロ平均)との間のモデル出力を比較することで、敵対的例における乖離を顕著にする予測の不一致を導入する。
  • 防御フレームワークは、元の入力と摂動を加えた入力の間の予測の乖離を評価し、高い不一致は敵対的例の可能性を示す。
  • 類似マップを用いてモデルの注目領域に焦点を当てることで、検出プロセスを支援し、解釈可能性と検出感度を向上させる。
  • 類似マップ解析とノイズ注入技術を組み合わせることで、クリーンな入力と敵対的入力の間の特徴活性化パターンの微細な差を顕著にする。
  • 検出性能は、成功確率と元の入力の精度を用いて、標準データセット(ImageNet、CIFAR-10)およびモデル(VGG16)を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1モデルアーキテクチャの変更や再トレーニングなしに、類似マップに基づく解釈可能性を敵対的例の検出に活用できるか?
  • RQ2元の入力とノイズ摂動を加えた入力の間の予測の不一致は、多様な敵対的攻撃に対して検出の頑健性を向上させるか?
  • RQ3本手法は、検出精度および異なる攻撃タイプへの一般化の観点から、特徴圧縮と比較してどうなるか?
  • RQ4色反転やゼロ平均などの単純なノイズ変換と類似マップを組み合わせることで、検出性能を向上させつつ、クリーンな入力の精度を維持できるか?
  • RQ5本手法は、特にブラックボックスまたは実世界のシナリオにおいて、攻撃に特化した防御(例:特徴圧縮)よりも一般性が高いとされるか?

主な発見

  • 色反転(θ=0.1)を用いた類似マップでは、OSPA攻撃で94.3%、FGSM攻撃で69.5%、C&W2攻撃で47.8%の検出成功率を達成した。
  • ゼロ平均ノイズを用いることで、OSPAで93.7%、FGSMで82.8%、C&W2で69.6%の検出成功率を達成し、特徴圧縮を上回る優れた性能を示した。
  • VGG16モデルでは、クリーンなImageNet入力に対して93%を超える精度を維持しながら、敵対的例を効果的に検出できた。
  • 類似マップとゼロ平均ノイズ(θ=0.1)の最適な組み合わせは、最高の特徴圧縮設定(5ビット、2×2メディアン、11-3-4非局所フィルタリング)を上回り、検出精度とクリーンな入力の保持の両面で優れた性能を示した。
  • 本手法は、勾配ベースの攻撃(FGSM、C&W)および物理世界の攻撃(OSPA)を含む多様な攻撃タイプに一般化可能であることが示され、広範な適用可能性を示した。
  • 結果から、解釈可能性を基盤とする類似マップによる検出は、攻撃タイプに特化したチューニングを要する特徴圧縮よりも頑健で一般性に優れていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。