Skip to main content
QUICK REVIEW

[論文レビュー] Improved Detection of Adversarial Images Using Deep Neural Networks

Yutong Gao, Yi Pan|arXiv (Cornell University)|Jul 10, 2020
Adversarial Robustness in Machine Learning参考文献 21被引用数 6
ひとこと要約

本稿では、中間特徴マップにウィーナーフィルタを適用することで、多様な攻撃タイプにわたる敵対的画像を検出する軽量な防御手法「特徴マップノイズ除去」を提案する。この手法は、再訓練を必要とせず、最小限の計算コストで任意の事前学習済み深層ニューラルネットワークに適用可能であり、高い検出精度を達成する。

ABSTRACT

Machine learning techniques are immensely deployed in both industry and academy. Recent studies indicate that machine learning models used for classification tasks are vulnerable to adversarial examples, which limits the usage of applications in the fields with high precision requirements. We propose a new approach called Feature Map Denoising to detect the adversarial inputs and show the performance of detection on the mixed dataset consisting of adversarial examples generated by different attack algorithms, which can be used to associate with any pre-trained DNNs at a low cost. Wiener filter is also introduced as the denoise algorithm to the defense model, which can further improve performance. Experimental results indicate that good accuracy of detecting the adversarial examples can be achieved through our Feature Map Denoising algorithm.

研究の動機と目的

  • 高精度応用分野における深層ニューラルネットワーク(DNN)の敵対的例に対する脆弱性を解消すること。
  • 再訓練を必要とせず、任意の事前学習済みDNNに普遍的に適用可能な防御メカニズムを開発すること。
  • FGSM、PGD、AutoAttackを含む多様な敵対的攻撃アルゴリズムに対して、検出のロバスト性を向上させること。
  • 混合敵対的データセットにおける高い検出精度を維持しながら、計算コストを最小限に抑えること。

提案手法

  • 事前学習済みDNNの中間特徴マップに適用する後処理技術として、特徴マップノイズ除去を提案する。
  • 敵対的摂動がしばしば高周波数ノイズを引き起こすという事実を活用し、ウィーナーフィルタを用いて特徴マップをノイズ除去する。
  • 元の特徴マップと復元された特徴マップの再構成誤差を、敵対的入力の検出スコアとして用いる。
  • 微調整や再学習を必要とせず、推論時におけるプラグインモジュールとして統合する。
  • 再構成誤差に基づいて自然入力と敵対的入力を区別する簡単な分類器を学習する。
  • 複数の攻撃アルゴリズムから得た敵対的例を含む混合データセット上で、手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1再訓練を必要とせず、アーキテクチャに依存しない軽量な手法が、多様な攻撃タイプにわたって敵対的例を検出可能か?
  • RQ2特徴マップ再構成に基づくウィーナーフィルタの効果は、敵対的入力と自然入力を区別するためにどれほど有効か?
  • RQ3評価時に使用されていない未確認の攻撃に対し、特徴マップノイズ除去はどの程度一般化可能か?
  • RQ4提案手法における検出精度と計算コストのトレードオフはいかほどか?
  • RQ5最小限の修正で、任意の事前学習済みDNNに効果的に適用可能か?

主な発見

  • 特徴マップノイズ除去は、複数の攻撃アルゴリズムから得た敵対的例を含む混合データセットにおいて、高い検出精度を達成する。
  • FGSM、PGD、AutoAttackを含むさまざまな攻撃タイプにわたり、攻撃固有のチューニングを必要とせず、良好な一般化性能を示す。
  • ウィーナーフィルタは、特徴マップ内の敵対的ノイズを効果的に抑制することで、検出性能を顕著に向上させる。
  • 計算コストが最小限に抑えられるため、リソース制約のある環境におけるリアルタイム展開に適している。
  • 攻撃強度が変動しても、再構成誤差に基づく検出メカニズムは頑健で効果的である。
  • さまざまな事前学習済みDNNに適用しても高い精度を維持するため、優れた転送性と互換性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。