Skip to main content
QUICK REVIEW

[論文レビュー] AdvDrop: Adversarial Attack to DNNs by Dropping Information

Ranjie Duan, Yuefeng Chen|arXiv (Cornell University)|Aug 20, 2021
Adversarial Robustness in Machine Learning参考文献 48被引用数 11
ひとこと要約

本論文は、摂氏的でない画像の詳細——特に周波数ドメインにおける高周波成分——を削除することで adversarial examples を生成する、新しい adversarial attack である AdvDrop を提案する。この手法は ImageNet で 97.20% の攻撃成功率を達成し、ノイズ除去ベースの防御に対して強い耐性を示し、現在の DNN の耐性評価における深刻な脆弱性を露呈する。

ABSTRACT

Human can easily recognize visual objects with lost information: even losing most details with only contour reserved, e.g. cartoon. However, in terms of visual perception of Deep Neural Networks (DNNs), the ability for recognizing abstract objects (visual objects with lost information) is still a challenge. In this work, we investigate this issue from an adversarial viewpoint: will the performance of DNNs decrease even for the images only losing a little information? Towards this end, we propose a novel adversarial attack, named extit{AdvDrop}, which crafts adversarial examples by dropping existing information of images. Previously, most adversarial attacks add extra disturbing information on clean images explicitly. Opposite to previous works, our proposed work explores the adversarial robustness of DNN models in a novel perspective by dropping imperceptible details to craft adversarial examples. We demonstrate the effectiveness of extit{AdvDrop} by extensive experiments, and show that this new type of adversarial examples is more difficult to be defended by current defense systems.

研究の動機と目的

  • 摂氏的でない画像の詳細を削除することで、DNN をだます adversarial examples を生成できるかを調査すること。
  • 摂氏的でない画像の詳細を削除することによる情報損失の観点から、adversarial robustness を探求すること。
  • 特にノイズ除去ベースの防御を含む既存の防御機構に対して、AdvDrop の有効性を評価すること。
  • モデルの注視マップと削除された画像特徴との関係を分析すること。
  • 空間ドメインの手法(例:色深度の低減)と比較して、周波数ドメインでの情報削除がなぜより効果的で自然に見えるかを示すこと。

提案手法

  • AdvDrop は離散コサイン変換(DCT)を用いて入力画像を空間ドメインから周波数ドメインに変換する。
  • 人間の知覚にあまり影響を与えないが DNN にとって重要な高周波成分を、選択的に低減するための微分可能量子化を適用する。
  • 画像の構造を保持しながら、微細なテクスチャや細部を削除することができる微分可能な量子化戦略を用いる。
  • 自然な画像と類似した視覚的類似性を保ちつつ、DNN の分類を混乱させる方法で adversarial examples を生成する。
  • ドロップされた周波数成分の量と位置を調整することで、標的攻撃および非標的攻撃を実行する。
  • 周波数帯域(低、中、高)のドロップと量子化手法のアブレーションスタディを実施して、アプローチを評価する。

実験結果

リサーチクエスチョン

  • RQ1周波数ドメインで摂氏的でない画像の詳細を削除することで、DNN をだます有効な adversarial examples を生成できるか?
  • RQ2摂氏的でない画像の詳細を削除する AdvDrop は、摂氏的でないノイズを追加する従来の adversarial attack よりも有効性と耐性において優れているか?
  • RQ3なぜ周波数ドメインでの情報削除は、色深度の低減のような空間ドメインの手法よりも効果的なのか?
  • RQ4AdvDrop は DNN の注視マップをどれほど活用しているか、または重複しているか?
  • RQ5特にノイズ除去ベースの防御は、AdvDrop が生成した adversarial examples に対してどれほど効果的か?

主な発見

  • AdvDrop は ImageNet で 97.20% の攻撃成功率を達成し、標準的な丸め処理(5.00%)や微分可能量子化(65.20%)を著しく上回る。
  • ノイズ除去ベースの防御に対して非常に強い耐性を示す:PGD によって生成された adversarial examples はノイズ除去で緩和されるが、AdvDrop の例は依然として効果的である。
  • 低周波成分のドロップが最も顕著な精度低下(30.00% まで)を引き起こし、DNN 識別において支配的であることが示された。一方、高周波成分のドロップはやや有害性が低いが、依然として効果的である。
  • 視覚的分析では、AdvDrop がしばしば高周波テクスチャの詳細を削除しており、特にテクスチャの多い領域でモデルの注視マップと重複している傾向がある。
  • 周波数ドメインでの情報削除は、空間ドメインの手法(例:色深度の低減)よりも効果的で、より自然に見える adversarial 画像を生成する。
  • アブレーションスタディにより、微分可能量子化が高性能を達成するために不可欠であることが確認された。これは、攻撃成功率を最大化するための非一様な情報削除を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。