Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Adversarial Examples - A Lesson from Multimedia Forensics

Pascal Schöttle, Alexander Schlögl|arXiv (Cornell University)|Mar 9, 2018
Adversarial Robustness in Machine Learning参考文献 17被引用数 5
ひとこと要約

本稿では、MNIST上で投影勾配降下法(PGD)によって生成された adversarial examples を検出するため、ステガノグラフィーにインspiredされた線形フィルタを提案する。ピクセルレベルの予測残差を活用することで、特に大きな摂動予算の場合に高い検出率を達成し、 adversarial retraining を組み合わせることで 96% を超える精度を維持する。これは adversarial examples の攻撃表面を顕著に縮小する。

ABSTRACT

Adversarial classification is the task of performing robust classification in the presence of a strategic attacker. Originating from information hiding and multimedia forensics, adversarial classification recently received a lot of attention in a broader security context. In the domain of machine learning-based image classification, adversarial classification can be interpreted as detecting so-called adversarial examples, which are slightly altered versions of benign images. They are specifically crafted to be misclassified with a very high probability by the classifier under attack. Neural networks, which dominate among modern image classifiers, have been shown to be especially vulnerable to these adversarial examples. However, detecting subtle changes in digital images has always been the goal of multimedia forensics and steganalysis. In this paper, we highlight the parallels between these two fields and secure machine learning. Furthermore, we adapt a linear filter, similar to early steganalysis methods, to detect adversarial examples that are generated with the projected gradient descent (PGD) method, the state-of-the-art algorithm for this task. We test our method on the MNIST database and show for several parameter combinations of PGD that our method can reliably detect adversarial examples. Additionally, the combination of adversarial re-training and our detection method effectively reduces the attack surface of attacks against neural networks. Thus, we conclude that adversarial examples for image classification possibly do not withstand detection methods from steganalysis, and future work should explore the effectiveness of known techniques from multimedia forensics in other adversarial settings.

研究の動機と目的

  • ステガノグラフィーと adversarial example 検出の間の概念的類似性を特定することで、adversarial machine learning とマルチメディアフォレンシックスを橋渡しすること。
  • 既存のステガノグラフィー技術が画像分類における adversarial examples を効果的に検出できるかどうかを調査すること。
  • PGD によって生成された adversarial examples を検出するための単純で線形な検出手法(ピクセル予測残差に基づく)を構築・評価すること。
  • 提案手法を adversarially retrained ニューラルネットワークと組み合わせることで、敵対的攻撃に対する全体的な耐性を向上させることの有効性を評価すること。
  • フォレンシックス分野の検出手法が、robust classification と補完的であることを示し、攻撃者の成功確率を低下させることを実証すること。

提案手法

  • ピクセルレベルの予測値からの逸脱を分析することで、adversarial examples を検出するため、初期のステガノグラフィー手法から取り入れた線形予測フィルタを適用する。
  • 局所的なピクセル予測モデルを用いて、実際のピクセル強度と予測値との間の残差を計算し、adversarial な摂動によって生じる異常を同定する。
  • さまざまな摂動予算(ε)を用いた投影勾配降下法(PGD)による adversarial examples に対して、この手法を適用する。
  • 検出手法と adversarially retrained CNN を組み合わせる:検出されなかった(良性に近い)入力をのみ分類器に渡す。
  • 予測残差の大きさに基づいて、閾値に基づく意思決定ルールを用いて、入力を adversarial または benign に分類する。
  • MNIST データセット上で、真陽性率(TPR)とさまざまな ε 値およびモデルタイプ(自然モデル対 adversarially retrained モデル)における全体の精度を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ステガノグラフィーにインスパイアされた検出手法は、PGD によって生成された adversarial examples を効果的に同定できるか?
  • RQ2PGD 攻撃における摂動の大きさ(ε)に応じて、検出性能はどのように変化するか?
  • RQ3提案手法を adversarially retrained モデルと組み合わせることで、敵対的攻撃に対する全体の耐性が向上するか?
  • RQ4なぜ adversarially retrained モデルからの adversarial examples は検出がより困難になるのか?その摂動にどのような構造的差異があるか?
  • RQ5マルチメディアフォレンシックス分野の検出手法は、adversarial machine learning における robust classification とどの程度補完的であるか?

主な発見

  • 自然モデルでは ε ≈ 0.17 のとき真陽性率(TPR)が約 50% を達成し、ε が大きくなるにつれて性能が向上する。
  • adversarially retrained モデルでは、ε ≈ 0.31 のとき TPR が 50% に達する。これは、retrained モデルからの adversarial examples が検出がより困難であることを示している。
  • 検出手法と adversarially retrained モデルを組み合わせることで、すべての ε 値において最低でも 96% の全体精度を維持する。これは、元の分類器の精度が 50% 未満に下がった場合でも同様に成り立つ。
  • 自然モデルでは ε ≥ 0.17、retrained モデルでは ε ≥ 0.31 のとき、adversarial および benign サンプルが完全に分離される。
  • adversarially retrained モデルからの adversarial examples は、より均一なピクセル変化を示し、予測モデルの期待値に近づく傾向がある。これは検出可能性を低下させる。
  • 検出と robust classification の直交的挙動は、両者を組み合わせることで強い相乗効果が得られることを示しており、攻撃者の有効な攻撃表面を顕著に縮小する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。