Skip to main content
QUICK REVIEW

[論文レビュー] Better the Devil you Know: An Analysis of Evasion Attacks using Out-of-Distribution Adversarial Examples

Vikash Sehwag, Arjun Nitin Bhagoji|arXiv (Cornell University)|May 5, 2019
Adversarial Robustness in Machine Learning参考文献 113被引用数 7
ひとこと要約

本稿では、開きたいらんディープラーニングシステムにおける検出を回避し、誤分類を引き起こすために、分布外(OOD)入力に摂動を適用する分布外(OOD)の adversarial 例を導入する。実験では、最新の防御手法(ロバストトレーニングやOOD検出器を含む)が、これらの攻撃に対して無効であることを示し、背景クラスの拡張を組み合わせた反復的 adversarial トレーニングのハイブリッド手法を提案。この手法により、OOD adversarial の成功確率を最大84%まで低減できる。

ABSTRACT

A large body of recent work has investigated the phenomenon of evasion attacks using adversarial examples for deep learning systems, where the addition of norm-bounded perturbations to the test inputs leads to incorrect output classification. Previous work has investigated this phenomenon in closed-world systems where training and test inputs follow a pre-specified distribution. However, real-world implementations of deep learning applications, such as autonomous driving and content classification are likely to operate in the open-world environment. In this paper, we demonstrate the success of open-world evasion attacks, where adversarial examples are generated from out-of-distribution inputs (OOD adversarial examples). In our study, we use 11 state-of-the-art neural network models trained on 3 image datasets of varying complexity. We first demonstrate that state-of-the-art detectors for out-of-distribution data are not robust against OOD adversarial examples. We then consider 5 known defenses for adversarial examples, including state-of-the-art robust training methods, and show that against these defenses, OOD adversarial examples can achieve up to 4$ imes$ higher target success rates compared to adversarial examples generated from in-distribution data. We also take a quantitative look at how open-world evasion attacks may affect real-world systems. Finally, we present the first steps towards a robust open-world machine learning system.

研究の動機と目的

  • オープンワールドの機械学習環境における回避攻撃の脅威を調査すること。この環境では、モデルが未知の分布からの入力を処理することになる。
  • 分布外(OOD)データから作成された adversarial 例に対して、最新のOOD検出および adversarial 防御メカニズムの脆弱性を分析すること。
  • OOD adversarial 例に直面した際の既存防御の有効性を評価し、現在のロバストネス仮定における深刻な欠陥を明らかにすること。
  • 背景クラスを用いた選択的予測と adversarial トレーニングを組み合わせた、OOD adversarial 例に対するロバストネスを向上させる新しい防御戦略を提案すること。

提案手法

  • 著者らは、分布内データではなく、分布外データ(例:ImageNet, VOC12, MNIST)にノルム制限付き摂動を適用することで、OOD adversarial 例を生成する。
  • CIFAR-10, SVHN, Tiny ImageNet でトレーニングされた11種類の最新の深層ニューラルネットワークを評価し、OOD adversarial 攻撃に対するロバストネスを測定する。
  • ハイブリッド防御を提案:背景クラスを用いた adversarial トレーニングにより、分布外入力を明示的にモデル化。4つのOODデータセット(MNIST, ImageNet, VOC12, Internet Photos)からそれぞれ5,000枚の画像を用いる。
  • 分布内データに OOD サンプルを追加した反復的 adversarial トレーニング(Madry et al. と同様)を実施。これにより、モデルはロバストな意思決定境界を学習できる。
  • 攻撃の有効性を測定する主な指標として、高信頼度で標的誤分類を引き起こす OOD adversarial 例の割合を用いる。
  • ロバストネスの一般化を評価するため、トレーニングに使用しなかった OOD データセットからの OOD adversarial 例に対するモデルの性能をテストする。

実験結果

リサーチクエスチョン

  • RQ1分布外(OOD)の入力は、検出を回避し、高信頼度の誤分類を引き起こす adversarial 例に操作可能か?
  • RQ2分布外(OOD) adversarial 例に対して、既存の最新のOOD検出および adversarial 防御メカニズムは、分布内 adversarial 例と比較してどの程度有効か?
  • RQ3背景クラスと OOD データを用いた adversarial トレーニングは、多様な OOD データセットにわたって、OOD adversarial 攻撃に対するロバストネスをどの程度向上できるか?
  • RQ41つの OOD データセットで学習したロバストネスは、他の OOD データセットへ一般化可能か?また、複数の OOD データセットを同時にトレーニングに組み込むことで、全体の防御性能はどのように変化するか?

主な発見

  • 最新の防御に対して、OOD adversarial 例は分布内 adversarial 例と比較して最大4倍高い標的攻撃成功確率を達成する。
  • 既存のOOD検出手法は、OOD adversarial 例を検出できない。なぜなら、これらの例は異なる分布に属するにもかかわらず、高信頼度で標的クラスとして分類されるからである。
  • ImageNet からの OOD 画像5,000枚のみを用いた adversarial トレーニングにより、OOD adversarial 例の標的成功確率は44.9%から7.4%にまで低下し、顕著なロバストネス向上が確認された。
  • VOC12 からの1つの OOD データセットで学習したロバストネスは、他の OOD データセットへ一般化可能であり、ImageNet を基盤とする OOD adversarial 例に対して、攻撃成功確率は44.9%から15.8%に低下した。
  • MNIST, ImageNet, VOC12, Internet Photos の複数の OOD データセットを組み合わせた adversarial トレーニングにより、最高の性能が得られ、すべての OOD ソースにおける全体の標的成功確率が最小化された。
  • 提案されたハイブリッド防御は、分布内精度にほとんど影響を与えない。4つの OOD データセットすべてでトレーニングした場合でも、最大で3.1%の低下にとどまる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。