Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Evasion Attacks to Deep Neural Networks via Region-based Classification

Xiaoyu Cao, Neil Zhenqiang Gong|arXiv (Cornell University)|Sep 17, 2017
Adversarial Robustness in Machine Learning参考文献 30被引用数 7
ひとこと要約

本論文は、テスト例を中心とするハイパーキューブ内の複数の点からの予測をアンサンブルすることで、深層ニューラルネットワーク(DNN)に対する撹乱攻撃に対する防御を、領域ベース分類によって提案する。この手法は、Carlini や Wagner による最先端の攻撃に対しても、悪意ある例の精度を損なわず、高い成功確率の低下を達成しながら、元のモデル性能を維持する。

ABSTRACT

Deep neural networks (DNNs) have transformed several artificial intelligence research areas including computer vision, speech recognition, and natural language processing. However, recent studies demonstrated that DNNs are vulnerable to adversarial manipulations at testing time. Specifically, suppose we have a testing example, whose label can be correctly predicted by a DNN classifier. An attacker can add a small carefully crafted noise to the testing example such that the DNN classifier predicts an incorrect label, where the crafted testing example is called adversarial example. Such attacks are called evasion attacks. Evasion attacks are one of the biggest challenges for deploying DNNs in safety and security critical applications such as self-driving cars. In this work, we develop new methods to defend against evasion attacks. Our key observation is that adversarial examples are close to the classification boundary. Therefore, we propose region-based classification to be robust to adversarial examples. For a benign/adversarial testing example, we ensemble information in a hypercube centered at the example to predict its label. In contrast, traditional classifiers are point-based classification, i.e., given a testing example, the classifier predicts its label based on the testing example alone. Our evaluation results on MNIST and CIFAR-10 datasets demonstrate that our region-based classification can significantly mitigate evasion attacks without sacrificing classification accuracy on benign examples. Specifically, our region-based classification achieves the same classification accuracy on testing benign examples as point-based classification, but our region-based classification is significantly more robust than point-based classification to various evasion attacks.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)が、小さな悪意ある摂動によって誤分類を引き起こす撹乱攻撃に対して脆弱であるという問題に対処すること。
  • 実験的測定に基づいて、悪意ある例が意思決定境界に近い位置に存在するかどうかを調査すること。
  • 再トレーニングや元のDNNの変更を必要とせず、耐性を高める防御機構を開発すること。
  • 標準ベンチマーク(MNIST および CIFAR-10)上で強力な撹乱攻撃に対してこの防御を評価すること。
  • 領域ベース分類が、元の分類性能を維持しながら、悪意ある例の成功確率を大幅に低下させることを示すこと。

提案手法

  • 本手法は、入力空間におけるテスト例を中心とするハイパーキューブを用い、複数の摂動を加えた点をサンプリングする。
  • ハイパーキューブ内に含まれる各サンプル点に対して、元のDNN分類器がラベルを予測する。
  • すべてのサンプル点のラベルに対する多数決によって、元のテスト例の最終予測が決定される。
  • このアプローチにより、点ベース分類から領域ベース分類に変換され、入力空間における局所的整合性が活用される。
  • 防御は推論時のみに適用されるため、再トレーニングを必要とせず、レガシーモデルとも互換性がある。
  • 本手法は複数のノイズを含むサンプルを通じてランダム化を暗黙的に適用するが、過去のランダム化防御とは異なり、単一のランダム化入力ではなく、複数のサンプルに対するアンサンブル投票を用いる。

実験結果

リサーチクエスチョン

  • RQ1悪意ある例は、意思決定境界に近い位置に存在するため、それらの周囲の局所領域に真のクラスに属する点が依然として存在するのだろうか?
  • RQ2テスト例の周囲の局所領域に複数の点をサンプリングし、その予測をアンサンブルすることで、撹乱攻撃に対する耐性が向上するのだろうか?
  • RQ3領域ベース分類は、点ベース分類と同等の精度で悪意ある例を処理できるのだろうか?
  • RQ4Carlini や Wagner が提案したような強力な撹乱攻撃に対して、領域ベース分類はどの程度効果的だろうか?
  • RQ5再トレーニングを必要とせず、異なるデータセットや攻撃タイプに一般化可能だろうか?

主な発見

  • 領域ベース分類は、点ベース分類と同等のテスト精度を悪意ある例で達成しており、性能の低下がないことが確認された。
  • 本手法は、MNIST および CIFAR-10 データセットの両方で、Carlini や Wagner の攻撃を含む撹乱攻撃の成功確率を顕著に低下させた。
  • 強力な攻撃によって生成された悪意ある例は、小さな摂動に対して敏感であることが判明した。すなわち、周囲の点を評価した際、ラベルが変化した。
  • 適応的攻撃の実際の成功確率は推定値よりも低く、過剰なノイズにより人間の知覚性テストに失敗する悪意ある例が一部存在した。
  • 本防御は、悪意ある訓練や蒸留を回避する攻撃に対しても効果的であり、最先端の撹乱技術に対して有効であることが示された。
  • 本手法は、元のモデルを変更せずに、入力空間における局所的整合性を活用して悪意ある例を検出・緩和可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。