Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating a Simple Retraining Strategy as a Defense Against Adversarial Attacks

Nupur Thakur, Yuzhen Ding|arXiv (Cornell University)|Jul 20, 2020
Adversarial Robustness in Machine Learning参考文献 9被引用数 4
ひとこと要約

本論文は、敵対的画像を用いた単純な再訓練戦略が、深層ニューラルネットワークに対する敵対的攻撃に対する防御に有効であるかを評価している。敵対的例を用いた再訓練—KNNに基づく手法を用いてラベル付けされたもの—が、特にブラックボックス攻撃に対して顕著に耐性を向上させることを示している。一方、ホワイトボックス攻撃は、更新された勾配にアクセスできるため、依然として効果的である。

ABSTRACT

Though deep neural networks (DNNs) have shown superiority over other techniques in major fields like computer vision, natural language processing, robotics, recently, it has been proven that they are vulnerable to adversarial attacks. The addition of a simple, small and almost invisible perturbation to the original input image can be used to fool DNNs into making wrong decisions. With more attack algorithms being designed, a need for defending the neural networks from such attacks arises. Retraining the network with adversarial images is one of the simplest techniques. In this paper, we evaluate the effectiveness of such a retraining strategy in defending against adversarial attacks. We also show how simple algorithms like KNN can be used to determine the labels of the adversarial images needed for retraining. We present the results on two standard datasets namely, CIFAR-10 and TinyImageNet.

研究の動機と目的

  • 敵対的例を用いた再訓練が防御機構として有効であるかどうかを評価すること。
  • 敵対的画像に固有の正解ラベルが存在しないため、再訓練に用いる敵対的画像のラベル付けの課題に対処すること。
  • KNNのような単純な機械学習手法が、敵対的画像の真のラベルを正確に予測できるかどうかを調査すること。
  • ホワイトボックスおよびブラックボックス攻撃に対する再訓練済みモデルの耐性を評価すること。
  • 再訓練が実世界の応用において実用的で軽量な防御戦略として機能するかどうかを特定すること。

提案手法

  • FGSM、DeepFool、GAP攻撃を用いて生成した敵対的画像を、元の訓練セットに追加することで、事前学習済み分類器を再訓練すること。
  • K=1のK近傍法(KNN)を用い、低次元の特徴空間における元の訓練画像との類似度に基づき、敵対的画像の真のラベルを予測すること。
  • KNN推論の効率化のため、入力次元を300(CIFAR-10)および2000(TinyImageNet)にまで次元削減するための主成分分析(PCA)を適用すること。
  • 異なる数の敵対的例を用いた再訓練後、元のテストセットおよび敵対的テストセットにおけるモデル性能を評価すること。
  • 再訓練後の敵対的画像の誤分類割合である「だまし率」を、防御効果の主要指標として測定すること。
  • ホワイトボックス(FGSM、DeepFool、Carlini-Wagner)とブラックボックス(GAP、RP2)攻撃の種別に応じた防御性能を比較すること。

実験結果

リサーチクエスチョン

  • RQ1敵対的例を用いた深層ニューラルネットワークの再訓練が、敵対的攻撃に対する耐性を向上させることができるか?
  • RQ2KNNに基づくラベル予測手法は、敵対的画像の正確なラベルを再訓練に用いるために適切に割り当てられるか?
  • RQ3再訓練防御戦略はホワイトボックス攻撃とブラックボックス攻撃の両方に対して同等に効果を発揮するか?
  • RQ4再訓練に使用する敵対的例の数を変化させた場合、モデルの精度と耐性にどのような影響が生じるか?
  • RQ5再訓練後のだまし率はどのように変化し、これはモデルの残存脆弱性を何を示唆しているか?

主な発見

  • 敵対的画像を用いた再訓練により、敵対的例に対するモデルの精度が顕著に向上した。100,000個の敵対的例を用いた場合、敵対的CIFAR-10画像で69.2%の精度を達成した。
  • KNNに基づくラベル予測手法は、CIFAR-10で98.29%、TinyImageNetで98%の精度を達成し、敵対的画像のラベル付けに信頼性があることが確認された。
  • 再訓練後のだまし率は、CIFAR-10で48.13%、TinyImageNetで49.2%に低下し、ほぼ半数の敵対的例が正しく分類されたことを示した。
  • ホワイトボックス攻撃(DeepFool、Carlini-Wagner)は再訓練後も依然として効果的であり、再訓練済みモデルの更新された勾配を利用できたためである。
  • ブラックボックス攻撃(GAP、RP2)は再訓練後はほとんど効果を示さず、勾配へのアクセスが制限された攻撃に対して再訓練が強力な防御であることが示唆された。
  • 敵対的例を統合しても、元のテスト画像に対する精度は高い水準を維持した(CIFAR-10で72.3%)、清浄データに対する性能劣化は最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。