Skip to main content
QUICK REVIEW

[論文レビュー] Learning More Robust Features with Adversarial Training

Shuangtao Li, Yuanke Chen|arXiv (Cornell University)|Apr 20, 2018
Adversarial Robustness in Machine Learning参考文献 8被引用数 17
ひとこと要約

この論文は、ニューラルネットワークの隠れ層における特徴の歪みを明示的に最小化することで、敵対的攻撃に対してより頑健な性能を発揮する新たな敵対的訓練手法を提案する。敵対的損失に歪み正則化項を追加することで、ネットワークがより頑健な特徴を学習するよう訓練され、FGSMおよびPGD攻撃の両方に対して顕著な耐性向上が得られるとともに、特徴レベルの頑健性も向上する。MNISTおよびCIFAR-10での実験により検証済み。

ABSTRACT

In recent years, it has been found that neural networks can be easily fooled by adversarial examples, which is a potential safety hazard in some safety-critical applications. Many researchers have proposed various method to make neural networks more robust to white-box adversarial attacks, but an effective method have not been found so far. In this short paper, we focus on the robustness of the features learned by neural networks. We show that the features learned by neural networks are not robust, and find that the robustness of the learned features is closely related to the resistance against adversarial examples of neural networks. We also find that adversarial training against fast gradients sign method (FGSM) does not make the leaned features very robust, even if it can make the trained networks very resistant to FGSM attack. Then we propose a method, which can be seen as an extension of adversarial training, to train neural networks to learn more robust features. We perform experiments on MNIST and CIFAR-10 to evaluate our method, and the experiment results show that this method greatly improves the robustness of the learned features and the resistance to adversarial attacks.

研究の動機と目的

  • ニューラルネットワークが学習する特徴の敵対的摂動に対する頑健性を調査すること。
  • モデルレベルの頑健性向上を図るが、特徴レベルの頑健性は向上しない標準的敵対的訓練の限界を特定すること。
  • 内部特徴表現の頑健性を直接向上させることで、全体的な敵対的防御性能を向上させる手法を開発すること。
  • より頑健な特徴が、PGDのような強力な敵対者に対してより強い耐性を示すかどうかを評価すること。
  • 敵対的摂動によって生じる特徴の歪みを最小化する訓練目的を提案および検証すること。

提案手法

  • クリーンな入力と敵対的摂動を加えた入力の間の正規化された特徴値の平均二乗歪みを用いて、特徴の頑健性を測定する。
  • 歪み正則化項を追加した変更済みの敵対的訓練目的を導入:$\tilde{J}_{adv} = \alpha J(x,y) + (1-\alpha)J(x^*,y) + \sum_{i=1}^{L-1} \beta_i \sum_{j=1}^{h_i} d_{ij}$、ここで$d_{ij}$は層$i$の$j$番目の正規化済み特徴の歪みを表す。
  • 訓練中には効率的な敵対的サンプル生成のためFGSMを用いるが、評価にはPGDを用いる。
  • 歪み測定をスケール不変にするために、特徴にバッチ正則化を適用する。
  • 深層部の高レベル表現の頑健性を優先するために、層ごとの重み付け($\beta_i$)を実施し、深さが進むほど値を大きくする。
  • MNISTおよびCIFAR-10で変更済みの目的関数を用いてモデルを訓練し、クリーンデータおよびFGSM・PGD摂動を加えたテストセットで評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的および敵対的訓練を経たニューラルネットワークが学習する特徴は、入力摂動に対して頑健であるか?
  • RQ2FGSMに対する敵対的訓練は、学習された特徴の頑健性をどの程度向上させるか?
  • RQ3訓練中に特徴の歪みを明示的に最小化することで、PGDのようなより強力な敵対者に対してもより良い頑健性が得られるか?
  • RQ4特徴レベルおよびモデルレベルの頑健性という観点から、提案手法の歪み正則化付き訓練は標準的敵対的訓練と比べてどのように異なるか?
  • RQ5特徴の頑健性の向上は、多様な敵対的攻撃に対する耐性向上と相関しているか?

主な発見

  • PGD攻撃下で高い平均歪み値を示すため、標準的およびFGSM敵対的訓練を経たネットワークが学習する特徴は、入力摂動に対して頑健でないことが判明した。
  • FGSMに対する敵対的訓練は特徴の頑健性をわずかに向上させるが、FGSM攻撃に対するモデル精度が顕著に向上するにもかかわらず、特徴の頑健性は十分に高まらない。
  • 提案手法は、特に深層部において、標準的敵対的訓練よりも平均特徴歪みをより効果的に低減した。
  • MNISTでは、提案手法がFGSM攻撃に対して97.13%の精度、PGD攻撃に対して91.71%の精度を達成し、標準的敵対的訓練(FGSM 94.92%、PGD 6.12%)を上回った。
  • CIFAR-10では、提案手法がFGSM攻撃に対して65.14%の精度、PGD攻撃に対して34.40%の精度を達成し、標準的敵対的訓練(FGSM 85.26%、PGD 10.43%)を顕著に上回った。
  • 結果から、より頑健な特徴は、特に一階の敵対者(PGD)に対して強い防御をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。