Skip to main content
QUICK REVIEW

[論文レビュー] On the Benefits of Models with Perceptually-Aligned Gradients

Gunjan Aggarwal, Abhishek Sinha|arXiv (Cornell University)|May 4, 2020
Adversarial Robustness in Machine Learning参考文献 11被引用数 5
ひとこと要約

この論文は、低ノイズバウンド(例:ε = 1.0/255)を用いた adversarial training が、強力な adversarial robustness を欠いていても、視覚的にターゲットクラスに類似した勾配(perceptually-aligned gradients)を生成することを示している。このようなモデルは、標準的および高ε adversarially trained モデルと比較して、ゼロショット転移および弱教師あり局所化タスクで優れた性能を達成する。

ABSTRACT

Adversarial robust models have been shown to learn more robust and interpretable features than standard trained models. As shown in [\cite{tsipras2018robustness}], such robust models inherit useful interpretable properties where the gradient aligns perceptually well with images, and adding a large targeted adversarial perturbation leads to an image resembling the target class. We perform experiments to show that interpretable and perceptually aligned gradients are present even in models that do not show high robustness to adversarial attacks. Specifically, we perform adversarial training with attack for different max-perturbation bound. Adversarial training with low max-perturbation bound results in models that have interpretable features with only slight drop in performance over clean samples. In this paper, we leverage models with interpretable perceptually-aligned features and show that adversarial training with low max-perturbation bound can improve the performance of models for zero-shot and weakly supervised localization tasks.

研究の動機と目的

  • 低 adversarial ノイズバウンド(ε)で訓練されたモデルが、視覚的に整合性のある勾配を示すかどうかを調査すること。
  • このようなモデルのゼロショット転移および弱教師あり局所化タスクにおける下流性能を評価すること。
  • 強力なrobustness がなくても、視覚的に整合性のある勾配が一般化性および解釈可能性を向上させることを確認すること。
  • 低ε adversarially trained モデルを、標準的訓練モデルおよび高ε adversarially trained モデルと比較して、下流タスクで評価すること。

提案手法

  • CIFAR-10、SVHN、MNIST、USPS、Restricted ImageNet において、FGSM および PGD 攻撃を用いた adversarial training を、ℓ∞ 範囲の異なるバウンド(ε ∈ {1.0, 2.0, 4.0, 8.0}/255)で実施。
  • 勾配の可視化による、勾配と入力画像との間の視覚的整合性の評価。
  • 大規模な未ターゲット PGD 攻撃(ε = 32.0/255)を実施し、adversarial 例がターゲットクラスに類似しているかどうかを検証。
  • SVHN から MNIST へのゼロショット転移評価および MNIST から USPS への評価を、ソースおよびターゲットデータセットの検証精度を用いて実施。
  • CUB データセットにおける弱教師ありオブジェクト局所化(WSOL)を、Grad-CAM を用いたバウンディングボックス推定および IoU を用いたメトリクスで実施。
  • Top-1 精度、GT 知識あり局所化精度、および IoU > 0.5 の閾値下での Top-1 局所化精度を用いてモデルを比較。

実験結果

リサーチクエスチョン

  • RQ1低 adversarial ノイズバウンド(ε)で訓練されたモデルで、高robustness がなくても視覚的に整合性のある勾配が見られるか?
  • RQ2視覚的に整合性のある勾配を持つモデルは、ゼロショット転移学習タスクの性能を向上させられるか?
  • RQ3このようなモデルは、自然訓練モデルおよび高ε adversarially trained モデルを上回る弱教師ありオブジェクト局所化性能を示せるか?
  • RQ4勾配の視覚的整合性は、下流タスクの一般化性を向上させる一般化可能な特性であるか?

主な発見

  • 低ε(例:ε = 1.0/255)で adversarially trained されたモデルは、入力を摂動させる際、視覚的にターゲットクラスに類似した勾配(perceptually-aligned gradients)を示す。
  • 低 adversarial robustness(例:ε = 4.0/255 時に PGD 精度 34.33%)であるにもかかわらず、これらのモデルは高いクリーンデータセットテスト精度(CIFAR-10 で 90.95%)を維持する。
  • SVHN → MNIST ゼロショットタスクにおいて、AT-1 モデルは 75.99% のターゲット精度を達成し、自然モデルの 53.98% や高εモデルを上回った。
  • MNIST → USPS ゼロショットタスクにおいて、AT-0.05 モデルは 81.81% のターゲット精度を達成し、自然モデル(75.14%)や高εモデルを上回った。
  • CUB における弱教師あり局所化では、AT-0.5 モデルが 77.93% の Top-1 局所化精度を達成し、自然 ResNet50(50.0%)および他の AT モデルを上回った。
  • 低εモデルの視覚的に整合性のある勾配は、大規模な摂動(ε = 32.0/255)下でも、adversarial 例がターゲットクラスに類似した外観を示す原因となるのに対し、自然モデルではランダムノイズが生成される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。