Skip to main content
QUICK REVIEW

[論文レビュー] On the Sensitivity of Adversarial Robustness to Input Data Distributions

Gavin Weiguang Ding, Kry Yik Chau Lui|arXiv (Cornell University)|Feb 22, 2019
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

この論文は、自然な正確性とは異なり、敵対的ロバストネスが入力データ分布の意味的保存的変換に対して極めて感受性を示すことを示している。同じ分布で再訓練しても、ロバストネスは顕著に変動する。これは、データ分布そのものがロバストネスを決定づける可能性を示しており、標準的な評価手法に疑問を呈する。

ABSTRACT

Neural networks are vulnerable to small adversarial perturbations. Existing literature largely focused on understanding and mitigating the vulnerability of learned models. In this paper, we demonstrate an intriguing phenomenon about the most popular robust training method in the literature, adversarial training: Adversarial robustness, unlike clean accuracy, is sensitive to the input data distribution. Even a semantics-preserving transformations on the input data distribution can cause a significantly different robustness for the adversarial trained model that is both trained and evaluated on the new distribution. Our discovery of such sensitivity on data distribution is based on a study which disentangles the behaviors of clean accuracy and robust accuracy of the Bayes classifier. Empirical investigations further confirm our finding. We construct semantically-identical variants for MNIST and CIFAR10 respectively, and show that standardly trained models achieve comparable clean accuracies on them, but adversarially trained models achieve significantly different robustness accuracies. This counter-intuitive phenomenon indicates that input data distribution alone can affect the adversarial robustness of trained neural networks, not necessarily the tasks themselves. Lastly, we discuss the practical implications on evaluating adversarial robustness, and make initial attempts to understand this complex phenomenon.

研究の動機と目的

  • MNISTとCIFAR10のような類似したタスクを有するデータセット間で、自然な正確性は同等であるにもかかわらず敵対的ロバストネスがなぜ異なるのかを調査すること。
  • 同じ意味的特徴を持つデータ変換が、モデルを新しい分布で再訓練した後でも敵対的ロバストネスに影響を与えるかどうかを検討すること。
  • ロバストネスが学習アルゴリズムそのものに起因する性質であるという仮定に反論し、それがデータ分布に影響を受けることを示すこと。
  • この感受性がモデルベンチマーク評価やロバストモデルの実世界展開に与える実用的影響を評価すること。
  • この分布依存的ロバストネス現象の背後にあるメカニズムを理解を促進すること。

提案手法

  • 可逆なデータ変換の下でのベイズ誤差とロバスト誤差の理論的分析により、通常のベイズ誤差は不変であるが、ロバスト誤差はそうではないことを示した。
  • 完全なロバストネスが不可能となる条件の導出、特にデータが一様分布である場合に特に顕著である。
  • MNISTおよびCIFAR10用の意味的に同一のデータバージョンの設計、例えば二値化MNIST、ガンマ補正CIFAR10、ファッショングMNIST、エッジ検出バージョンなど。
  • 標準的および敵対的訓練済みモデルをこれらの変種で評価し、異なるデータ分布における自然な正確性とロバスト正確性を測定した。
  • モデル容量とトレーニングデータサイズの体系的アブレーションにより、変化するデータ分布下でのロバストネスへの影響を評価した。
  • Wong & Kolter (2018) などの認証ロバストネス手法を用いて、二値化MNISTでのロバストネスを検証し、高い自然な正確性にもかかわらず低ロバスト誤差(3%未満)を確認した。

実験結果

リサーチクエスチョン

  • RQ1入力データ分布の意味的保存的変換の下でも、敵対的ロバストネスは不変であるか?
  • RQ2MNISTで訓練されたモデルは、CIFAR10と同程度の自然な正確性を示すにもかかわらず、なぜ著しく高いロバスト正確性を達成するのか?
  • RQ3意味的に同一のデータ分布に変換されたデータで再訓練したモデルは、著しく異なるロバストネスを示すことができるか?
  • RQ4モデル容量とトレーニングデータサイズは、データ分布が変化した場合にロバストネスにどのように影響するか?
  • RQ5タスクやモデルとは独立して、データ分布そのものが敵対的ロバストネスにどの程度影響を与えるか?

主な発見

  • 敵対的ロバストネスは入力データ分布に極めて感受性を示す:意味的に同一のデータ変種(例:ガンマ補正CIFAR10)でも、顕著に異なるロバスト正確性を示す。
  • 標準的訓練ではMNISTとその変種で同程度の自然な正確性を達成するが、敵対的訓練済みモデルではロバスト正確性に顕著な差が生じる。例:同等の摂動バジェット下で、MNISTでは89.3%、CIFAR10では45.8%のロバスト正確性。
  • 二値化MNISTではWong & Kolter (2018) の認証手法により、最大3%の認証ロバスト誤差を達成し、MNISTと意味的に同一であるにもかかわらず高いロバストネスを示した。
  • PGDで訓練されたモデルでは、MNIST変種ではモデル容量とトレーニングデータサイズの増加に伴いロバスト正確性が飽和し、ある閾値を超えると限界に達することが示唆された。
  • CIFAR10変種では、より大きなモデルとより多くのデータがロバスト正確性の向上に寄与し続け、データ分布とサンプル複雑性の相互作用が複雑に現れている。
  • 二値化MNISTと∞-飽和CIFAR10では、異なるサンプル複雑性の挙動を示しており、二値化そのものがロバストネス特性を完全に決定しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。