Skip to main content
QUICK REVIEW

[論文レビュー] The shape and simplicity biases of adversarially robust ImageNet-trained CNNs

Peijie Chen, Chirag Agarwal|arXiv (Cornell University)|Jun 16, 2020
Adversarial Robustness in Machine Learning参考文献 21被引用数 7
ひとこと要約

この論文は、敵対的に頑健なImageNet学習済みCNNにおける形状バイアスと単純さバイアスを調査し、敵対的訓練が滑らかなフィルタ、高周波数ノイズのブロッキング、低レベル特徴(テクスチャや色)へのシフト、およびニューロンごとの入力多様性の低下という3つの主要な単純化メカニズムを誘発することを明らかにした。これらの変化は、分布外および敵対的例におけるRネットワークの向上した頑健性と一般化性能を説明する。

ABSTRACT

Increasingly more similarities between human vision and convolutional neural networks (CNNs) have been revealed in the past few years. Yet, vanilla CNNs often fall short in generalizing to adversarial or out-of-distribution (OOD) examples which humans demonstrate superior performance. Adversarial training is a leading learning algorithm for improving the robustness of CNNs on adversarial and OOD data; however, little is known about the properties, specifically the shape bias and internal features learned inside adversarially-robust CNNs. In this paper, we perform a thorough, systematic study to understand the shape bias and some internal mechanisms that enable the generalizability of AlexNet, GoogLeNet, and ResNet-50 models trained via adversarial training. We find that while standard ImageNet classifiers have a strong texture bias, their R counterparts rely heavily on shapes. Remarkably, adversarial training induces three simplicity biases into hidden neurons in the process of "robustifying" CNNs. That is, each convolutional neuron in R networks often changes to detecting (1) pixel-wise smoother patterns, i.e., a mechanism that blocks high-frequency noise from passing through the network; (2) more lower-level features i.e. textures and colors (instead of objects);and (3) fewer types of inputs. Our findings reveal the interesting mechanisms that made networks more adversarially robust and also explain some recent findings e.g., why R networks benefit from a much larger capacity (Xie et al. 2020) and can act as a strong image prior in image synthesis (Santurkar et al. 2019).

研究の動機と目的

  • 敵対的頑健性を持つ(R)CNNがImageNet上で標準(S)モデルと比較して形状バイアスを示すかどうかを理解すること。
  • Rネットワークにおけるより強い形状バイアスが、分布外(OOD)および損傷を加えた画像における一般化性能の向上に寄与するかどうかを調査すること。
  • 特に隠れ層の表現において、敵対的頑健性を可能にする内部ニューラルメカニズムを解明すること。
  • 標準ImageNetテストセットではしばしば性能が低いにもかかわらず、Rネットワークがなぜ分布外データに対してより良い一般化性能を示すのかを説明すること。
  • フィルタの滑らかさ、特徴階層、ニューロンの入力多様性を分析することで、単純さが頑健性に果たす役割を明確にすること。

提案手法

  • AlexNet、GoogLeNet、ResNet-50の隠れニューロンにおける形状対テクスチャの好みを分析するために、キュー・コンフリクト法およびNetDissect法を適用する。
  • 層ごとのカーネル全変動(TV)を用いてフィルタの滑らかさを定量化し、ノイズ遮断能力を評価する。
  • NetDissectを用いて検出された固有の概念の数を数えることでニューロンの入力多様性を測定し、ゼロアウト実験により特徴の重要度を評価する。
  • スクラムブルド、スタイライズド、グレースケール、シルエット化された画像を用いた標準化された画像変換を複数のアーキテクチャで比較し、標準(S)と頑健(R)モデルを比較する。
  • 形状除去およびテクスチャ除去された画像バージョンにおける分類精度を用いて、形状バイアスとテクスチャバイアスを定量化する。
  • 特定の特徴検出器をネットワーク内でゼロアウトした際の精度低下を測定することで、チャネルレベルの寄与度を分析する。

実験結果

リサーチクエスチョン

  • RQ1ImageNet上で、敵対的頑健なネットワークは、標準ImageNet分類器と比較して形状をテクスチャよりも好むか?
  • RQ2Rネットワークにおけるより強い形状バイアスは、スタイライズドやシルエット化された画像を含む、分布外および損傷を加えた画像における性能向上に寄与するか?
  • RQ3敵対的訓練は、フィルタの滑らかさ、特徴階層、ニューロンの入力多様性の観点から、内部表現をどのように変化させ、頑健性を向上させるか?
  • RQ4標準テストセットでは低い精度を示すにもかかわらず、なぜRネットワークは分布外データに対してより良い一般化性能を示すのか?
  • RQ5Rネットワークは、標準モデルと比較して、滑らかなフィルタや少ない入力タイプといった、より単純で制限された表現をどの程度学習するのか?

主な発見

  • 敵対的頑健(R)ネットワークは、形状をテクスチャよりも約67%の確率で好むが、これは標準(S)ネットワークで観察された25%の好む割合と比較して顕著に高い。
  • Rネットワークは、テクスチャのない歪んだ画像、例えばCOCO画像のスタイライズド版やシルエット版において、Sネットワークを上回る性能を示し、分布外一般化性能の優位性を確認した。
  • 敵対的訓練は、Rネットワークにおいて滑らかなフィルタを誘発し、畳み込みカーネルの全変動(TV)を低下させ、高周波数ノイズがネットワーク内を伝搬するのを防ぐ。
  • Rネットワークは、テクスチャや色といった低レベル特徴の検出へとシフトし、特に「ストライプ」や「バンデッド」などの単純なテクスチャパターンに特化したチャネルが顕著に増加した。
  • Rネットワークの隠れニューロンは、平均して検出する固有の概念の数が少ないため、入力多様性が低く抑えられており、内部表現の単純化を示している。
  • 滑らかなフィルタ、低レベル特徴の検出、入力多様性の低下といった内部表現の単純化が、敵対的および分布外例におけるRネットワークの向上した頑健性と一般化性能を説明する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。