Skip to main content
QUICK REVIEW

[論文レビュー] An Impartial Take to the CNN vs Transformer Robustness Contest

Francesco Pinto, Philip H. S. Torr|arXiv (Cornell University)|Jul 22, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

この論文は、ImageNet-1Kおよびシフトベンチマークにおいて、最先端のCNN(特にConvNeXt)とトランスフォーマー(ViT、Swin-T)をきめ細やかで公平な比較を通じて行い、CNNが頑健性、キャリブレーション、不確実性推定においてトランスフォーマーと同等またはそれを上回ることを示した。主な発見は、自己注意機構が inherently 优越な頑健性をもたらすわけではないこと、両アーキテクチャとも類似したバイアス(単純性バイアスやテクスチャバイアス)を示していることである。

ABSTRACT

Following the surge of popularity of Transformers in Computer Vision, several studies have attempted to determine whether they could be more robust to distribution shifts and provide better uncertainty estimates than Convolutional Neural Networks (CNNs). The almost unanimous conclusion is that they are, and it is often conjectured more or less explicitly that the reason of this supposed superiority is to be attributed to the self-attention mechanism. In this paper we perform extensive empirical analyses showing that recent state-of-the-art CNNs (particularly, ConvNeXt) can be as robust and reliable or even sometimes more than the current state-of-the-art Transformers. However, there is no clear winner. Therefore, although it is tempting to state the definitive superiority of one family of architectures over another, they seem to enjoy similar extraordinary performances on a variety of tasks while also suffering from similar vulnerabilities such as texture, background, and simplicity biases.

研究の動機と目的

  • 自己注意機構のおかげでトランスフォーマーがCNNよりも inherently 頑健で、キャリブレーション性能に優れているという広く信じられている考えに挑戦すること。
  • CNNとトランスフォーマーの両方の最新アーキテクチャとトレーニングレシピを用いて、公平でバイアスのない比較を実施すること。
  • 自己注意機構が頑健性の向上に寄与しているとされるが、正規化や活性化関数といった他のアーキテクチャ的要因がそれ以上に影響を与えている可能性を調査すること。
  • 精度以外の複数の指標(キャリブレーション、OoD検出、誤分類検出)を用いて、モデルの信頼性を評価すること。
  • 過去の比較における欠陥を浮き彫りにすること、例えば、不適切なメトリクス選択(不均衡な設定でのAURP vs. AUROC)や、モデル容量の不平等なスケーリングである。

提案手法

  • BiTおよびConvNeXtといった最先端のCNNと、ViTおよびSwin-Tといったトランスフォーマーを、同一のImageNet-1Kトレーニングおよび評価プロトコルで比較した。
  • モデルが最高性能を発揮するように、トレーニングレシピを変更せずに標準的な評価プロトコルを用いた。
  • 分布シフトベンチマーク(ImageNet-A、ImageNet-R、ImageNet-Sketches、ImageNet-V2)における頑健性を評価した。
  • 複数の信頼性指標を用いた:期待キャリブレーション誤差(ECE)、OoD検出のためのAUROCおよびAURP、誤分類検出のための予測拒否比(PRR)。
  • 単純性バイアスの実験を実施し、モデルが複雑で不変な特徴ではなく、単純で誤った特徴に依存しているかどうかを評価した。
  • 誤分類されたサンプルにおけるモデルの信頼度分布を分析し、特に分布外設定での過信度を検出した。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーは、複数の分布シフトベンチマークにおいて、CNNを常に上回る頑健性とキャリブレーション性能を示すのか?
  • RQ2自己注意機構が頑健性の向上を主因としているのか、それとも他のアーキテクチャ的要因(正規化、活性化関数など)が同等またはそれ以上に影響を与えているのか?
  • RQ3OoD検出において、異なる評価指標(例:AURP対AUROC)が、CNNとトランスフォーマーの間の性能差の認識にどのように影響を与えるか?
  • RQ4CNNとトランスフォーマーの両方が、頑健で不変な特徴ではなく、容易に識別可能な特徴を好む単純性バイアスをどの程度示しているか?
  • RQ5ConvNeXt といった現代のCNNは、自己注意機構を用いずに、トランスフォーマーと同等の性能を達成できるのか?

主な発見

  • ConvNeXt-XLは、ImageNet-1Kにおいてインディストリビューションキャリブレーションで最先端のトランスフォーマーを上回り、PRRが74.37%を記録した。これは、ViT-L/16(76.03%)を上回り、Swin-L(72.89%)をも下回る結果であった。
  • ImageNet-Rでは、Swin-Lのみが正のPRR(36.53%)を示したが、ConvNeXt-XLおよびLは負のPRR(-19.32%および-23.60%)を示し、誤分類されたサンプルに対して過信していることがわかった。
  • 分布外検出においては明確な勝者は現れず、ViT-L/16とConvNeXt-XLはImageNet-SketchesおよびImageNet-V2で同等の性能を示し、AUROC値は約0.85〜0.87の範囲に収まった。
  • BiT-R152x4はImageNet-Aで最高のPRR(92.04%)を記録し、すべてのトランスフォーマーを大きく上回った。これは、CNNが極端なドメインシフトにおいてより信頼性が高い可能性を示唆している。
  • 低めの誤差(ECE)を示しても、特にImageNet-Rでは複数のモデルが誤分類されたサンプルに対して高い過信度を示しており、ECEのみでは信頼性の評価が不十分であることがわかった。
  • 単純性バイアスの実験により、CNNとトランスフォーマーの両方が、複雑で不変な特徴ではなく、単純で誤った特徴に注目する傾向があることが判明した。これは、自己注意機構がより優れた特徴学習を可能にするという主張を揺るがすものであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。