Skip to main content
QUICK REVIEW

[論文レビュー] Understanding and Improving Robustness of Vision Transformers through Patch-based Negative Augmentation

Yao Qin, Chiyuan Zhang|arXiv (Cornell University)|Oct 15, 2021
Advanced Neural Network Applications参考文献 37被引用数 12
ひとこと要約

この論文は、ビジョントランスフォーマー(ViTs)が、意味を破壊する変換ですら耐えるが、真のクラスの意味を示唆しない非頑健なピクセル単位の特徴に依存していることを特定している。ピクセル単位のネガティブな拡張——空間的および意味的構造を破壊する変換——を導入することで、著者たちはViTがこれらの特徴に依存しないように正則化し、20以上の設定において分布外の頑健性を著しく向上させつつ、分布内精度を損なわずに実現した。

ABSTRACT

We investigate the robustness of vision transformers (ViTs) through the lens of their special patch-based architectural structure, i.e., they process an image as a sequence of image patches. We find that ViTs are surprisingly insensitive to patch-based transformations, even when the transformation largely destroys the original semantics and makes the image unrecognizable by humans. This indicates that ViTs heavily use features that survived such transformations but are generally not indicative of the semantic class to humans. Further investigations show that these features are useful but non-robust, as ViTs trained on them can achieve high in-distribution accuracy, but break down under distribution shifts. From this understanding, we ask: can training the model to rely less on these features improve ViT robustness and out-of-distribution performance? We use the images transformed with our patch-based operations as negatively augmented views and offer losses to regularize the training away from using non-robust features. This is a complementary view to existing research that mostly focuses on augmenting inputs with semantic-preserving transformations to enforce models' invariance. We show that patch-based negative augmentation consistently improves robustness of ViTs across a wide set of ImageNet based robustness benchmarks. Furthermore, we find our patch-based negative augmentation are complementary to traditional (positive) data augmentation, and together boost the performance further.

研究の動機と目的

  • グローバルアテンションメカニズムを備えるにもかかわらず、ビジョントランスフォーマー(ViTs)が分布シフトに対して依然として脆弱である理由を調査すること。
  • 意味を破壊するピクセル単位の変換に耐えるが、意味的意味を持たない非頑健な特徴を、ViTsがどのように依存しているかを特定・分析すること。
  • ViTがこのような非頑健な特徴に依存するのを減らすためのトレーニング正則化法を開発し、分布シフト下での一般化を向上させること。
  • ピクセル単位のネガティブな拡張が、既存のポジティブなデータ拡張および対照学習技術とどのように補完的かを示すこと。
  • 意味を破壊する変換を的確に適用することで、ViTsにおける頑健性の失敗を診断・是正するための新規フレームワークを提供すること。

提案手法

  • 空間的および意味的関係を破壊するが、局所的ピクセル統計を保持するピクセル単位の変換(例:ランダムなピクセル回転、シャッフル、背景埋め込み)を設計・適用すること。
  • トレーニング中に変換された画像をネガティブに拡張されたビューとして使用し、モデルが元の入力とは異なる表現を生成するように促すこと。
  • 元の画像とそのピクセル単位の変換されたバージョンをそれぞれポジティブおよびネガティブペアとして扱う対照損失を導入し、非頑健な特徴からモデルを正則化すること。
  • 標準的なポジティブなデータ拡張(例:mixup、Cutout)および対照学習におけるバッチベースのネガティブ例と組み合わせることで、頑健性を向上させること。
  • アーキテクチャの変更なしに、標準的な教師あり学習で新しい損失目的を用いてViTを訓練し、追加の推論コストを発生させないこと。
  • 分布シフト下での標準的なImageNetベースのベンチマーク(ImageNet-R、ImageNet-A、ImageNet-V2)を用いて頑健性を評価すること。

実験結果

リサーチクエスチョン

  • RQ1グローバルアテンションメカニズムを備えるにもかかわらず、ビジョントランスフォーマーがなぜ分布シフトに対して脆弱であるのか?
  • RQ2ピクセル単位の変換に耐えるが、意味的意味を持たない特徴として、ViTsがどのタイプの特徴に依存しているのか?
  • RQ3ピクセル単位のネガティブな拡張を用いたトレーニングによって、非頑健な特徴への依存を減らし、分布外一般化を向上させられるか?
  • RQ4ピクセル単位のネガティブな拡張は、既存のポジティブなデータ拡張および対照学習手法とどのように比較・補完的か?
  • RQ5提案手法は、標準ベンチマークにおける分布内精度を低下させることなく、頑健性を向上させられるか?

主な発見

  • ViTsは分布内精度が非常に高いが、意味的コンテンツを破壊するピクセル単位の変換を適用した際、頑健性ベンチマークで著しく失敗する。
  • ピクセル単位の変換後にViTが依存する特徴は、分布内パフォーマンスには有用であるが、人間が理解できる意味的手がかりに対応しないため非頑健である。
  • ピクセル単位のネガティブな拡張は、ImageNetベースの頑健性ベンチマーク(ImageNet-R、ImageNet-A、ImageNet-V2)において20以上の実験設定で一貫してViTの頑健性を向上させる。
  • 標準的なポジティブなデータ拡張およびバッチベースのネガティブ例と組み合わせても、頑健性が向上し、補完的利得を示している。
  • 提案手法は、非頑健な特徴への依存を著しく減少させる一方で、注意可視化および特徴帰属分析により確認されたように、分布内精度を維持またはわずかに向上させる。
  • 本研究では、ViTが物体に注目することはできるが、予測が非頑健なピクセルレベルのアーチファクトに依存する場合、グローバルな意味的構造ではなく、一般化に失敗することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。