Skip to main content
QUICK REVIEW

[論文レビュー] Pyramid Adversarial Training Improves ViT Performance

Charles Herrmann, Kyle Sargent|arXiv (Cornell University)|Nov 30, 2021
Adversarial Robustness in Machine Learning参考文献 55被引用数 4
ひとこと要約

本稿では、視覚変換器(ViT)の性能を向上させるために、訓練中にマルチスケールで構造化された敵対的摂動を適用する、新しいデータ拡張手法であるピラミッド敵対的訓練(PyramidAT)を提案する。この手法は、追加データを用いずに、ViT-B/16のImageNetクリーン精度を1.82%絶対値向上させ、7つのImageNetのロバストネスベンチマークで新たなSOTAを達成した。ドロップアウトと確率的深さ正則化を適切に組み合わせた。

ABSTRACT

Aggressive data augmentation is a key component of the strong generalization capabilities of Vision Transformer (ViT). One such data augmentation technique is adversarial training (AT); however, many prior works have shown that this often results in poor clean accuracy. In this work, we present pyramid adversarial training (PyramidAT), a simple and effective technique to improve ViT's overall performance. We pair it with a "matched" Dropout and stochastic depth regularization, which adopts the same Dropout and stochastic depth configuration for the clean and adversarial samples. Similar to the improvements on CNNs by AdvProp (not directly applicable to ViT), our pyramid adversarial training breaks the trade-off between in-distribution accuracy and out-of-distribution robustness for ViT and related architectures. It leads to 1.82% absolute improvement on ImageNet clean accuracy for the ViT-B model when trained only on ImageNet-1K data, while simultaneously boosting performance on 7 ImageNet robustness metrics, by absolute numbers ranging from 1.76% to 15.68%. We set a new state-of-the-art for ImageNet-C (41.42 mCE), ImageNet-R (53.92%), and ImageNet-Sketch (41.04%) without extra data, using only the ViT-B/16 backbone and our pyramid adversarial training. Our code is publicly available at pyramidat.github.io.

研究の動機と目的

  • 視覚変換器(ViT)における分布内一般化と分布外ロバストネスのトレードオフを解消すること。
  • 追加データに依存せずに、クリーンなImageNetおよび複数のロバストネスベンチマークにおけるViTの性能を向上させること。
  • ViTのアーキテクチャとインダクティブバイアスに特化した、より効果的な敵対的訓練手法を設計すること。
  • ドロップアウトと確率的深さといった正則化技術が、ViT向けの敵対的訓練に与える影響を調査すること。
  • 標準的な事前学習とPyramidATのみを用いて、ImageNet-C、ImageNet-R、ImageNet-SketchにおけるViT-B/16の新たなSOTAを確立すること。

提案手法

  • 複数の空間スケールで摂動を生成する敵対的訓練(PyramidAT)を提案。大規模な編集を構造的に、微細な編集を柔軟に再現することで、データ拡張を模倣する。
  • 大規模で一貫性のある摂動を画像領域に適用し、同時に微細なピクセル単位の編集を許容することで、ロバストネスを向上させるマルチスケールピラミッドアタックを用いる。
  • 訓練の安定化を図るため、ミニバッチ内のクリーンサンプルと敵対的サンプルの両方に同じドロップアウトマスクを適用する「マッチドドロップアウト」を導入。
  • 同じ設定で確率的深さを適用し、訓練中に層をランダムにドロップすることで、一般化性能とロバストネスを向上させる。
  • クリーンなフォワードパスと敵対的フォワードパスの両方で同じ最適化ハイパーパrameter(例:学習率、重み減衰)を適用し、訓練の一貫性を維持する。
  • ViT-B/16にアーキテクチャの変更を加えずに、標準的なImageNet-1Kおよび、オプションでImageNet-21Kのデータを用いてモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練は、通常の精度-ロバストネストレードオフを打破し、視覚変換器におけるクリーン精度とロバストネスの両方を向上させることができるか?
  • RQ2標準的なピクセル単位の敵対的アタックと比較して、マルチスケールで構造化された敵対的摂動は、ViTの一般化性能をどのように向上させるか?
  • RQ3マッチドドロップアウトと確率的深さの組み合わせは、ViTモデルにおける敵対的訓練性能にどのような影響を与えるか?
  • RQ4PyramidATは、ViT-B/16を越えて、異なるデータセットやモデルアーキテクチャにも一般化可能か?
  • RQ5追加データを一切使用せずに、PyramidATは分布外ベンチマークでSOTA性能を達成できるか?

主な発見

  • PyramidATは、ImageNet-1Kデータでのみ学習したViT-B/16に対して、ImageNetクリーン精度を1.82%絶対値向上させた。
  • 追加データなしで、ImageNet-Cでは41.42 mCEを達成し、従来手法を上回る新たなSOTAを樹立した。
  • ImageNet-Rでは53.92%、ImageNet-Sketchでは41.04%の精度を達成し、両方ともViT-B/16の新たなSOTAとなった。
  • 7つのImageNetロバストネスベンチマークにおけるロバストネス向上幅は、1.76%から15.68%の絶対値向上を記録した。
  • AdaBelief最適化手法の導入により、ImageNet-RでのPixelAT性能が最大1.72%向上したが、PyramidATではその恩恵は顕著ではなかった。
  • アブレーションスタディの結果、マッチドドロップアウトと確率的深さは、PyramidATにおける性能向上の鍵となる重要な要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。