Skip to main content
QUICK REVIEW

[論文レビュー] When Adversarial Training Meets Vision Transformers: Recipes from Training to Architecture

Yichuan Mo, Dongxian Wu|arXiv (Cornell University)|Oct 14, 2022
Adversarial Robustness in Machine Learning被引用数 14
ひとこと要約

本論文は、ビジョントランスフォーマー(ViTs)における adversarial training の包括的な研究を提示し、頑健性の向上に不可欠な要因として事前学習とSGDを特定している。本研究では、注意機構のブロックにおける勾配のランダムマスキング、またはトレーニング中のパッチへの摂動のランダムマスキングによって、 adversarial robustness を顕著に向上させる2つの新しいアーキテクチャに配慮した手法—Attention Random Dropping(ARD)とPerturbation Random Masking(PRM)—を提案している。これらの手法は、CIFAR-10およびImageNet-1Kベンチマークで最先端の性能を達成している。

ABSTRACT

Vision Transformers (ViTs) have recently achieved competitive performance in broad vision tasks. Unfortunately, on popular threat models, naturally trained ViTs are shown to provide no more adversarial robustness than convolutional neural networks (CNNs). Adversarial training is still required for ViTs to defend against such adversarial attacks. In this paper, we provide the first and comprehensive study on the adversarial training recipe of ViTs via extensive evaluation of various training techniques across benchmark datasets. We find that pre-training and SGD optimizer are necessary for ViTs' adversarial training. Further considering ViT as a new type of model architecture, we investigate its adversarial robustness from the perspective of its unique architectural components. We find, when randomly masking gradients from some attention blocks or masking perturbations on some patches during adversarial training, the adversarial robustness of ViTs can be remarkably improved, which may potentially open up a line of work to explore the architectural information inside the newly designed models like ViTs. Our code is available at https://github.com/mo666666/When-Adversarial-Training-Meets-Vision-Transformers.

研究の動機と目的

  • Adversarial training の下で、ビジョントランスフォーマー(ViTs)における adversarial robustness を向上させるために不可欠なトレーニング技術を同定すること。
  • ViTが有する独自のアーキテクチャ的要素—特に自己注意機構—が、標準的なトレーニングレシピを上回る頑健性向上にどのように寄与するかを調査すること。
  • Adversarially trained ViTsのための実用的で経験的に検証されたベンチマーク(「テクニックの袋」)を提供すること。
  • 勾配と摂動のマスキングに基づく、新しいアーキテクチャに配慮した防御メカニズム—ARDとPRM—を提案し、その有効性を評価すること。

提案手法

  • CIFAR-10およびImageNet-1Kの両ベンチマークで、さまざまなトレーニング技術(最適化手法、事前学習、データ拡張、損失関数)をViTsに適用し、adversarial training の下で経験的に評価する。
  • バックプロパゲーション中に特定の注意ブロックからの勾配をランダムにマスキングすることで、特徴学習を正則化するAttention Random Dropping(ARD)を提案する。
  • Adversarial example生成の過程で、特定の画像パッチへの摂動をランダムにマスキングすることで、頑健性を向上させるPerturbation Random Masking(PRM)を導入する。
  • ARDとPRMを、初期トレーニングエポクにおけるウォームアップ戦略として適用し、両手法に共通のハイパーパrameter $ n_w $ を使用する。
  • ARDとPRMを、TRADES や MART といった既存の防御手法と組み合わせ、汎用性と有効性を評価する。
  • ハイパーパrameter $ n_w $ に関するアブレーションスタディを実施し、ARDとPRMそれぞれの個別最適化を含め、パフォーマンス最適化を図る。

実験結果

リサーチクエスチョン

  • RQ1最適化手法の選択、事前学習、データ拡張といったトレーニング技術の中で、ViTsにおける adversarial robustness の向上に最も寄与するのはどれか?
  • RQ2ViTのアーキテクチャ的設計、特に自己注意機構は、CNNと比較して adversarial robustness にどのように影響を与えるか?
  • RQ3ViTに内在するアーキテクチャ的インダクティブバイアスは、標準的な adversarial training を超えて、頑健性向上に利用可能か?
  • RQ4ウォームアップエポック数と標準的な防御手法との相互作用を考慮した場合、ARDとPRMの最適な設定は何か?
  • RQ5ARDとPRMの組み合わせは、さまざまなViTバリアントおよびデータセットにおいて一貫して頑健性を向上させるか?

主な発見

  • 事前学習とSGD最適化手法の使用は、ViTsにおける高い adversarial robustness を達成する上で不可欠であり、AdamWは adversarial training 環境下で性能を発揮しない。
  • ARDとPRMを用いた adversarial training は、CIFAR-10におけるDeiT-TiのPGD-100攻撃で最大1.63%の頑健性向上を達成し、複数のモデルで一貫した向上効果を示している。
  • ARDとPRMをTRADES や MART と組み合わせることで、最先端のパフォーマンスが達成され、DeiT-TiにおけるAA頑健性はそれぞれ0.77%および1.63%向上した。
  • ARDは長いウォームアップ期間($ n_w $)と正の相関を示すが、PRMは最適な$ n_w $を超えると収益が減少する傾向にあり、それぞれ異なる感度プロファイルを示している。
  • 提案手法はハイパーパrameterのチューニングに対して頑健であり、$ n_w \in \{10,15,20\} $ の範囲でパフォーマンス向上が安定しており、容易な導入が可能である。
  • ARDとPRMは、DeiT-Ti、ConViT-Ti、Swin-Tiを含む多様なViTアーキテクチャで有効であることが確認され、一般化能が裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。