[論文レビュー] Towards Robust Vision Transformer
この論文は、標準的なビジョントランスフォーマーにおける有害なコンponentsを特定し、2つのプラグアンドプレイ技術である位置に依存するアテンションスケーリング(PAAS)およびパッチ単位の増強を導入することで、 adversarial examples、distribution shifts、画像の汚損に対してモデルのロバスト性を向上させる、ロバストビジョントランスフォーマー(RVT)およびその拡張版RVT∗を提案する。RVT∗は、ImageNet-C、ImageNet-Sketch、ImageNet-Rを含む複数のロバストネスベンチマークで最先端の性能を達成し、ImageNetにおけるトップ-1精度も記録した。
Recent advances on Vision Transformer (ViT) and its improved variants have shown that self-attention-based networks surpass traditional Convolutional Neural Networks (CNNs) in most vision tasks. However, existing ViTs focus on the standard accuracy and computation cost, lacking the investigation of the intrinsic influence on model robustness and generalization. In this work, we conduct systematic evaluation on components of ViTs in terms of their impact on robustness to adversarial examples, common corruptions and distribution shifts. We find some components can be harmful to robustness. By using and combining robust components as building blocks of ViTs, we propose Robust Vision Transformer (RVT), which is a new vision transformer and has superior performance with strong robustness. We further propose two new plug-and-play techniques called position-aware attention scaling and patch-wise augmentation to augment our RVT, which we abbreviate as RVT*. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous ViTs and state-of-the-art CNNs. Furthermore, RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at \url{https://github.com/alibaba/easyrobust}.
研究の動機と目的
- ビジョントランスフォーマー(ViTs)の主要なコンponentsが、adversarial examples、一般的な汚損、distribution shifts に対するモデルのロバストネスに与える影響を体系的に評価すること。
- 標準的な精度を向上させる一方でロバストネスを低下させる、既存のViTアーキテクチャ内のコンponentsを同定すること。
- ロバストなコンponentsのみを用いて再設計した新しいビジョントランスフォーマー・アーキテクチャ、RVTを設計し、汎化性能およびロバストネスを向上させること。
- ロバストネスおよび精度をさらに向上させるために、2つのプラグアンドプレイ技術である位置に依存するアテンションスケーリング(PAAS)およびパッチ単位の増強を開発すること。
- RVTおよびRVT∗をImageNetおよび6つのロバストネスベンチマークで検証し、標準精度とロバストネスの間の優れたトレードオフを示すこと。
提案手法
- パッチエンコーディング、位置エンコーディング、トランスフォーマーブロック、分類ヘッドの各コンponentsを、標準的なViTにおける有害なコンponentsに代えて、ロバストな代替品を用いることで、ロバストビジョントランスフォーマー(RVT)を提案する。
- 位置に依存するアテンションスケーリング(PAAS)を導入し、位置に依存する相関強度に基づいてアテンションマップをスケーリングすることで、自己注意機構におけるノイズの多い位置相関をフィルタリングする。
- パッチシーケンスに直接データ増強(例:ランダムクロップ、ノイズ、フリップ)を適用するパッチ単位の増強技術を開発し、トレーニングの多様性を高め、過学習を低減する。
- PAASを複数のトランスフォーマーブロックに適用し、アブレーション実験により5〜10のブロックに適用した際に最良の性能向上が得られ、さらなる適用では利得が飽和することを確認した。
- PAASとパッチ単位の増強を組み合わせ、任意のViTバックボーンに適用可能なプラグアンドプレイな拡張形態であるRVT∗を構築した。
- DeiT-Ti、ConViT-Ti、PiT-Tiなどの異なるViTバリアントを対象に、ImageNetで標準的なトレーニングプロトコルを用い、アブレーションスタディにより各コンponentsの貢献度を検証した。
実験結果
リサーチクエスチョン
- RQ1標準的な精度を向上させる一方でロバストネスに悪影響を及げるビジョントランスフォーマー内のコンponentsは何か?
- RQ2位置エンコーディングおよびアテンションメカニズムの選択が、adversarial examplesおよびdistribution shifts に対するロバストネスに与える影響はいかほどか?
- RQ3ロバストなコンponentsのみを用いてビジョントランスフォーマーを体系的に再設計することで、精度を損なわずより優れたロバストネスを達成できるか?
- RQ4PAASやパッチ単位の増強といったプラグアンドプレイ技術が、異なるViTアーキテクチャにおいて標準精度およびロバスト精度をどの程度向上させられるか?
- RQ5提案されたRVTは、ImageNet-C、ImageNet-Sketch、ImageNet-Rを含む複数のロバストネスベンチマークにおいて、最先端のCNNおよびViTと比較してどのように評価されるか?
主な発見
- RVT-S∗はImageNet-Sketchでトップ-1精度46.9%、ImageNet-Rで35.0%を達成し、両ベンチマークで新たな最先端の結果を樹立した。
- ImageNet-Cでは、RVT-S∗がトップ-1のロバスト精度を記録し、以前の最先端モデルを上回った。
- PAASとパッチ単位の増強の組み合わせにより、複数のViTアーキテクチャにおいて平均で標準精度が1%以上、ロバスト精度が5%以上向上した。
- PAASを5〜10のトランスフォーマーブロックに適用すると、最良の性能向上が得られ、さらに適用を増やしても利得の増加は限界に達した。
- ランダムガウスノイズを用いたパッチ単位の増強が、検証済みの増強法の中で最も顕著なロバストネス向上効果を示した。
- RVTおよびRVT∗は、ViTおよび最先端のCNNと比較して、FLOPs、標準精度、ロバストネスの間の優れたトレードオフを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。