[論文レビュー] Rethinking the Design Principles of Robust Vision Transformer
本論文では、耐性の観点からアーキテクチャ部品を再考することで、より高い耐性と一般化性能を実現するための新しいビジョントランスフォーマー・アーキテクチャ、Robust Vision Transformer (RVT) を提案する。耐性設計の要素を統合し、位置に依存するアテンション再スケーリングやパッチ単位の増幅といったプラグアンドプレイ技術を導入することで、ImageNet および複数の耐性ベンチマークで最先端の性能を達成し、ImageNet-C および ImageNet-Sketch ランキングにおけるトップ-1精度を達成した。
Recent advances on Vision Transformers (ViT) have shown that self-attention-based networks, which take advantage of long-range dependencies modeling ability, surpassed traditional convolution neural networks (CNNs) in most vision tasks. To further expand the applicability for computer vision, many improved variants are proposed to re-design the Transformer architecture by considering the superiority of CNNs, i.e., locality, translation invariance, for better performance. However, these methods only consider the standard accuracy or computation cost of the model. In this paper, we rethink the design principles of ViTs based on the robustness. We found some design components greatly harm the robustness and generalization ability of ViTs while some others are beneficial. By combining the robust design components, we propose Robust Vision Transformer (RVT). RVT is a new vision transformer, which has superior performance and strong robustness. We further propose two new plug-and-play techniques called position-aware attention rescaling and patch-wise augmentation to train our RVT. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous Transformers and state-of-the-art CNNs. Our RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at https://github.com/vtddggg/Robust-Vision-Transformer.
研究の動機と目的
- 標準的な精度や計算コストを超えて、既存のビジョントランスフォーマーモデルの部品がモデルの耐性や一般化性能に与える影響を調査すること。
- ビジョントランスフォーマーにおける耐性を損なうか、向上させるアーキテクチャ部品を特定すること。
- 耐性を最適化しつつ高い性能を維持する新しいビジョントランスフォーマー・アーキテクチャ、RVT を設計すること。
- アーキテクチャの変更なしに耐性を向上させるためのプラグアンドプレイなトレーニング技術を開発すること。
- ImageNet-C や ImageNet-Sketch を含む、標準的および耐性ベンチマークにおいて RVT の優位性を検証すること。
提案手法
- 各部品が分布シフト下での耐性に与える影響を評価することで、ビジョントランスフォーマーの設計原則を再考し、性能を低下させるか向上させる要因を同定する。
- 耐性に優れた部品のみを組み合わせることで、一般化性能と耐性を向上させる「ロバストビジョントランスフォーマー(RVT)」を提案する。
- 位置に依存するアテンション再スケーリングを導入し、空間的位置に応じてアテンションマップのスケーリングを適応的に変更することで、安定性を向上させる。
- パッチ単位の増幅を開発し、トレーニング中に各パッチごとにランダムな増幅を適用することで耐性を向上させるデータ増幅戦略を実現する。
- 標準的な ImageNet および耐性ベンチマークを用いて RVT をトレーニングし、提案手法を活用して分布シフト下での一般化性能を向上させる。
- アブレーションスタディを用いて、各部品および技術が耐性と精度に与える寄与度を検証する。
実験結果
リサーチクエスチョン
- RQ1分布シフト下で、どのビジョントランスフォーマー部品が耐性を低下させたり、向上させたりするか?
- RQ2性能を犠牲にすることなく、耐性を最優先に据えてビジョントランスフォーマーを再設計することは可能か?
- RQ3位置に依存するアテンション再スケーリングとパッチ単位の増幅は、トレーニング中にモデルの耐性をどのように向上させるか?
- RQ4RVT は、既存の ViT や最先端の CNN に対して、耐性ベンチマークでどの程度優れているか?
- RQ5RVT は ImageNet-C や ImageNet-Sketch のような耐性リーダーボードでトップクラスの性能を達成できるか?
主な発見
- RVT は ImageNet-C や ImageNet-Sketch を含む複数の耐性リーダーボードでトップ-1精度を達成し、最先端の耐性性能を示した。
- 提案された位置に依存するアテンション再スケーリングおよびパッチ単位の増幅技術は、アーキテクチャの変更なしに耐性を顕著に向上させた。
- 従来、有益とされていた一部の ViT 部品が耐性を損なうことが判明し、設計原則の再評価の必要性が浮き彫りになった。
- RVT は 6 つの耐性ベンチマークにおいて、標準的なビジョントランスフォーマーや最先端の CNN を上回り、優れた一般化能力を確認した。
- アブレーションスタディにより、耐性に優れた部品のみを組み合わせることで、分布シフト下での性能向上が顕著に得られることを確認し、設計哲学の妥当性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。