[論文レビュー] Vision Transformer: Vit and its Derivatives
この論文は、Vision Transformer (ViT) 及びその主要な派生モデルである PVT、Swin Transformer、MLP-Mixer、XCiT、MViT、TimesFormer、SegFormer、UNETR をレビューし、自己注意機構とアーキテクチャの革新が、画像分類、物体検出、セマンティックセグメンテーション、動画認識、医療画像処理の分野で最先端のパフォーマンスを達成できることを示している。主な貢献は、ViTベースのモデルがスケーリング、大規模事前学習、局所的注意、効率的注意、MLPベースの混合といったアーキテクチャの変更を経て、特に優れた正確性と一般化性能を達成できることを示したことにある。
Transformer, an attention-based encoder-decoder architecture, has not only revolutionized the field of natural language processing (NLP), but has also done some pioneering work in the field of computer vision (CV). Compared to convolutional neural networks (CNNs), the Vision Transformer (ViT) relies on excellent modeling capabilities to achieve very good performance on several benchmarks such as ImageNet, COCO, and ADE20k. ViT is inspired by the self-attention mechanism in natural language processing, where word embeddings are replaced with patch embeddings. This paper reviews the derivatives of ViT and the cross-applications of ViT with other fields.
研究の動機と目的
- Vision Transformer (ViT) 及びその派生モデルの進化とアーキテクチャ的革新を、コンピュータビジョンタスク全体にわたって調査すること。
- 自己注意機構の変更が、密度予測および高解像度タスクにおける効率性とパフォーマンスをどのように向上させるかを分析すること。
- モデルサイズと事前学習データのスケーリングが、少サンプル一般化と正確性に与える影響を評価すること。
- 動画認識、セマンティックセグメンテーション、3D 医療画像セグメンテーションを含む、分野横断的応用を探索すること。
- 局所的注意、MLPベースの混合、位置エンコーディングの削除といった、ViTのパフォーマンスを向上させるアーキテクチャ的原則を特定すること
提案手法
- 空間的縮小注意(SRA)を導入したピラミッドビジョントランスフォーマー(PVT)を提案。キーや値のダウンサンプリングにより、二次的複雑度を低減し、階層的特徴抽出を可能にする。
- 重複パッチエンコーディング、ディープワイド畳み込み型フィードフォワードネットワーク、線形複雑度の自己注意機構を備えた PVT-v2 を導入。これにより、局所的インダクティブバイアスが向上し、さまざまな画像解像度に対応可能になる。
- シフトされたウィンドウパーティショニングを用いたスウィントランスフォーマーを提案。線形複雑度 O(M×N) を実現し、局所的自己注意と階層的表現学習、グローバルコンテキストモデリングを可能にする。
- ViTにスケーリング法則を適用。30億枚の画像で20億パラメータのモデルを学習させ、ImageNet でのトップ1精度が84.86%に向上し、少ないデータからの一般化性能が向上することを示した。
- MLP-Mixerでは、自己注意を2段階のMLPに置き換え:1つはパッチ間のチャネル混合、もう1つは空間的位置間のトークン混合。
- XCiTでは、クロスコバリアンス注意(XCA)を導入。深度方向およびポイントワイド畳み込みを用いて、トークンとチャネルの混合を分離し、パrameter数を削減した非局所的効率的注意を実現。
実験結果
リサーチクエスチョン
- RQ1ViTにおける自己注意機構は、どのように高解像度および密度予測タスク向けに効率化できるか?
- RQ2どのようなアーキテクチャ的変更が、物体検出およびセマンティックセグメンテーションにおいてCNNと同等のパフォーマンスを達成可能にするか?
- RQ3モデルサイズと事前学習データのスケーリングが、ViTベースのモデルにおける少サンプル一般化にどの程度寄与するか?
- RQ4自己注意を、パフォーマンスを損なわずにMLPベースまたは畳み込みベースの混合機構に効果的に置き換えられるか?
- RQ5位置エンコーディング、プーリング、正規化といったアーキテクチャ的選択が、さまざまな入力解像度におけるViTのロバストネスにどのように影響するか?
主な発見
- スウィントランスフォーマーは、シフトされたウィンドウパーティショニングを用いることで、線形複雑度 O(M×N) を達成し、効率的な局所的自己注意と階層的特徴抽出を可能にした。
- PVT-v2 は重複パッチとディープワイド畳み込みにより局所的インダクティブバイアスを向上させ、セマンティックセグメンテーションおよび物体検出タスクでより優れたパフォーマンスを達成した。
- 20億パラメータのViTを30億枚の画像で学習させた結果、ImageNet でのトップ1精度が90.45%、少サンプル精度が84.86%に達し、限られたデータからの強力な一般化性能を示した。
- ヘッド層とボディ層の重み減衰を分離することで、少サンプル性能が向上した。特にヘッド層に対して強い減衰を適用すると、分類境界の分離が良くなった。
- MLP-Mixer と XCiT は、自己注意を2段階のMLPまたは畳み込みベースの混合に置き換えることで、計算コストを削減しながらも、競争力のあるパフォーマンスを達成した。
- SegFormer は、位置エンコーディングを含まない階層的エンコーダーと単純なMLPデコーダーを採用し、解像度変更に強く、セマンティックセグメンテーションで最先端の結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。