Skip to main content
QUICK REVIEW

[論文レビュー] Mixing and Shifting: Exploiting Global and Local Dependencies in Vision MLPs

Huangjie Zheng, Pengcheng He|arXiv (Cornell University)|Feb 14, 2022
Neural Networks and Applications被引用数 6
ひとこと要約

本論文では、空間シフトを用いて受容 field のサイズを動的に拡大することで、局所的およびグローバルな依存関係を同時にモデル化するビジョン MLP アーキテクチャである Mix-Shift-MLP (MS-MLP) を提案する。これにより、細粒度および粗粒度の領域間で効率的なトークンミキシングが可能となる。MS-MLP はパラメータ数 85M、ImageNet-1K におけるトップ-1精度 83.8% を達成し、物体検出およびセグメンテーションタスクにおいて Swin および Focal Transformer よりも 0.5–0.7% の向上を達成する。

ABSTRACT

Token-mixing multi-layer perceptron (MLP) models have shown competitive performance in computer vision tasks with a simple architecture and relatively small computational cost. Their success in maintaining computation efficiency is mainly attributed to avoiding the use of self-attention that is often computationally heavy, yet this is at the expense of not being able to mix tokens both globally and locally. In this paper, to exploit both global and local dependencies without self-attention, we present Mix-Shift-MLP (MS-MLP) which makes the size of the local receptive field used for mixing increase with respect to the amount of spatial shifting. In addition to conventional mixing and shifting techniques, MS-MLP mixes both neighboring and distant tokens from fine- to coarse-grained levels and then gathers them via a shifting operation. This directly contributes to the interactions between global and local tokens. Being simple to implement, MS-MLP achieves competitive performance in multiple vision benchmarks. For example, an MS-MLP with 85 million parameters achieves 83.8% top-1 classification accuracy on ImageNet-1K. Moreover, by combining MS-MLP with state-of-the-art Vision Transformers such as the Swin Transformer, we show MS-MLP achieves further improvements on three different model scales, e.g., by 0.5% on ImageNet-1K classification with Swin-B. The code is available at: https://github.com/JegZheng/MS-MLP.

研究の動機と目的

  • 自己注意を用いない既存の MLP ベースモデルが、同時に局所的およびグローバルな視覚的依存関係を捉えることの制限を解消すること。
  • ビジョン MLP における柔軟でマルチスケールのトークンミキシングを可能にする、単純かつ効果的なメカニズムを設計すること。
  • ImageNet-1K、COCO、ADE20K などのビジョンベンチマークで高い性能を発揮するとともに、計算コストを低く抑えること。
  • MS-MLP が、最先端のビジョン Transformer のバックボーンまたはモジュールとして、さらなる性能向上を実現できることを示すこと。

提案手法

  • MS-MLP は、クエリトークンからの相対的な空間的距離に応じて、トークンミキシングのための受容 field サイズを増大させるマルチスケール領域ミキシング機構を導入する。
  • 空間シフトを適用することで、近隣および遠方の領域からの情報を集約し、局所的およびグローバルな特徴間の相互作用を可能にする。
  • 特徴マップを再編成することで、異なるスケール間でのクロス領域通信を可能にする学習可能なシフト操作を採用する。
  • 標準的な MLP ブロックに領域ミキシングを統合することで、シンプルさと計算効率を維持する。
  • 複数の段階を備えた階層的設計を採用し、各段階でシフトと領域ミキシングを適用することで、さまざまな粒度の依存関係を段階的に捉える。
  • 標準的なビジョンベンチマーク上で標準的な最適化プロトコルを用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1自己注意を排除した MLP アーキテクチャが、同時に局所的およびグローバルな視覚的依存関係を効果的にモデル化できるか?
  • RQ2空間的距離に基づいて受容 field サイズを動的に調整することで、ビジョンタスクの性能にどのような影響を与えるか?
  • RQ3シフトを用いた領域ミキシングは、純粋に局所的またはグローバルなミキシングを上回る性能を発揮できるか?
  • RQ4MS-MLP をバックボーンまたはモジュールとして用いることで、既存のビジョン Transformer の性能をどの程度向上できるか?
  • RQ5大規模ビジョンベンチマークにおいて、競争力のある精度を達成しながらも、高いスループットを維持できるか?

主な発見

  • パラメータ数 8500 万の MS-MLP は、ImageNet-1K でトップ-1精度 83.8% を達成し、より高いスループットを示す Focal-Attention-B と同等の性能を発揮する。
  • RetinaNet 物体検出タスクにおいて、Hire-MLP-L や WaveMLP-B よりもそれぞれ 0.6%、1.5% の高い精度を達成する。
  • Swin Transformer と組み合わせた場合、複数のスケールで分類精度が 0.5–0.7% 向上し、物体検出精度が 0.2–0.5% 向上する。
  • アブレーションスタディの結果、受容 field サイズを増大させる領域ミキシングが、孤立した局所的またはグローバルなミキシングを上回ることが確認され、特に小さなパッチサイズで顕著である。
  • パッチサイズが 2 および 4 の Swin-T において、それぞれ 0.5% および 0.3% の向上を示し、MS-MLP を組み合わせることで高い性能を維持する。
  • MS-MLP は、インスタンスセグメンテーションおよびセマンティックセグメンテーションタスクにおいて、Swin および Focal Transformer の両方を一貫して向上させ、COCO で 0.1–0.3%、ADE20K で 0.2–0.5% の向上を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。