Skip to main content
QUICK REVIEW

[論文レビュー] Hire-MLP: Vision MLP via Hierarchical Rearrangement

Jianyuan Guo, Yehui Tang|arXiv (Cornell University)|Aug 30, 2021
Advanced Image and Video Retrieval Techniques参考文献 59被引用数 6
ひとこと要約

Hire-MLPは、階層的な入れ替えを用いるビジョンMLPアーキテクチャを提案し、局所的およびグローバルな空間的情報を捉えることを可能にし、柔軟な入力解像度と優れた性能を実現する。内部領域およびクロス領域のトークン入れ替えをチャネル混合MLPと組み合わせることで、ImageNet(トップ1正答率83.8%)、COCO(ボックスAP 51.7%)、ADE20K(mIoU 49.9%)で最先端の結果を達成し、従来のMLPおよびトランスフォーマー・モデルを上回る性能を発揮するが、精度とスループットのトレードオフが良好である。

ABSTRACT

Previous vision MLPs such as MLP-Mixer and ResMLP accept linearly flattened image patches as input, making them inflexible for different input sizes and hard to capture spatial information. Such approach withholds MLPs from getting comparable performance with their transformer-based counterparts and prevents them from becoming a general backbone for computer vision. This paper presents Hire-MLP, a simple yet competitive vision MLP architecture via extbf{Hi}erarchical extbf{re}arrangement, which contains two levels of rearrangements. Specifically, the inner-region rearrangement is proposed to capture local information inside a spatial region, and the cross-region rearrangement is proposed to enable information communication between different regions and capture global context by circularly shifting all tokens along spatial directions. Extensive experiments demonstrate the effectiveness of Hire-MLP as a versatile backbone for various vision tasks. In particular, Hire-MLP achieves competitive results on image classification, object detection and semantic segmentation tasks, e.g., 83.8% top-1 accuracy on ImageNet, 51.7% box AP and 44.8% mask AP on COCO val2017, and 49.9% mIoU on ADE20K, surpassing previous transformer-based and MLP-based models with better trade-off for accuracy and throughput. Code is available at https://github.com/ggjy/Hire-Wave-MLP.pytorch.

研究の動機と目的

  • MLP-Mixerのような既存のビジョンMLPが線形にフラット化されたパッチに起因する入力解像度の変動に対する柔軟性の欠如に対処すること。
  • 自己注意機構に依存せずに、ビジョンMLPが局所的なインダクティブバイアスとグローバルなコンテキストを効果的に捉えられるようにすること。
  • 分類、検出、セグメンテーションなどの多様なコンピュータビジョンタスクに適した汎用的で効率的かつ高精度なバックボーンを設計すること。

提案手法

  • 2段階の階層的入れ替え機構を導入:局所的な特徴混合のための内部領域入れ替えと、円形シフトを用いた領域間通信のためのクロス領域入れ替え。
  • 入れ替えの後、チャネル間の特徴相互作用をモデル化するため、復元層を介して空間構造を保持するチャネル混合MLPを適用。
  • Hire-MLPブロックではマルチブランチアーキテクチャを採用:高さ方向および幅方向処理用の2ブランチ(入れ替え・復元を含む)と、直接的なチャネル混合用の1ブランチ。
  • 精度とFLOPsのバランスを取るために、チャネル混合ヘッドに2層の全結合層を採用するボトルネック設計を採用。
  • 領域ベースの入れ替えにより空間処理とトークン列長を分離することで、柔軟な入力解像度を実現。
  • 畳み込みニューラルネットワークやSwinトランスフォーマーと同様のピラミッド特徴階層を活用し、マルチスケールの下流タスクをサポート。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構に依存せずに、ビジョンMLPアーキテクチャが局所的およびグローバルな空間的依存関係を効果的に捉えられるか?
  • RQ2性能を維持したまま、入力解像度の変動に強いビジョンMLPをどのように設計できるか?
  • RQ3標準的なMLP-Mixerやサイクル全結合演算と比較して、トークンの階層的入れ替えが特徴表現を向上させるか?
  • RQ4完全にMLPベースのモデルが、多様なビジョンベンチマークで最先端のトランスフォーマーと同等の性能を達成できるか?
  • RQ5精度、FLOPs、推論速度のバランスを最適化するための、入れ替えおよびチャネル混合部の最適設計は何か?

主な発見

  • ImageNet-1Kでは83.8%のトップ1正答率を達成し、従来のMLPおよびトランスフォーマー基盤モデルを上回り、精度とスループットのトレードオフが優れている。
  • COCO val2017では、Hire-MLPを搭載したRetinaNetがボックスAP 51.7%、マスクAP 44.8%を達成し、同程度のFLOPs下でResNet、PVT、CycleMLPを上回った。
  • ADE20Kにおけるセマンティックセグメンテーションでは、マルチスケールテスト下で49.9%のmIoUを達成し、Swin-Tを1.6 mIoU上回り、PVTおよびCycleMLPをも上回った。
  • シフト付きクロス領域通信戦略は、ShuffleNet風のシャッフルよりも相対的位置情報の保持が優れており、結果としてより高い性能を発揮した。
  • チャネル混合ヘッドに2層のボトルネックを採用した場合が、精度と計算コストのトレードオフにおいて最良のバランスを実現し、2層を超えると利得が減少する傾向を示した。
  • アブレーションスタディにより、性能向上は単にネットワークの深さや層数の増加によるものではなく、階層的入れ替えに起因することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。