[論文レビュー] CycleMLP: A MLP-like Architecture for Dense Prediction
CycleMLP は Cycle Fully-Connected Layers (Cycle FC) を導入し、階層的な MLP 風のバックボーンを画像サイズに対してリニアな複雑性で作成し、効果的な密な予測を可能にし、検出、分割、分類タスクにおいて CNN や Transformers と競争力のある性能を発揮します。
This paper presents a simple MLP-like architecture, CycleMLP, which is a versatile backbone for visual recognition and dense predictions. As compared to modern MLP architectures, e.g., MLP-Mixer, ResMLP, and gMLP, whose architectures are correlated to image size and thus are infeasible in object detection and segmentation, CycleMLP has two advantages compared to modern approaches. (1) It can cope with various image sizes. (2) It achieves linear computational complexity to image size by using local windows. In contrast, previous MLPs have $O(N^2)$ computations due to fully spatial connections. We build a family of models which surpass existing MLPs and even state-of-the-art Transformer-based models, e.g., Swin Transformer, while using fewer parameters and FLOPs. We expand the MLP-like models' applicability, making them a versatile backbone for dense prediction tasks. CycleMLP achieves competitive results on object detection, instance segmentation, and semantic segmentation. In particular, CycleMLP-Tiny outperforms Swin-Tiny by 1.3% mIoU on ADE20K dataset with fewer FLOPs. Moreover, CycleMLP also shows excellent zero-shot robustness on ImageNet-C dataset. Code is available at https://github.com/ShoufaChen/CycleMLP.
研究の動機と目的
- 変動する入力スケールに対応する密な予測タスク(検出、分割)のために、MLP風のバックボーンを動機づけ、実現する。
- 従来のMLPモデルの限界—非階層的ブロック、固定入力スケール、2次コスト—を解決する。
- 入力スケールの柔軟性とリニアな複雑性を維持しつつ受容野を拡大する Cycle FC を提案する。
- 認識と密な予測のための階層的アーキテクチャを持つ CycleMLP モデルのファミリーを構築する。
- 標準ベンチマークで CNNs、Transformers、最先端のMLPと対等な性能を示す。
提案手法
- Cycle Fully-Connected Layer (Cycle FC) を導入し、チャネル次元に沿ってサンプリングして受容野を作成し、オフセット delta_i(c)、delta_j(c)、ステップサイズ SH、SW を持つ。
- Cycle FC は画像サイズとともにパラメータと FLOP の複雑性が線形で、任意の入力解像度を可能にする。
- 3つの並列 Cycle FC ブランチ(1x7、7x1、1x1)とチャンネル MLP を組み合わせ、LayerNorm と残差接続を備えた CycleMLP ブロックを構築する。
- 密な予測タスクをサポートするため、段階的なトークン削減とチャネル拡張を伴う4段階の階層バックボーンを構築する。
- ストライド、チャネル次元、深さ、拡張比率を調整することで、2つのモデル・ゾウを作成する(PVT風 CycleMLP-B1..B5 および Swin風 CycleMLP-T/S/B)。
- 解像度適応性を実証し、Cycle FC を Channel FC および MHSA と比較して、疎性と受容野の利点を強調する。
実験結果
リサーチクエスチョン
- RQ1Cycle FC は自己注意なしで、密な予測タスク向けのスケーラブルで入力スケールに依存しない演算子を提供できるのか?
- RQ2Cycle FC ブロックを備えた階層的 CycleMLP バックボーンは、既存のMLP風モデルを上回り、検出、分割、分類で CNN/Transformer バックボーンと競えるのか?
- RQ3密な予測ワークロードに典型的な、さまざまな入力解像度とマルチスケール訓練戦略のもとで CycleMLP はどのように性能を発揮するのか?
主な発見
- CycleMLP-B2 は ImageNet-1K で 81.6% の top-1 精度を、27M パラメータと 3.9G FLOPs で達成し、いくつかの MLP風モデルを上回る。
- CycleMLP-B3/B4/B5 変種は、追加データなしで ImageNet-1K において Transformer バックボーンと対等かそれを上回る結果を、FLOPs とパラメータ数の点でも好ましい。
- CycleMLP ベースのバックボーンは COCO における ResNet や PVT ベースラインと比較して、同等予算下で物体検出とインスタンス分割の指標を改善。
- ADE20K のセマンティック分割では、CycleMLP-B2 と CycleMLP-B3 は ResNet/PVT ベースラインより高い mIoU を示し、設定によっては Swin を近づけるか凌ぐ。可視化によると Swin よりも効果的な受容野が大きい。
- ImageNet-C のさまざまな破損タイプに対して堅牢性が高く、平均破損誤差で複数の Transformer および他の MLP ベースモデルを上回る。
- アブレーション研究は、最良の性能には三つの並列 Cycle FC ブランチの必要性を確認し、Cycle FC は複数のタスクで Channel FC および Spatial FC を上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。